GPT-6 Astra: precios y contexto de 1M — qué permite de verdad
TL;DR
- GPT-6 Astra comparte la cima del Intelligence Index de Artificial Analysis con Claude Fable 5.1: 53 puntos para ambas configuraciones principales (captura del 10 de septiembre de 2026). Es el primer GPT que empata técnicamente con el líder desde que Anthropic encabeza el índice.
- Cuidado con las comparativas: Artificial Analysis recalibró la escala en septiembre (versión 4.2 de su metodología). La media del índice pasó de 58,0 a 45,0 entre las capturas del 3 y del 10 de septiembre. Comparar scores entre esas semanas es comparar termómetros distintos.
- Precio: $10/$50 por millón de tokens (entrada/salida) en tramo de contexto corto, y $20/$75 cuando la petición supera los 272.000 tokens de input — recargo que se aplica a toda la request (2x entrada y caché, 1,5x salida), no solo al exceso. Batch a mitad de precio; Fast mode al doble y sin disponibilidad con residencia de datos en la UE.
- El contexto de 1M es real pero caro: leer un repositorio de 700k tokens en una sola petición cuesta unos $14,30. Con caché (90% de descuento en input), las sesiones agent largas bajan de ~$44 a ~$11,60 en nuestro escenario de referencia.
La cima vuelve a estar reñida
Esta es la parte alta del índice en la captura del 10 de septiembre de 2026 (40 modelos seguidos; posiciones solo comparables dentro de esta misma captura):
| # | Modelo | Score |
|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | 53 |
| 2 | Claude Fable 5.1 (xhigh with fallback) | 53 |
| 3 | GPT-6 Astra (max) | 53 |
| 4 | GPT-6 Astra (xhigh) | 53 |
| 5 | Claude Fable 5.1 (high with fallback) | 51 |
| 6 | GPT-6 Astra (high) | 51 |
| 7 | Claude Opus 5 (max) | 51 |
La historia correcta no es “OpenAI recupera el trono”, porque nadie lo perdió: Anthropic lidera el índice de forma ininterrumpida en nuestras capturas desde el 18 de junio (primero Fable 5, después Fable 5.1). Lo que trae Astra es la primera vez en todo ese periodo que un modelo GPT empata técnicamente con el líder. Fable 5.1 y Astra comparten los 53 puntos y, de hecho, los cuatro primeros puestos.
Un matiz que este mes se va a leer mal en muchos sitios: GPT-5.6 Sol ya fue #2 en julio (captura del 20). Agosto entero fue de Anthropic en el top-2. Astra no devuelve a OpenAI a un sitio que nunca perdió del todo; lo que hace es reabrir la pelea por el #1, que llevaba casi tres meses resuelta. En la captura actual, Sol (max) aparece en el puesto 14 con 47 puntos: dentro de la misma captura, la diferencia frente a Astra es real y sí es comparable.
La escala del índice cambió: v4.2 y el arte de comparar mal
Entre las capturas del 3 y del 10 de septiembre, la media de los 40 modelos del índice pasó de 58,0 a 45,0, y el mejor score absoluto de 66 a 53. Una caída uniforme de ~13 puntos en todos los modelos no es regresión: es recalibración. La causa está documentada en la Version History de la metodología de Artificial Analysis:
- v4.2 (septiembre 2026): añade AA-Briefcase (15%) a la categoría Agents, añade GDP.pdf (10%) a General, retira GPQA Diamond del índice, actualiza AA-LCR a v1.1 y re-gradúa SciCode con el timeout de grading subido de 60s a 300s: el código correcto pero lento deja de puntuar como fallo, y ese cambio solo ya mueve la escala.
- v4.1.1 (agosto–septiembre): cambia los modelos grader de HLE, AA-LCR y AA-Omniscience a GPT-5.6 Luna (medium).
- v4.3 (vigente desde septiembre): sustituye 𝜏³-Banking por AutomationBench-AA (5%) en Agents y sube Terminal-Bench a la versión 4.0 (66 tareas, harness mini-SWE-agent). Ojo: la captura del 10 de septiembre ya es posterior a la v4.2, y las capturas que vengan ahora pueden correr ya sobre v4.3 — dos versiones consecutivas tampoco son comparables entre sí.
Cuando un índice cambia de composición, los scores dejan de ser una serie temporal: cada captura es una foto con su propia regla. “Opus 5 ha caído de 63 a 51” es falso como cambio de capacidad; lo único comparable entre capturas son las posiciones relativas y los movimientos de entrada/salida (Astra debuta en el top-4 donde la semana anterior no estaba; Opus 5 baja al #7 desplazado, no degradado). Si citamos scores, citamos la metodología y su versión. A partir de aquí, todos los números de este artículo son de la captura del 10 de septiembre.
Precio: el contexto largo se cobra aparte
La novedad relevante de esta generación no es el número, es la estructura: OpenAI distingue dos tramos por petición, contexto corto y contexto largo, y el segundo duplica la entrada. El salto de tramo ocurre en más de 272.000 tokens de input y, al cruzarlo, el recargo —2x en entrada y caché, 1,5x en salida— se aplica a toda la request, no solo a los tokens que pasan el umbral: en una petición de 300k se pagan los 300k al doble. Es la trampa de coste clásica de las ventanas enormes y afecta de lleno al caso de uso estrella de este modelo, meter un repo entero en una request. Precios oficiales del docs de pricing de OpenAI (verificados el 12 de septiembre de 2026), por millón de tokens:
| Modelo | In (corto) | Cached in (corto) | Out (corto) | In (largo) | Cached in (largo) | Out (largo) |
|---|---|---|---|---|---|---|
| gpt-6-astra | $10,00 | $1,00 | $50,00 | $20,00 | $2,00 | $75,00 |
| gpt-5.6-sol | $4,00 | $0,40 | $20,00 | $8,00 | $0,80 | $30,00 |
| gpt-5.6-terra | $2,00 | $0,20 | $12,00 | $4,00 | $0,40 | $18,00 |
| gpt-5.6-luna | $0,20 | $0,02 | $1,20 | $0,40 | $0,04 | $1,80 |
Cuatro condiciones más que conviene conocer antes de meter Astra en producción:
- Batch: $5/$25 en corto (la mitad exacta); útil para indexación o análisis no interactivo de repos.
- Fast mode: $20/$100 por millón — el doble en todo — y OpenAI lo declara explícitamente no disponible para GPT-6 Astra con residencia de datos en la UE. Literal de los docs: “Fast mode is unavailable for GPT-6 Astra with EU data residency. Use Standard processing for those requests” (verificado el 13 de septiembre de 2026), con una guía de compatibilidad específica. Detalle para quien lo tenga en código: Fast mode es el antiguo priority processing renombrado el 30 de julio de 2026 —
service_tier: "priority"yservice_tier: "fast"siguen siendo válidos y equivalentes. Si te importa la UE (y si tienes clientes europeos, debería), Fast mode no es opción para este modelo. - Escritura de caché: la primera vez que un prompt entra en caché se factura a 1,25x el input sin caché ($12,50/M en corto, $25,00/M en largo). Ignorarla subestima la primera petición de cualquier workload cacheado; en los escenarios de abajo la contamos.
- Caché de prompt (lectura): 90% de descuento sobre el input ($1,00/M en corto, $2,00/M en largo). En workloads agent, donde reenvías el mismo contexto una y otra vez, esto es la diferencia entre un experimento caro y uno sostenible.
El precio está alineado con lo que lista OpenRouter para openai/gpt-6-astra ($10/$50) y con Artificial Analysis ($10 in / $50 out para la variante max). También es caro en términos relativos: la mediana de precio de entrada entre los modelos que sigue AA está en $2,00 — Astra multiplica por cinco esa mediana — y su coste por tarea del Intelligence Index ($3,26) es de los más altos de la tabla. No es un modelo para todo; es un modelo para peticiones concretas que ningún otro puede hacer.
Qué permite de verdad el contexto de 1M
La ficha de OpenAI lista 1.050.000 tokens de contexto para Astra; Artificial Analysis lo redondea a 1M (~1.500 páginas A4). Es espacio de sobra para un repositorio mediano, una base de conocimiento completa o una sesión de agente de una jornada. La pregunta que importa no es si cabe, sino cuánto cuesta usarlo. Tres escenarios con cálculos propios sobre los precios anteriores (los dos primeros en tramo largo porque sus 700k de input superan con creces los 272k del umbral; el tercero en tramo corto, con ~100k de contexto por turno):
| Escenario | Cuenta | Coste |
|---|---|---|
| Leer un repo de 700k tokens en una petición, resumen de 4k de salida | 0,7M × $20 + 0,004M × $75 | ~$14,30 |
| 20 consultas sobre ese mismo repo, cacheadas | 1ª: 0,7M × $25 (escritura de caché) + 0,001M × $75; 19 × (0,7M × $2 + 0,001M × $75) | ~$45,60 |
| Sesión de agente: 40 turnos, ~100k de contexto medio, 90% de cache hits, 2k de salida por turno | 40 × (0,01M × $10 + 0,09M × $1 + 0,002M × $50) | ~$11,60 |
Dos lecturas de la tabla. En el segundo escenario, la primera consulta paga la escritura de caché — 0,7M × $25/M = $17,50, más que cualquiera de las 19 lecturas siguientes — y omitirla da una cuenta optimista de ~$29,50 que no cuadra con la factura. Aun contándola, las 20 consultas cuestan ~$45,60 frente a ~$282 sin caché. En el tercero está el número más útil: sin caché de prompt, la misma sesión cuesta ~$44; con caché, ~$11,60. Es la diferencia entre poder dejar un agente trabajando toda la tarde y tener que racionar las ejecuciones.
¿Y qué puedes hacer con 1M que no puedas hacer chunking? Tres casos donde el contexto completo cambia el resultado, no solo el comfort:
- Análisis de repos completos. El modelo ve dependencias cruzadas, configuración, tests y código a la vez. Con RAG fragmentado, cada recuperación trae trozos sin su contexto estructural; los análisis de arquitectura son donde más se nota la diferencia.
- RAG sin chunking. Pasar el corpus entero (hasta
700k tokens útiles) elimina la clase de errores de retrieval: el modelo ya no depende de que tu retriever encuentre el fragmento correcto. A cambio, pagas todo el corpus en cada consulta — por eso el segundo escenario ($45,60) cuesta más que el primero (~$14,30) aunque la pregunta sea la misma. - Sesiones agent largas. Mantener el historial completo de una sesión de horas sin compactación. Aquí el tramo largo es estructural: con ~100k de contexto medio por turno estás dentro del tramo corto, pero en cuanto una petición acumula más de 272.000 tokens de input cruza al tramo de $20/$75, y el recargo golpea a la request entera, no solo al exceso.
La contrapartida operativa: Astra (max) genera 53,9 tokens por segundo según AA, por debajo de la media (67) de los 200 modelos que sigue. En una petición que ingiere 700k tokens y responde 4k, la espera de salida es la parte pequeña; pero en sesiones interactivas se nota. Velocidad y profundidad siguen siendo un trade-off.
Cuándo tiene sentido pagar (y cuándo no)
Con estos números, la decisión de enrutado se puede escribir en una tabla:
| Si tu tarea es… | Modelo sugerido | Por qué |
|---|---|---|
| Una decisión crítica que ningún otro modelo resuelve | Astra (max/xhigh) | Empate técnico en la cima del índice; $10/$50 en corto |
| Sesiones de agente largas, a diario | Astra con caché de prompt | La sesión de 40 turnos baja de ~$44 a ~$11,60; si un turno supera los 272k de input, la request entera salta de tramo |
| Análisis one-shot de un repo o corpus completo | Astra en batch | $5/$25, la mitad, para trabajo no interactivo |
| Trabajo de código y agentes de ejecución habitual | Sol, o GLM-5.3 fuera de OpenAI | Sol es 2,5x más barato en entrada; GLM-5.3 ($1,4/M) 7x; GLM-5.3-Flash ($0,15/M) 67x — para la mayoría del trabajo cotidiano |
| Clasificar, extraer, resumir a volumen | Luna | $0,20/$1,20; 50x más barato en entrada |
Si necesitas 1M de contexto pero no el nivel de Astra, Kimi K3 ofrece la misma ventana con pesos abiertos a $3/$15 — un tercio del precio de entrada de Astra en tramo corto. No son modelos intercambiables en capacidad, pero para “pásame este repositorio y dime dónde está el bug” puede sobrar.
Este análisis completa el que publicamos sobre GPT-6 Astra como agente de computer-use: allí evaluamos qué tareas delegarle; aquí, qué cuesta hacerlo y con qué margen real. Para el marco general de decisión, la guía de costes de LLM y nuestra pieza sobre qué leaderboards mirar y cuáles ignorar siguen siendo las referencias del sitio.
FAQ
¿GPT-6 Astra es mejor que Claude Fable 5.1?
En el Intelligence Index de AA, empatan: 53 puntos ambos en la captura del 10 de septiembre de 2026. Con ese empate técnico, la decisión se mueve a otras variables: precio ($10/$50 frente a lo que cueste Fable 5.1 según endpoint), ventana de contexto (1M) y velocidad (53,9 tok/s, por debajo de la media). El índice ya no te la resuelve.
¿Puedo comparar el 53 de Astra con el 57 de Kimi K3 de agosto?
No. Son escalas distintas del índice: la versión 4.2 de la metodología (septiembre) cambió composición y pesos, y la media del índice bajó de 58,0 a 45,0 entre capturas consecutivas. Solo son comparables los scores dentro de la misma captura, y entre capturas solo las posiciones relativas.
Método y fuentes
- Intelligence Index: captura propia del 10 de septiembre de 2026 (40 modelos), de Artificial Analysis. Metodología y Version History citadas para la recalibración de escala: las entradas de v4.2 y v4.3 (ambas de septiembre 2026) están verificadas contra la página el 13 de septiembre de 2026. Datos de ficha (score 53, 53,9 tok/s, coste por tarea, mediana de precios) de la página del modelo en AA.
- Precios: docs oficiales de pricing de OpenAI y ficha de GPT-6 Astra (contexto 1.050.000), verificados el 13 de septiembre de 2026: tarifas completas de Standard, Batch, Flex y Fast mode incluidas las columnas de cache writes, y la nota de no-disponibilidad de Fast mode con residencia UE. Umbral de tramo largo (>272K tokens de input), recargo sobre la request completa (2x entrada y caché, 1,5x salida) y escritura de caché a 1,25x del input sin caché, citados de la ficha; OpenRouter (
openai/gpt-6-astra, $10/$50 y cache write $12,50/M) como segunda fuente. - Cálculos de coste: propios, con los precios anteriores; los supuestos de cada escenario están en la tabla. Los ratios contra GLM-5.3 ($1,4/$4,4) y Kimi K3 ($3/$15) provienen de nuestras capturas de precios.
- Corrections policy: si Artificial Analysis publica una nota sobre la recalibración o cambia los scores de la captura, actualizaremos este artículo con la fecha de revisión.