ChatGPT 6 Astra: novedades, precios y benchmarks oficiales

Por Daniele Forciniti

ChatGPT 6 Astra: novedades, precios y benchmarks oficiales

Índice

ChatGPT 6 Astra es el nuevo modelo insignia de OpenAI, publicado el 3 de septiembre de 2026. Cuesta 10 dólares por millón de tokens de entrada y 50 de salida, tiene una ventana de contexto de 1.050.000 tokens y es el primer modelo que OpenAI clasifica como «Critical» en ciberseguridad. En los benchmarks oficiales arrasa en uso del ordenador, matemáticas y ciber, pero en dos índices generalistas se queda por detrás de Claude Fable 5.1. Aquí tienes todas las cifras publicadas, los precios reales y lo que en las tablas no se ve.

Llevo más de diez años trabajando con webs, SEO y contenidos, y cada vez que sale un modelo nuevo lo difícil no es entender qué sabe hacer: es separar lo que pone en la tabla de lo que pasa cuando lo pones a trabajar de verdad. Con Astra esa distancia es más grande de lo habitual, y vale la pena explicar por qué.

Si lo que estás valorando es cuál de los dos modelos de principios de septiembre te conviene, lo conté de forma más directa en la comparación entre GPT-6 Astra y Gemini 3.8 Flash.

Qué cambia de verdad frente a GPT-5.6 Sol

OpenAI presenta Astra como «el modelo más inteligente y mejor alineado del mundo». Más allá de la frase de nota de prensa, lo que cambia en la práctica son cinco cosas, y ninguna tiene que ver con charlar mejor.

1. Usa el ordenador mucho más rápido

Es lo primero que se nota. En OSWorld 2.0, la prueba que mide si un modelo sabe moverse dentro de un sistema operativo real, Astra marca 72,6% empleando unos 40 minutos por tarea, frente al 65,7% en unos 75 minutos del modelo anterior. Traducido: hace más y tarda un 47% menos.

En ScreenSpot-Pro, que mide algo más prosaico (acertar el píxel correcto en una interfaz cargada), pasa de 76,9% a 92,7%. Quien haya intentado que una IA rellene un gestor sabe lo que pesa ese número: es la diferencia entre un agente que trabaja y uno que pulsa el botón equivocado y borra una fila.

Junto al modelo, OpenAI también ha actualizado el entorno de Codex, y declara que las tareas se completan 1,9 veces más rápido que con Sol en el benchmark Mind2Web.

2. Se acuerda de las cosas entre una ventana de contexto y otra

Esto es técnico pero cambia la vida a quien trabaja en proyectos largos. Hasta ahora, cuando la memoria de trabajo se llenaba, los modelos hacían «compaction»: resumían todo en un bloque y tiraban el resto. Cada resumen perdía piezas, normalmente las que hacían falta (por qué una corrección no funcionó, cómo se comportaba un componente).

En Codex, Astra mantiene notas que cruzan las ventanas de contexto, y las ventanas anteriores siguen siendo consultables incluso para lo que no quedó en las notas. La función es todavía experimental y hay que activarla en el archivo de configuración, pero OpenAI dice que pasará a ser la opción por defecto en las próximas semanas.

3. Se queda dentro del perímetro que le das

Aquí está la cifra que más me ha llamado la atención. OpenAI construyó una prueba inspirada en el incidente de Hugging Face de julio de 2026, para medir qué hace un modelo cuando le encargas algo difícil o imposible: ¿se detiene o va más allá de lo que le has autorizado?

Sin las protecciones de producción, GPT-5.6 Sol se pasó del objetivo autorizado en el 48% de los casos. Astra en el 0%. En el benchmark interno que mide los intentos de esquivar la revisión automática de Codex, Astra no lo intentó ni una vez, y eso incluso cuando la revisión estaba configurada a propósito para poder esquivarse y la tarea era imposible de completar de otra forma.

Quien haya intentado poner un agente en producción entiende enseguida lo que vale. Un modelo que al primer obstáculo prueba caminos no autorizados no lo puedes dejar solo en nada.

4. Un salto en matemáticas e investigación científica

En FrontierMath Tier 4, el nivel más difícil de la prueba de matemáticas, Astra marca 97,6% frente al 83,0% de Sol. OpenAI escribe que el modelo ya ha contribuido a resolver problemas abiertos sobre la distancia entre números primos. En Terminal-Bench Science, que mide si es capaz de completar flujos de trabajo científicos reales usando código y terminal, se pasa de 22,4% a 64,6%.

5. Hace trabajo de oficina que antes salía mal

Presentaciones que respetan tu plantilla de diapositivas, documentos formateados según tu estándar, hojas de cálculo. En BenchCAD, que comprueba si un modelo sabe reconstruir objetos 3D generando código CAD, Astra llega al 95,9% frente al 83,3%. Y con Sites dentro de ChatGPT puede crear, alojar y compartir webs y pequeñas aplicaciones a partir de una petición escrita.

Los benchmarks oficiales de ChatGPT 6 Astra, tabla por tabla

Abajo están las nueve tablas que publicó OpenAI el día del lanzamiento, reescritas enteras. Las puntuaciones son las mejores obtenidas a cualquier nivel de esfuerzo, y las pruebas se hicieron en el entorno de investigación de OpenAI o vía API: la propia empresa avisa de que el ChatGPT que usas tú puede dar resultados algo distintos, porque cambian las instrucciones de sistema y las herramientas disponibles.

He puesto en negrita la mejor puntuación de cada fila. Verás que no siempre es la de Astra, y es una de las cosas más honestas de esta tabla: OpenAI publica también las filas donde pierde.

Benchmarks de GPT-6 Astra frente a GPT-5.6 Sol: los ocho saltos más claros
Las ocho pruebas donde la distancia con el modelo anterior es mayor. Datos de las tablas oficiales de OpenAI.

Uso del ordenador

La categoría donde el salto se nota más. Los tiempos por tarea en OSWorld son la parte que más pesa.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
Agents’ Last Exam59,3%53,6%n.d.48,7%55,5%n.d.
OSWorld 2.0 (set offline, puntuación parcial)72,6%65,7%n.d.n.d.70,2%n.d.
ScreenSpot-Pro (sin herramientas)92,7%76,9%n.d.87,3%n.d.n.d.

Trabajo profesional

Aquí aparece el primer dato incómodo: en el Intelligence Index de Artificial Analysis, Astra es cuarta.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
AutomationBench41,4%18,1%31,4%17,4%26,9%n.d.
BenchCAD95,9%83,3%84,3%67,5%82,1%n.d.
BrowseComp91,5%90,4%n.d.87,4%90,8%n.d.
OpenScore String Quartets (1 – OMR-NED)0,840,19n.d.n.d.n.d.n.d.
Tareas de diseño internas50,0%47,4%n.d.35,8%n.d.n.d.
Tareas de ciencia de datos internas40,9%30,5%n.d.34,7%n.d.n.d.
Artificial Analysis Intelligence Index v4.1.161,260,965,762,163,158,7

Programación

Astra es primera en Terminal-Bench y en las migraciones de bases de datos, pero el Coding Agent Index se queda en Opus 5.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended64,5%60,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Main53,3%47,5%50,9%53,5%53,4%43,6%
Migraciones de bases de datos (interno)63,9%42,7%57,8%50,3%n.d.n.d.
Artificial Analysis Coding Agent Index v1.467,065,1n.d.67,268,161,2

Pruebas académicas

El triple en Terminal-Bench Science, pero el Humanity’s Last Exam se lo lleva Anthropic.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
Terminal-Bench Science 0.164,6%22,4%52,6%21,4%30,0%n.d.
FrontierMath Tier 4 (v2)97,6%83,0%87,8%90,2%73,2%n.d.
GPQA Diamond96,0%94,6%93,7%92,6%93,7%95,3%
Humanity’s Last Exam (con herramientas)57,2%n.d.65,0%63,8%63,6%n.d.

Ciencia y salud

Mejoras reales pero pequeñas: aquí la distancia es de uno o dos puntos.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%n.d.n.d.n.d.n.d.
MedChemBench (interno)49,3%47,4%n.d.n.d.n.d.n.d.
LifeSciBench60,3%59,9%n.d.n.d.n.d.n.d.
HealthBench Professional63,4%60,5%58,1%60,9%56,4%52,1%

Ciberseguridad

La categoría que ha activado la clasificación Critical. El 100% en ExploitBench es una puntuación saturada.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%n.d.n.d.70%n.d.
ExploitGym42,4%30,3%30,4%28,4%22,0%n.d.
ExploitBench (junio-agosto 2026)39,0%5,5%n.d.n.d.n.d.n.d.
SRE-Bench88,0%55,9%n.d.n.d.12,5%n.d.
SEC-Bench Pro85,4%79,1%n.d.n.d.n.d.n.d.

Alineación

Ojo: aquí cuanto más bajo, mejor. Son las pruebas que miden cuánto se sale el modelo de lo que se le ha pedido.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
Seguridad en el uso del ordenador (interno)2,4%22,0%9,5%18,3%11,5%n.d.
Seguridad uso del ordenador con AutoReview1,8%4,3%n.d.n.d.n.d.n.d.
Intentos de elusión (interno)0,00%0,29%n.d.n.d.n.d.n.d.
ExploitGym honeypot0,0%48,2%n.d.n.d.n.d.n.d.
Alucinaciones (interno)4,2%12,2%n.d.n.d.n.d.n.d.

Contexto largo

El dato que justifica la ventana de un millón de tokens: por encima del medio millón, Sol perdía una cuarta parte de la información.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
OpenAI MRCR v2, 8 agujas, 256K-512K100,0%91,5%n.d.n.d.n.d.n.d.
OpenAI MRCR v2, 8 agujas, 512K-1M96,3%73,8%n.d.n.d.n.d.n.d.

Razonamiento abstracto

Las cifras de las que ha hablado todo el mundo. Sobre ARC-AGI-3 vuelvo enseguida, porque el número hay que leerlo con cuidado.

PruebaGPT-6 AstraGPT-5.6 SolFable 5.1Fable 5Opus 5Gemini 3.8 Flash
ARC-AGI-399,9%7,8%n.d.n.d.30,2%n.d.
ARC-AGI-295,0%92,5%90,0%89,2%90,4%n.d.
ARC-AGI-198,5%97,5%97,5%98,5%97,5%n.d.

El 99,9% en ARC-AGI-3 y la cifra que casi nadie cita

El número que dio la vuelta al mundo es el 99,9% en ARC-AGI-3, la prueba que mide si un modelo se apaña en entornos que no ha visto nunca, sin instrucciones, explorando y construyéndose solo una idea de cómo funcionan. El modelo anterior estaba en el 7,8% y Claude Opus 5 en el 30,2%. Dicho así parece el final de una época.

La ARC Prize Foundation, que es quien construyó el test, publicó ese mismo día su medición. Y las puntuaciones son dos, no una.

ARC-AGI-3: GPT-6 Astra logra 99,9% con el adaptador de OpenAI y 62,7% con el harness estándar de ARC
El mismo modelo, en el mismo test, con dos andamiajes distintos. Datos: ARC Prize Foundation.

Con el harness estándar de ARC, el mismo para todos los modelos, Astra hace 62,7% y la ejecución cuesta unos 26.000 dólares de cómputo. Con el adaptador de OpenAI, que conserva el estado del razonamiento entre una acción y la siguiente y usa el sistema de compresión de OpenAI, hace 99,9% y cuesta unos 19.000 dólares.

No es un truco y ARC lo dice claramente: los dos son récords absolutos. Pero son cosas distintas. El 62,7% dice lo bueno que es el modelo en un entorno neutro. El 99,9% dice lo bueno que se vuelve cuando corre dentro de la infraestructura de quien lo ha construido. Si tu agente va a usar la API de OpenAI, la cifra que te afecta es la segunda. Si estás comparando modelos distintos para decidir cuál adoptar, la primera es la única comparable.

Hay además un detalle contraintuitivo en la tabla completa: al subir el nivel de razonamiento el coste baja, porque el modelo resuelve los juegos con menos movimientos y por tanto con menos llamadas.

Nivel de razonamientoHarness estándar de ARCAdaptador de OpenAI
max62,7%, 26.098 $98,6%, 17.332 $
xhigh59,3%, 37.317 $98,4%, 18.147 $
high54,8%, 40.705 $99,9%, 18.817 $
medium38,6%, 48.090 $98,4%, 19.285 $
low17,5%, 38.166 $98,0%, 21.298 $
none35,2%, 49.791 $96,7%, 23.457 $
Puntuaciones y coste por ejecución en ARC-AGI-3 Semi-Private. Fuente: ARC Prize Foundation.

Una última comparación que ayuda a poner las cosas en perspectiva. Para fijar la referencia humana, ARC pagó a unas 500 personas normales: 115 dólares por una sesión de 90 minutos más 5 dólares por juego completado, es decir unos 12,78 dólares por partida intentada. El modelo, en la ejecución más barata de las estándar, está en otro orden de magnitud. Eso sí, Astra superó la eficiencia humana en número de movimientos en el 96% de los niveles: hace menos intentos que nosotros, no cuesta menos que nosotros.

Las tres pruebas donde Astra no queda primero

Esta parte pasó desapercibida en las noticias del 3 de septiembre y, sin embargo, está en la tabla oficial de OpenAI, no en una medición hostil.

Las tres pruebas en las que GPT-6 Astra no queda primero según la tabla oficial de OpenAI
En los dos índices generalistas y en el examen más difícil, el primer puesto es de Anthropic.

En el Artificial Analysis Intelligence Index, que es la medida generalista más citada del sector, Astra hace 61,2 frente a los 65,7 de Claude Fable 5.1 y los 63,1 de Opus 5. Es cuarta, por detrás incluso de Fable 5. En el Humanity’s Last Exam con herramientas hace 57,2% frente al 65,0% de Fable 5.1. En el Coding Agent Index se queda en 67,0 frente a los 68,1 de Opus 5.

¿Cómo se casa esto con «el modelo más inteligente del mundo»? Se casa así: Astra está construida para hacer cosas, no para responder bien a preguntas. Gana allí donde hay que usar un ordenador, moverse en un terminal, terminar una tarea larga. Pierde en los índices que miden lo bueno que es un modelo en general. Son dos cualidades distintas, y conviene saber cuál de las dos necesitas antes de firmar un contrato.

Cuánto cuesta Astra: la tarifa completa

El precio base son 10 dólares por millón de tokens de entrada y 50 por millón de salida. Es dos veces y media el modelo anterior, que estaba en 4 y 20.

Precios API de GPT-6 Astra comparados con GPT-5.6 Sol, Terra y Luna
Tarifa API estándar por millón de tokens. Fuente: documentación de OpenAI.

Pero la tarifa base cuenta la mitad de la historia. Hay otras cuatro líneas que en la factura de fin de mes pesan bastante.

ConceptoContexto corto (hasta 272K)Contexto largo (más de 272K)
Entrada10,00 $20,00 $
Entrada desde caché1,00 $2,00 $
Escritura en caché12,50 $25,00 $
Salida50,00 $75,00 $
Precios por millón de tokens. Batch y Flex cuestan la mitad de la tarifa estándar, el modo Fast el doble.

La línea que hay que mirar bien es el umbral de los 272.000 tokens. No es un recargo sobre los tokens que sobran: si lo superas en la entrada, se factura a tarifa larga la petición entera. Con una ventana de 1.050.000 tokens esto se convierte en una decisión de arquitectura: llenar el contexto porque hay sitio es la forma más rápida de triplicar la factura sin darte cuenta.

Las otras tres líneas empujan en dirección contraria y conviene aprovecharlas. La caché cuesta la décima parte de la entrada normal, así que todo lo que se repite (instrucciones de sistema, documentos de referencia) hay que colocarlo de forma que se pueda reutilizar. Batch y Flex cuestan la mitad: si el trabajo no tiene que responder en un segundo, ahí hay un 50% ahorrado sin tocar una línea de código. Fast cuesta el doble y solo tiene sentido donde la velocidad la nota el usuario.

Un ejemplo concreto, con las cifras

Pongamos un caso que en mi trabajo aparece a menudo: un asistente que lee la documentación de un cliente y responde a las preguntas de los visitantes. Digamos 20.000 peticiones al mes, con 8.000 tokens de contexto cada una y 700 tokens de respuesta.

  • Sin caché, tarifa estándar: 160 millones de tokens de entrada (1.600 $) más 14 millones de salida (700 $), es decir 2.300 dólares al mes.
  • Con el contexto fijo en caché (supongamos que 6.000 de los 8.000 tokens se repiten): 120 millones a tarifa de caché (120 $) más 40 millones a tarifa plena (400 $) más la salida (700 $), es decir 1.220 dólares.
  • El mismo trabajo en el modelo anterior, sin caché: 920 dólares.

En el segundo cálculo no he incluido la escritura en caché, que se paga una vez a 12,50 dólares por millón y luego se amortiza en las peticiones siguientes.

Lo importante no es qué cifra es más baja, sino que la diferencia entre la primera línea y la segunda vale más que el salto de generación. Antes de decidir si Astra es cara, conviene mirar cómo está montado el propio flujo de trabajo. En varios proyectos que he llevado, lo que pesaba no era el modelo: era el contexto reenviado cada vez.

¿Y en ChatGPT, sin API?

Astra está incluida en los límites de uso de las suscripciones que ya tienes: Plus, Pro, Business y Enterprise. Quien agote el uso incluido puede comprar créditos adicionales. Quien esté en Pro, Business o Enterprise tiene además acceso a GPT-6 Astra Pro. Para las empresas hay un detalle que no conviene olvidar: en el lanzamiento el acceso viene desactivado por defecto y lo tiene que encender el administrador del espacio de trabajo.

La ficha técnica, en corto

Nombre en la APIgpt-6-astra
Publicación3 de septiembre de 2026
Ventana de contexto1.050.000 tokens
Máximo de entrada922.000 tokens
Máximo de salida128.000 tokens
Conocimiento hasta30 de abril de 2026
Modalidad de salidasolo texto
Razonamientosoportado, con niveles de none a max
Dónde funcionaChatGPT, API de OpenAI, Microsoft Azure, AWS Bedrock
Endpoints soportadosChat Completions, Responses, Batch
No soportadosRealtime, Assistants, fine-tuning, embeddings, imágenes, vídeo, audio

Dos líneas merecen un comentario. La primera es que no se puede entrenar: nada de fine-tuning, así que si tu caso de uso necesita un modelo adaptado a tus datos, Astra no es el camino. La segunda es que solo genera texto: para imágenes, audio y vídeo hacen falta otros modelos de la familia.

Seguridad: por primera vez el umbral «Critical»

Esta es la parte que hace a Astra distinta de cualquier modelo anterior, y no en sentido comercial.

OpenAI tiene un documento interno, el Preparedness Framework, que clasifica los modelos por riesgo. Astra es el primero en alcanzar el umbral Critical en ciberseguridad. No es una etiqueta de marketing: es la razón por la que el lanzamiento va escalonado en vez de ser inmediato.

Las cifras detrás de la clasificación impresionan. En ExploitBench, que mide si un modelo sabe convertir una vulnerabilidad conocida en un ataque que funciona, Astra hace 100%. En una prueba construida a propósito con vulnerabilidades de los tres meses anteriores, imposibles de haber visto en el entrenamiento, pasa del 5,5% del modelo anterior al 39,0%. En SRE-Bench, que mide si sabe entender cómo funciona un programa leyendo su código compilado, resuelve el 88,0% de los casos al primer intento y el 99,2% en cuatro.

Y durante las pruebas encontró y usó dos vulnerabilidades que no conocía nadie. OpenAI dice haberlas comunicado a quienes mantienen esos programas.

La versión que llega a ti va recortada: hace revisión de código y corrección de fallos, pero rechaza las tareas ofensivas, como escribir una prueba de concepto de un ataque. Las capacidades completas se abrirán poco a poco a través de un programa llamado OpenAI Daybreak, para análisis de malware, validación de vulnerabilidades y trabajo defensivo.

Hay una consecuencia práctica que quien ponga Astra en producción debe conocer. Corren unos controles automáticos sobre el comportamiento del modelo, y cuando saltan la actividad se detiene. En ChatGPT o Codex te piden confirmar antes de seguir. En la API la tarea se corta y ya está. OpenAI admite que estos controles a veces bloquean trabajo legítimo, incluida la seguridad defensiva, y dice que siguen ajustándolo. Si estás montando un servicio que funciona solo de noche, esa línea vale más que la mitad de los benchmarks.

Hay también algo que ha empeorado

En el comunicado de OpenAI, entre los entusiasmos, hay un párrafo que conviene leer dos veces. Sus evaluaciones encontraron que el razonamiento escrito de Astra es más difícil de vigilar que el de Sol, en pruebas donde se le pedía explícitamente al modelo que escapara del monitoreo.

OpenAI atribuye el fenómeno a que Astra resuelve los problemas en menos pasos escritos y controla mejor lo que escribe. Añade que en las tareas complejas el modelo todavía tiene dificultades para ocultar el razonamiento, y que se toman el asunto en serio. Queda el hecho de que es una regresión declarada por la propia empresa, y es relevante para cualquiera que tenga que demostrar a un auditor por qué un sistema tomó una decisión. Quien trabaja con el cumplimiento europeo sabe que esto no es ningún detalle.

Desde cuándo se usa, y dónde

El despliegue arrancó el 3 de septiembre de 2026 con un grupo reducido de organizaciones, para extenderse en los días siguientes a todos los suscriptores Plus, Pro, Business y Enterprise. Para desarrolladores está en la API de OpenAI con el nombre gpt-6-astra, además de en Microsoft Azure y AWS Bedrock.

Para los clientes de API que cumplan los requisitos está el Zero Data Retention, es decir, sin conservación de datos. OpenAI está probando además el Private Safety Processing, una forma de hacer el monitoreo de seguridad sin mirar los contenidos.

Mi opinión, desde quien trabaja con esto

Astra no es un modelo que converse mejor. Es un modelo que termina las cosas, y esa es otra categoría. Si tu problema es escribir textos o responder preguntas, los 50 dólares por millón de tokens de salida no los justifica ningún benchmark de esta página: te va mejor un modelo de gama inferior, y la diferencia en la factura la inviertes en otra cosa.

Si en cambio tu problema es un agente que tiene que moverse dentro de software real, abrir paneles, rellenar campos, completar un procedimiento de cuarenta pasos sin inventarse atajos, entonces las cifras que cuentan no son las de inteligencia. Son el 0% frente al 48% en quedarse dentro del perímetro, el 2,4% frente al 22,0% en seguridad de uso del ordenador, el 4,2% frente al 12,2% en alucinaciones. Esas sí cambian el presupuesto, porque son la diferencia entre un agente que vigilas y uno que dejas trabajar.

El consejo que le daría a quien me pregunta si conviene cambiarse: no mires el precio por token, mira el coste por trabajo terminado. Un modelo que cuesta dos veces y media pero cierra la tarea en la mitad de pasos y sin tener que rehacerla puede salir más barato. Vale también lo contrario, y la única forma de saberlo es medirlo en tu propio caso, no en las tablas de nadie. Si estás construyendo algo así, en la guía de agentes IA dejé el método que uso para hacer estas cuentas antes de empezar.

Una última cosa, que afecta a quien como yo se dedica al posicionamiento. Modelos como este están cambiando la forma en que la gente busca información y, por tanto, cómo hay que escribir una web para que la encuentren y la citen. Es un trabajo distinto del SEO clásico y lo hemos recogido en el servicio de consultoría SEO y GEO.

Preguntas frecuentes

¿Cuánto cuesta ChatGPT 6 Astra?

En la API cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida. La entrada recuperada de la caché baja a 1 dólar y la escritura en caché cuesta 12,50. Por encima de 272.000 tokens de entrada, la petición entera pasa a 20 dólares de entrada y 75 de salida. Los modos Batch y Flex cuestan la mitad, el modo Fast el doble. Dentro de ChatGPT, en cambio, Astra está incluida en las suscripciones Plus, Pro, Business y Enterprise sin coste adicional, dentro de los límites de uso del plan.

¿Cuándo salió y cómo se accede?

Salió el 3 de septiembre de 2026, primero para un grupo reducido de organizaciones y después, en pocos días, para todos los suscriptores Plus, Pro, Business y Enterprise. Los desarrolladores lo encuentran en la API como gpt-6-astra, en Microsoft Azure y en AWS Bedrock. En las empresas el acceso viene apagado por defecto: lo tiene que activar el administrador del espacio de trabajo.

¿Por qué circulan dos cifras distintas en ARC-AGI-3?

Porque son dos pruebas hechas con andamiajes distintos, las dos publicadas por la ARC Prize Foundation. Con el harness estándar, igual para todos los modelos, Astra hace 62,7%. Con el adaptador de OpenAI, que conserva el estado del razonamiento entre una acción y la siguiente, hace 99,9%. Ninguna de las dos está mal: la primera sirve para comparar modelos entre sí, la segunda dice qué obtienes si usas la infraestructura de OpenAI.

¿Astra es de verdad el modelo más inteligente que existe?

Depende de qué se entienda por eso. En las pruebas que miden uso del ordenador, matemáticas avanzadas y ciberseguridad es primera y con distancia. En los índices generalistas no: en la tabla publicada por la propia OpenAI, en el Artificial Analysis Intelligence Index hace 61,2 frente a los 65,7 de Claude Fable 5.1, y en el Humanity’s Last Exam con herramientas hace 57,2% frente al 65,0%. Es el modelo más capaz para terminar tareas, no necesariamente el más brillante respondiendo.

¿Cómo de grande es la ventana de contexto?

1.050.000 tokens en total, de los cuales como máximo 922.000 de entrada y 128.000 de salida. Ojo, eso sí, con el umbral de los 272.000 tokens: si lo superas en la entrada, toda la petición se factura al doble de entrada y a una vez y media de salida. La ventana grande está, pero usarla entera tiene un precio.

¿Qué significa que está clasificado como «Critical» en seguridad?

Significa que, según el Preparedness Framework de OpenAI, el modelo tiene capacidades ofensivas que exigen protecciones añadidas. Es el primer modelo que llega a ese umbral. En la práctica la versión pública rechaza las tareas ofensivas (por ejemplo escribir una prueba de concepto de un ataque) y sigue sirviendo para revisión de código y corrección de vulnerabilidades. Las capacidades completas llegarán poco a poco mediante el programa OpenAI Daybreak.

¿Se puede entrenar con datos propios?

No. La documentación oficial pone el fine-tuning entre los endpoints no soportados, junto con embeddings, imágenes, vídeo y audio. Astra solo genera texto. Si tu caso necesita un modelo adaptado a tus datos, hace falta otro camino.

¿Conviene pasarse a Astra o quedarse en el modelo anterior?

Conviene si tu trabajo es agéntico: usar software, completar procedimientos largos, moverse en un terminal. Ahí la ventaja es grande y las cifras de fiabilidad (0% frente a 48% en quedarse dentro del perímetro autorizado) valen más que el precio. No conviene si el trabajo es escribir textos o responder preguntas: cuesta dos veces y media y en ese terreno la distancia no existe. La forma correcta de decidirlo es medir el coste por trabajo terminado en tu propio caso, no el precio por token.

Fuentes

Todas las cifras de este artículo salen de las tablas oficiales publicadas por OpenAI el 3 de septiembre de 2026 y de la medición de la ARC Prize Foundation de esa misma fecha. Donde las dos no coinciden, lo he señalado.

Avatar de Daniele Forciniti
Contáctanos ahora