GPT-6 Astra y Gemini 3.8 Flash: benchmarks oficiales, precios reales y cuál conviene

Por Daniele Forciniti

GPT-6 Astra y Gemini 3.8 Flash: benchmarks oficiales, precios reales y cuál conviene

En dos días han salido dos modelos que van en direcciones opuestas. GPT-6 Astra es el nuevo modelo estrella de OpenAI, anunciado el 3 de septiembre de 2026: usa el ordenador, navega, escribe software y termina tareas largas por su cuenta, a 10 y 50 dólares por millón de tokens. El día anterior Google lanzó Gemini 3.8 Flash, que apuesta por el extremo contrario: rendimiento cercano a los modelos de primera línea a una fracción del precio. Aquí tienes las cifras oficiales de ambos, la comparación directa y las tres cosas que en los comunicados no aparecen. Sin pruebas de campo: salieron ayer, nos ceñimos a los benchmarks publicados y a las evaluaciones independientes.

Qué sabe hacer Astra, en concreto

El salto que declara OpenAI no está en la escritura, está en la autonomía operativa. Astra usa el ordenador como lo haría una persona: abre programas, rellena formularios, navega, comprueba el resultado de lo que ha hecho y corrige. El modelo está pensado para el trabajo largo, ese que ocupa una tarde: actualizar decenas de fichas en un sistema de gestión, hacer las comprobaciones de una web recién publicada, instalar y configurar software mirando qué pasa en pantalla.

Junto al modelo OpenAI también ha actualizado el entorno Codex, declarando una finalización de tareas 1,9 veces más rápida. Es la parte que más importa a quien trabaja: no lo listo que es el modelo, sino cuánto tarda en cerrar un trabajo sin que tengas que volver a meter mano.

GPT-6 Astra: los benchmarks oficiales

Gráfico comparativo de los benchmarks oficiales de GPT-6 Astra frente a GPT-5.6 Sol, Claude Fable 5.1 y Claude Opus 5
Elaboración gráfica sobre datos oficiales de openai.com

Estas son las cifras publicadas por OpenAI, con la comparación contra la generación anterior y contra los modelos de Anthropic:

PruebaGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Uso del ordenador (OSWorld 2.0)72,6%65,7%no publicado70,2%
Automatización de procesos (AutomationBench)41,4%18,1%31,4%26,9%
Investigación científica agéntica (Terminal-Bench Science 0.1)64,6%22,4%52,6%29,0%
Ingeniería de software (DeepSWE v1.1)74,1%70,8%67,4%68,8%
Razonamiento científico (GPQA Diamond)96,0%94,6%93,7%93,2%
Matemáticas avanzadas (FrontierMath Tier 4)97,6%83,0%87,8%73,2%
Seguridad ofensiva (ExploitBench)100%78,5%no publicado70%

La distancia más clara está en la automatización de procesos y en la investigación científica agéntica, donde Astra más que duplica al modelo anterior. En el razonamiento puro, en cambio, los márgenes son de pocos puntos: 96,0% frente al 93,7% de Claude Fable 5.1 no es un salto generacional, es una mejora.

El 99,9% que circula por todas partes, y los dos números que faltan

Las tres puntuaciones de GPT-6 Astra en ARC-AGI-3 medidas en condiciones distintas: 62,7%, 98,6% y 99,9%
Elaboración gráfica sobre datos oficiales de ARC Prize

La cifra que ha dado la vuelta a las redes es el 99,9% en ARC-AGI-3, la prueba pensada para medir cuánto sabe generalizar un modelo ante problemas nuevos. Es cierta y es oficial. Pero ARC Prize, la organización que construyó esa prueba, publicó los resultados completos y son tres, no uno:

  • 62,7% con el entorno de prueba estándar, el mismo para todos los modelos, con un coste de prueba de 26.098 dólares.
  • 98,6% con el adaptador de OpenAI al esfuerzo máximo, por 17.332 dólares.
  • 99,9% con el mismo adaptador a esfuerzo alto, por 19.817 dólares. Es el número que lees en todas partes.

La diferencia técnica no es un tecnicismo. El entorno estándar obliga al modelo a decidir qué merece la pena anotarse entre un paso y otro, con una interfaz idéntica para todos. El adaptador, en cambio, conserva el estado de razonamiento entre una petición y otra y comprime las conversaciones largas, así que el modelo reutiliza el trabajo ya hecho en lugar de repetirlo. Con ese adaptador las pruebas fueron 3,66 veces más rápidas y consumieron un 49% menos de tokens.

Ninguno de los tres números es falso. Pero citar solo el 99,9% y callar el 62,7% cuenta una historia distinta de la real, y el salto respecto al modelo anterior sigue siendo enorme incluso tomando la cifra más baja: 62,7% frente al 7,8% de GPT-5.6 Sol.

Qué dice quien construyó la prueba

En redes el lanzamiento se ha contado como el inicio oficial de la era de la AGI, la inteligencia artificial general. Merece la pena leer qué escribe ARC Prize, que creó ese benchmark: aun reconociendo un avance significativo hacia la generalización, declara explícitamente que no sostiene que se trate de AGI. Y añade que saturar la prueba no constituiría la demostración de haberla alcanzado, porque ARC-AGI-3 tiene un alcance deliberadamente limitado, con entornos cerrados y deterministas que no representan la complejidad del mundo real.

Dicho de forma sencilla: quien construyó el metro dice que el metro no mide lo que el titular afirma. Es una información que vale más que diez comentarios entusiastas, y curiosamente no aparece casi en ningún sitio.

Gemini 3.8 Flash: la estrategia opuesta

El 2 de septiembre, un día antes, Google lanzó Gemini 3.8 Flash con una apuesta distinta: no ser el mejor, sino ser lo bastante bueno a una fracción del precio. Cuesta 0,75 dólares por millón de tokens de entrada y 3,75 de salida, frente a los 5 y 25 de Claude Opus 5. Son unas seis o siete veces menos.

Ojo con un detalle que en los posts no aparece: ese es un precio promocional. Desde el 1 de enero de 2027 se duplica, pasando a 1,50 y 7,50 dólares. Sigue siendo el más barato del grupo, pero si estás echando cuentas para un proyecto que dura más de cuatro meses, las cifras que van en la hoja son las nuevas.

Gemini 3.8 Flash contra Opus 5: dónde se sostiene la promesa y dónde no

La frase que circula es «está al nivel de Opus 5». Mirando la tabla publicada por Google, es cierta en algunas pruebas y clamorosamente falsa en otras:

PruebaGemini 3.8 FlashClaude Opus 5Quién gana
Tareas de analista financiero (Vals Finance Agent v2)61,4%58,6%Gemini
Flujos legales complejos (Harvey’s Legal Agent)10,0%6,7%Gemini, casi el doble
Vídeo largo (LVBench, modo agéntico)87,8%75,4%Gemini
Lectura de gráficos complejos (CharXiv Reasoning)86,2%83,7%Gemini
Programación en terminal (Terminal-bench 2.1)89,4%89,1%Prácticamente empate
Ingeniería de software (DeepSWE v1.1)73,7%74,0%Prácticamente empate
Trabajo de conocimiento (GDPVal-AA v2, puntuación Elo)15451824Opus 5, con claridad
Capacidades agénticas generales (Terminal-bench 4.0)19,1%51,8%Opus 5, casi el triple

El cuadro es claro: en tareas acotadas y bien definidas Gemini 3.8 Flash aguanta la comparación y a veces gana. En las tareas agénticas largas, donde el modelo tiene que mantener el hilo durante muchos pasos, la distancia es enorme. Y como es justo ahí donde se concentra el trabajo que se cobra, la frase «al nivel de Opus 5» hay que tomarla por lo que es: cierta en una casilla, falsa en otra.

Una nota de método que sirve siempre: cada empresa publica los benchmarks que ha ejecutado ella, con sus propios ajustes. En Terminal-Bench 4.0 la tabla de Google le da a Opus 5 un 51,8% y la de OpenAI un 52,3%. Son diferencias pequeñas, pero explican por qué dos tablas sobre el mismo modelo nunca coinciden del todo.

Astra contra Gemini 3.8 Flash: la comparación que importa

Comparación de precios por millón de tokens entre GPT-6 Astra, Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol y Gemini 3.8 Flash
Elaboración gráfica sobre las tarifas oficiales de los tres proveedores

Enfrentarlos por puntuación tiene poco sentido, porque no juegan la misma liga. La comparación útil es esta:

GPT-6 AstraGemini 3.8 Flash
Precio por millón de tokens10 de entrada, 50 de salida0,75 y 3,75, luego 1,50 y 7,50 desde 2027
Diferencia de precioreferenciaunas 13 veces menos en entrada al precio promocional
Punto fuerteUso del ordenador y tareas largas en autonomíaCoste y velocidad en tareas definidas
Dónde se caeEn la factura, si lo usas para trabajos simplesEn las tareas agénticas largas
Uso sensatoEl trabajo complejo que antes requería a una persona durante horasVolúmenes altos de operaciones repetitivas y definidas

Traducido para quien tiene que decidir: si tienes muchas operaciones simples, clasificar mensajes, extraer datos, resumir documentos, el modelo caro no te hace falta y estás tirando dinero. Si tienes pocas tareas complejas que antes ocupaban a una persona media jornada, el modelo barato no llega y el ahorro se convierte en trabajo rehecho.

La medida independiente: Astra no es primero en todo

Aquí llega el dato que le da la vuelta al relato triunfal, y viene de quien mide modelos por oficio sin venderlos. Según Artificial Analysis:

  • En su índice de inteligencia general Astra marca 61, exactamente igual que la generación anterior, mientras que en cabeza sigue Claude Fable 5.1 con 66.
  • En el índice de agentes de programación Astra llega a 67, a la par con Opus 5, mientras Fable 5.1 lidera con 70.
  • En código es un 70% más eficiente en tokens que el modelo anterior, pero cuesta un 75% más por tarea en el índice general, porque la tarifa ha subido dos veces y media.

No es un suspenso: en uso del ordenador y en autonomía el salto es real y está medido. Pero «el modelo que inaugura la era de la AGI» y «igual que la generación anterior en el índice de inteligencia general» son dos frases que describen el mismo modelo, y solo una de las dos está en los comunicados.

Seguridad: el umbral Critical, por primera vez

Esta es la parte que merece más atención que los benchmarks. OpenAI ha clasificado a Astra en el nivel Critical para las capacidades de ciberseguridad según su propio marco de evaluación de riesgos: es la primera vez en un modelo publicado por la empresa. El 100% en ExploitBench no es una puntuación como las demás: mide la capacidad de construir cadenas de ataque que funcionan.

Por eso las capacidades ofensivas no están abiertas a todos, sino que pasan por un programa de acceso controlado. Y para responder a la duda de que las puntuaciones estuvieran infladas por vulnerabilidades ya vistas en el entrenamiento, OpenAI construyó una prueba nueva sobre fallos del periodo de junio a agosto de 2026. Es una precaución metodológica seria y hay que reconocerla.

Precios, versiones y dónde se usan

  • GPT-6 Astra: 10 dólares por millón de tokens de entrada y 50 de salida, con tarifas aparte para la caché. Hay un modo rápido que duplica la velocidad duplicando el precio.
  • Dónde: despliegue gradual en ChatGPT en los planes Plus, Pro, Business y Enterprise, más API, Microsoft Azure y Amazon Bedrock. Quien tenga Pro, Business o Enterprise accede también a la versión Pro. En empresas está desactivado por defecto en el lanzamiento y lo activa el administrador.
  • Gemini 3.8 Flash: 0,75 y 3,75 dólares por millón de tokens, que pasan a 1,50 y 7,50 desde el 1 de enero de 2027.

Mi opinión

Llevo más de diez años trabajando con webs, contenidos y posicionamiento, y estas herramientas las uso a diario, no las estudio desde lejos. El modelo salió ayer, así que no tengo nada que contarte desde el terreno y no me lo invento: lo que hay aquí son las cifras oficiales y las verificaciones de quien las mide por oficio.

Dicho esto, dos cosas ya parecen claras. La primera es que el salto real no está en la inteligencia sino en la autonomía: el modelo que mantiene el hilo durante horas sin perderse cambia el trabajo mucho más que dos puntos más en una prueba de razonamiento. La segunda es que con estos precios la elección del modelo se convierte en una decisión de presupuesto, no de bando: poner a Astra en una tarea que Gemini Flash resuelve por una treceava parte del coste es un error que se paga en la factura, y quien construye sistemas con estas herramientas debería razonar por niveles, como explico en la guía completa de agentes IA.

La tercera la digo como persona que lee titulares todo el día: cuando la empresa que vende dice «AGI» y la organización que construyó la prueba dice «no es AGI», conviene fiarse de la segunda. En el frente de Anthropic la comparación la tienes en el artículo sobre Claude Fable 5.1, que sigue liderando los índices independientes.

En conclusión

Dos lanzamientos en dos días que cuentan dos estrategias: OpenAI empuja en autonomía y sube el precio, Google empuja en precio y acepta no ganar en todo. Los benchmarks oficiales son ciertos, pero hay que leerlos sabiendo en qué condiciones se obtuvieron, y las verificaciones independientes rebajan bastante el anuncio de la era de la AGI. Si tienes que elegir, no mires quién tiene la puntuación más alta: mira qué tipo de trabajo necesitas y cuánto estás dispuesto a pagarlo.

Preguntas frecuentes

¿GPT-6 Astra es realmente AGI?

No, y lo dice justamente quien construyó la prueba más citada. ARC Prize reconoce un avance significativo hacia la generalización pero declara explícitamente que no sostiene que se trate de AGI, y precisa que el benchmark tiene un alcance limitado y entornos deterministas.

¿Por qué circulan cifras distintas en ARC-AGI-3?

Porque son tres medidas del mismo modelo en condiciones distintas: 62,7% con el entorno de prueba estándar, 98,6% con el adaptador de OpenAI a esfuerzo máximo y 99,9% con el mismo adaptador a esfuerzo alto. El adaptador conserva el estado de razonamiento entre peticiones, algo que el entorno estándar no hace.

¿Cuánto cuesta GPT-6 Astra?

10 dólares por millón de tokens de entrada y 50 de salida, con tarifas aparte para la caché. El modo rápido duplica velocidad y precio. Es la misma tarifa que Claude Fable 5.1 y unas dos veces y media el precio de la generación anterior.

¿Gemini 3.8 Flash está de verdad al nivel de Opus 5?

En algunas pruebas sí, y en varias lo supera: tareas de analista financiero, flujos legales, vídeo largo y lectura de gráficos. En otras no: en capacidades agénticas generales Opus 5 hace casi el triple, y en trabajo de conocimiento la distancia sigue siendo amplia.

¿Los precios de Gemini 3.8 Flash se mantienen?

No. Son precios promocionales que se duplican el 1 de enero de 2027, pasando de 0,75 y 3,75 a 1,50 y 7,50 dólares por millón de tokens. Sigue siendo el más barato de los comparados, pero las cuentas de un proyecto largo hay que hacerlas con las cifras nuevas.

¿Qué significa la clasificación Critical en seguridad?

Que según el marco de evaluación de riesgos de OpenAI el modelo alcanza el umbral más alto en capacidades de ciberseguridad, por primera vez en un modelo publicado. Las funciones ofensivas no están abiertas a todos, sino que pasan por un programa de acceso controlado.

¿Cuál conviene elegir?

Depende del tipo de trabajo. Para grandes volúmenes de operaciones simples y bien definidas conviene el modelo barato, porque el coste por operación marca la diferencia. Para pocas tareas largas y complejas que exigen autonomía, el modelo caro se paga solo con el tiempo que libera.

Fuentes

  • OpenAI: el anuncio oficial de GPT-6 Astra con las tablas de benchmarks, los precios y la disponibilidad.
  • ARC Prize: las tres puntuaciones en ARC-AGI-3, la diferencia entre entornos de prueba y su posición sobre la AGI.
  • Artificial Analysis: la evaluación independiente sobre inteligencia, agentes de programación y coste por tarea.
  • Simon Willison: el análisis técnico del lanzamiento, con los matices sobre los benchmarks.
  • Análisis de Gemini 3.8 Flash: precios, benchmarks y el detalle de la subida de tarifas en 2027.
Avatar de Daniele Forciniti
Contáctanos ahora