Opus 5 de Anthropic: todas las novedades, los benchmarks y los costes
Por Daniele Forciniti

Claude Opus 5 es el nuevo modelo estrella de Anthropic, lanzado el 24 de julio de 2026, y la noticia cabe en una línea: alcanza un rendimiento cercano a Claude Fable 5 a la mitad de precio, manteniendo el mismo coste que Opus 4.8 — 5 $ de entrada y 25 $ de salida por millón de tokens. Además trae una novedad que cambia la forma de trabajar con él: un selector de esfuerzo (de bajo a máximo) que te deja decidir en cada petición cuánto quieres que razone el modelo, y por tanto cuánto gastar.
Desde hace más de 10 años trabajo con webs, SEO y contenidos, y uso los modelos de Anthropic a diario en trabajo real. Aquí no vas a encontrar la nota de prensa reescrita: te cuento qué cambia de verdad, qué dicen los números y —lo que casi nadie explica— dónde Opus 5 no conviene.
Qué es Opus 5 y por qué sale ahora
Opus 5 sustituye a Opus 4.8 como modelo por defecto para quien tiene Claude Max y Claude Pro. En el catálogo de Anthropic se coloca en medio: por debajo de Fable 5 en precio, pero muy cerca en rendimiento. El identificador para la API es claude-opus-5, la ventana de contexto es de 1 millón de tokens. Está disponible en Claude.ai, la API, Claude Code y Claude Cowork.
Junto al modelo llegan dos funciones en beta que vale la pena conocer: la posibilidad de cambiar de herramientas a mitad de conversación y los fallbacks automáticos hacia otros modelos. Esta última es cómoda: si una petición se bloquea por los filtros, el sistema puede recurrir a Opus 4.8 en lugar de dejarte con las manos vacías.
El contexto importa, porque explica el resto. Este es el cuarto modelo de frontera que Anthropic publica en menos de dos meses, y llega en plena guerra de precios que ha sacudido a todo el sector: como conté en el artículo sobre cuánto estás pagando de verdad por la IA, en pocas semanas la inteligencia de alto nivel se ha vuelto dos o tres veces más barata. Opus 5 es la respuesta de Anthropic a esa presión: mismas tarifas de antes, mucho más rendimiento.
Los benchmarks, con los números delante
Aquí Anthropic tiene motivos para celebrar, aunque con algún asterisco. Empecemos por los tests donde Opus 5 domina:
| Test | Opus 5 | Fable 5 | GPT-5.6 Sol | Opus 4.8 |
|---|---|---|---|---|
| Frontier-Bench (coding en terminal) | 43,3% | 33,7% | 34,4% | 21,1% |
| GDPval-AA (trabajo de conocimiento, Elo) | 1.861 | 1.747 | 1.736 | 1.593 |
| ARC-AGI-3 (problemas nunca vistos) | 30,2% | — | 7,8% | 1,5% |
| BrowseComp (búsqueda agéntica) | 90,8% | 87,4% | 90,4% | 84,3% |
| Humanity’s Last Exam (con herramientas) | 64,7% | 63,9% | — | 57,9% |
| BioMysteryBench (biología, nivel difícil) | 49,4% | 46,5% | — | 42,4% |
| DeepSWE (coding agéntico) | 68,8% | 69,7% | 72,7% | 59,0% |

Dos datos saltan a la vista. En Frontier-Bench, Opus 5 hace más del doble que su predecesor (43,3% frente a 21,1%) y adelanta con claridad tanto a Fable 5 como a GPT-5.6 Sol. En ARC-AGI-3, el test que mide cómo se desenvuelve un modelo ante problemas que nunca ha visto, el salto es impresionante: 30,2% frente al 7,8% de GPT-5.6 Sol, casi cuatro veces más — y frente al 1,5% de Opus 4.8 ni siquiera hay comparación.
Hay además tres resultados que merecen atención porque desmienten alguna expectativa. En BrowseComp, el test de búsqueda agéntica, Opus 5 marca 90,8% y supera a GPT-5.6 Sol (90,4%): un adelantamiento en un terreno donde se daba por favorita a OpenAI. En Humanity’s Last Exam con herramientas llega al 64,7%, por delante de Fable 5 — aunque sin herramientas Fable sigue por delante por muy poco (56,5% frente a 56,3%). Y en biología el cuadro es más matizado de lo que la propia Anthropic deja entender: en BioMysteryBench, en el nivel difícil, Opus 5 lidera con un 49,4% frente al 46,5% de Fable 5.
Luego están los resultados de coste por resultado, que en mi opinión son los más interesantes para quien trabaja:
- CursorBench 3.2: al máximo esfuerzo, la distancia con Fable 5 se reduce a un margen del 0,5% — con la mitad del coste por tarea.
- OSWorld 2.0 (uso del ordenador): 70,6% frente al 66,1% de Fable 5, gastando alrededor de un tercio.
- Zapier AutomationBench: tasa de éxito unas 1,5 veces superior a la competencia con el mismo gasto.
- Biología estructural: +10,2 puntos porcentuales sobre Opus 4.8; predicción de variantes proteicas +7,7 puntos.

En un agregado independiente como BenchLM, Opus 5 aparece primero entre 215 modelos con 85,88 puntos, por delante de Fable 5 (82,76) y GPT-5.6 Sol (81,46), con un 96% en SWE-bench Verified y una puntuación perfecta en las olimpiadas de matemáticas IMO 2026.
La verdadera novedad: el selector de esfuerzo
Esta es la parte que en la mayoría de artículos se despacha en dos líneas y, en cambio, es la que te cambia la factura. Opus 5 te permite elegir cuánto tiene que «pensar» el modelo en cada petición, en cinco niveles: bajo, medio, alto, xhigh y máximo.
Traducido a la práctica: ya no pagas una tarifa única al margen de la tarea. Para reescribir la descripción de un producto dejas el esfuerzo bajo y gastas poquísimo; para un análisis complejo o un bug difícil subes la rueda y pagas más solo en ese momento. Es el mismo principio del que hablaba en la comparativa entre Fable 5 y ChatGPT 5.6: el ahorro real no está en el modelo barato, está en no usar la potencia máxima cuando no hace falta.
También hay un modo rápido: unas 2,5 veces más veloz que el predeterminado, al doble del precio base. Útil cuando la velocidad de respuesta importa más que el coste, por ejemplo en una aplicación que responde a un usuario en tiempo real.
La anomalía de la que nadie habla: el máximo esfuerzo rinde menos
Y aquí llega el dato que me hizo levantar una ceja. Mirando los resultados en detalle, Opus 5 en el nivel «máximo» obtiene puntuaciones más bajas que en el nivel «xhigh» en Frontier-Bench y en el índice de coding de Artificial Analysis. Más bajas, aun costando más.
No es un detalle menor: significa que llevar la rueda al máximo no solo no compensa, sino que puede empeorar el resultado en ciertas tareas. En mis años de trabajo he aprendido que cuando una herramienta ofrece un ajuste «al máximo», casi todo el mundo lo usa pensando que obtendrá lo mejor. Aquí te arriesgas a pagar más para obtener menos. Si usas Opus 5 en serio, prueba xhigh antes de dar por hecho que max es superior.
Qué dicen las empresas que ya lo han probado
Anthropic ha publicado algunas valoraciones de los socios que probaron Opus 5 antes del lanzamiento, y una en concreto es más elocuente que cualquier benchmark. Wade Foster, CEO de Zapier, cuenta que en sus tests internos «los modelos anteriores no pasaban; Opus 5 hizo el 100%». Teniendo en cuenta que Zapier vive de automatizaciones que deben funcionar sin supervisión, es el tipo de resultado que pesa más que una puntuación.
En la misma línea Scott Wu, CEO de Devin: «Opus 5 se acerca al rendimiento de Fable a la mitad del coste». Y desde Lovable señalan un aspecto que suele pasarse por alto pero que quien trabaja conoce bien: el modelo muestra «mucha menos varianza de una ejecución a otra». Traducido: ante la misma tarea repetida dos veces, te da respuestas más coherentes. Para quien construye automatizaciones eso es oro, porque la imprevisibilidad es el verdadero enemigo.
Dónde Opus 5 no es el mejor
La propia Anthropic lo admite, y hay que decirlo porque ningún modelo gana en todo. En DeepSWE, el test de coding agéntico, Opus 5 se queda por detrás tanto de GPT-5.6 Sol (72,7%) como de Fable 5 (69,7%) con su 68,8%. En ciberseguridad y en investigación biológica avanzada va por detrás de Mythos 5, y en los benchmarks de ámbito sanitario y legal no está en cabeza.

Un aspecto interesante en seguridad: Anthropic define a Opus 5 como el modelo más alineado que ha producido nunca, con una puntuación de 2,3 en la auditoría de comportamiento — la más baja (y por tanto la mejor) entre los modelos recientes, con las tasas más bajas de comportamientos engañosos. Además ha hecho que los filtros de ciberseguridad intervengan un 85% menos que en Fable 5, aunque sigue bloqueando el escaneo de binarios, el pentesting y la generación de exploits. Traducido: es más colaborativo ante peticiones técnicas legítimas, sin abrir la puerta a los abusos.

Cuánto cuesta de verdad
Los precios vía API son idénticos a los de Opus 4.8, y ese es el punto: pagas como antes y obtienes mucho más.
| Modelo | Entrada (1M tokens) | Salida (1M tokens) |
|---|---|---|
| Claude Opus 5 | 5 $ | 25 $ |
| Claude Fable 5 | 10 $ | 50 $ |
| Claude Opus 4.8 | 5 $ | 25 $ |
La comparación con Fable 5 es clara: exactamente la mitad, tanto en entrada como en salida, para un rendimiento que en varios tests es superior. Si usas Fable 5 para trabajos que Opus 5 resuelve igual de bien, estás gastando el doble sin motivo. Quien tenga Claude Max o Pro ya lo tiene como modelo por defecto, sin coste adicional.
A quién le conviene de verdad
Después de ponerlo a prueba en trabajo real, mi lectura es esta:
- Si usabas Fable 5 para la mayoría de tareas: prueba a pasarte a Opus 5. Misma calidad percibida, media factura.
- Si trabajas con agentes y automatizaciones: probablemente sea hoy la mejor opción, visto lo que hace en Frontier-Bench y AutomationBench.
- Si escribes código complejo todo el día: valora también GPT-5.6 Sol, que en DeepSWE sigue por delante.
- Si trabajas en ciberseguridad: Opus 5 todavía no es la referencia, mejor mirar otras opciones.
- Si te basta algo más ligero: para tareas sencillas y de alto volumen sigue siendo válido Claude Sonnet 5, que cuesta mucho menos.
Mi opinión, con honestidad
Opus 5 es un lanzamiento serio, no una actualización de fachada: duplicar el resultado en Frontier-Bench y el salto en ARC-AGI-3 son números reales, y mantener el precio congelado mientras sube el rendimiento es lo que más me convence. Para quien trabaja, es la mejor noticia de los últimos meses.
Dicho esto, dos cautelas. La primera: los benchmarks no son tu trabajo. Un modelo que gana en un test de coding en terminal no es automáticamente el mejor para escribir tus contenidos o analizar tus datos — mira siempre el test que se parece a lo que haces de verdad. La segunda: esa historia del máximo esfuerzo que rinde menos que xhigh es el recordatorio perfecto de que estas herramientas hay que probarlas, no darlas por buenas de fiado.
El consejo que doy siempre sigue siendo el mismo: ten dos o tres modelos y elige según la tarea. Con el selector de esfuerzo, ahora puedes hacerlo incluso dentro del mismo modelo.
Preguntas frecuentes
¿Qué es Claude Opus 5?
Es el nuevo modelo estrella de Anthropic, lanzado el 24 de julio de 2026. Ofrece un rendimiento cercano a Claude Fable 5 a la mitad de precio, tiene una ventana de contexto de 1 millón de tokens e introduce un selector de esfuerzo de cinco niveles.
¿Cuánto cuesta Opus 5?
5 $ por millón de tokens de entrada y 25 $ de salida, exactamente igual que Opus 4.8 y la mitad que Fable 5 (10 $ y 50 $). También existe un modo rápido, 2,5 veces más veloz al doble del precio base.
¿Es Opus 5 mejor que Fable 5?
En muchos tests sí: lo supera en Frontier-Bench (43,3% frente a 33,7%) y en GDPval-AA, costando la mitad. En DeepSWE, en cambio, se queda ligeramente por detrás (68,8% frente a 69,7%). Depende del tipo de trabajo.
¿Qué es el selector de esfuerzo?
Es un ajuste que permite elegir cuánto razona el modelo en cada petición, en cinco niveles de bajo a máximo. Sirve para pagar más solo cuando la tarea lo requiere de verdad.
¿Conviene usar Opus 5 al máximo esfuerzo?
No siempre. En Frontier-Bench y en el índice de coding de Artificial Analysis, el nivel «máximo» obtiene puntuaciones inferiores al nivel «xhigh» aun costando más. Conviene probar xhigh antes de dar por hecho que el máximo es mejor.
¿Tengo que pagar aparte para usar Opus 5?
No, si tienes una suscripción Claude Max o Claude Pro: allí ya es el modelo por defecto. Vía API se paga por consumo según las tarifas indicadas.
¿En qué es más débil Opus 5?
En el coding agéntico medido por DeepSWE se queda por detrás de GPT-5.6 Sol, y en ciberseguridad e investigación biológica avanzada va por detrás de Mythos 5. También en el ámbito sanitario y legal no está en cabeza.
Fuentes
- Anthropic – Introducing Claude Opus 5 (anuncio oficial)
- The Decoder – Opus 5: rendimiento cercano a Fable 5 a mitad de precio
- BenchLM – Claude Opus 5: benchmarks y precios
- MarkTechPost – Claude Opus 5: coding agéntico de frontera al mismo precio
- VentureBeat – Anthropic lanza Claude Opus 5
Estás pagando la IA 10 veces de más: los 3
Estás pagando la IA 10 veces de más: los 3 modelos que uso yo (y lo que cuestan de verdad) Por…
NotebookLM ha muerto: bienvenido Gemini Notebook
NotebookLM ha muerto: bienvenido Gemini Notebook (y esta vez cambia de verdad) Por Daniele Forciniti Gemini Notebook es el nuevo nombre de…
Google AI Overviews ya genera imágenes: qué cambia para tu
Google AI Overviews ya genera imágenes: qué cambia para tu web Por Daniele Forciniti Google anunció el 14 de julio de 2026…
Fable 5 VS ChatGPT 5.6: benchmarks y costes comparados
Fable 5 VS ChatGPT 5.6: benchmarks y costes comparados Por Daniele Forciniti En la comparativa entre Fable 5 y ChatGPT 5.6 no…
El navegador se convierte en un agente: empieza la guerra
En 2026 el navegador ya no sirve solo para navegar: se está convirtiendo en un agente de IA capaz de…
ChatGPT 5.6 y ChatGPT Work: todas las novedades
ChatGPT 5.6 y ChatGPT Work: todas las novedades Por Daniele Forciniti ChatGPT 5.6 es la nueva generación de modelos de inteligencia artificial…