Claude Fable 5.1 y Mythos 5.1: benchmarks, precios y el recorte del 75% que cambia las cuentas
Por Daniele Forciniti

Claude Fable 5.1 es el nuevo modelo estrella de Anthropic, anunciado el 1 de septiembre de 2026 junto a Claude Mythos 5.1. Son el mismo modelo con protecciones distintas: el primero es para todos, el segundo está reservado a organizaciones verificadas que trabajan en ciberseguridad y ciencias de la vida. La novedad que más pesa no está en los benchmarks sino en la tarifa: la lectura de caché baja de 1 a 0,25 dólares por millón de tokens, un recorte del 75% que en el trabajo agéntico puede valer hasta un 45% de ahorro. Aquí tienes las cifras oficiales, qué cambia de verdad y lo que casi nadie está contando.
Qué cambia respecto a la versión anterior
Si leíste el artículo sobre Fable 5 y Mythos 5, la estructura te suena: misma familia, mismo precio base por token, misma ventana de contexto de un millón de tokens y 128.000 tokens de respuesta máxima. El salto está en tres puntos:
- Trabajos largos y autónomos: el modelo aguanta tareas agénticas mucho más extensas, es decir, secuencias en las que usa herramientas, comprueba, corrige y sigue solo.
- Coste de uso intensivo: entrada y salida siguen igual, pero quien relee a menudo el mismo contexto paga mucho menos.
- Menos bloqueos inútiles: las protecciones saltan sin motivo mucho menos, y es un problema que quien trabajaba con temas técnicos conocía bien.
Claude Fable 5.1: los benchmarks oficiales, cifras en mano
Esta es la tabla publicada por Anthropic, con la comparación directa contra el modelo anterior, contra Opus 5 y contra GPT-5.6 Sol de OpenAI. Los valores son los de la página oficial:
| Prueba | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Investigación científica agéntica (Terminal-Bench-Science 0.1) | 52,6% | 24,7% | 29,0% | 22,4% |
| Programación agéntica (Terminal-Bench 4.0) | 55,8% | 42,0% | 52,3% | 37,3% |
| Trabajo de conocimiento (GDPval-AA v2) | 1853 | 1723 | 1824 | 1711 |
| Uso del ordenador (OSWorld 2.0, criterio estricto) | 41,7% | 36,1% | 39,6% | no publicado |
| Razonamiento multidisciplinar (Humanity’s Last Exam, con herramientas) | 65,0% | 63,8% | 63,6% | no publicado |
| Flujos de trabajo empresariales (AutomationBench) | 31,4% | 17,1% | 26,9% | 19,6% |
| Programación agéntica (CursorBench 3.2.0) | 73,4% | 70,5% | 70,0% | 67,2% |

El dato que salta a la vista es el primero: en investigación científica agéntica la puntuación más que se duplica respecto al modelo anterior, del 24,7% al 52,6%. En el resto hay mejoras, pero más contenidas, y en algunos casos la distancia con Opus 5 es de pocos puntos. Quien te cuente que es un salto generacional en todo está exagerando: el salto es claro en ciencia y en automatización de flujos de trabajo, medido en el resto.

Ojo con una cifra que circula mal. En varias publicaciones en redes se ve un 60,9% atribuido a Fable 5.1 en programación agéntica. En la página oficial ese 60,9% pertenece a Mythos 5.1 en la misma prueba, mientras que Fable 5.1 se queda en 55,8%. El mismo número aparece además en otra fila, Humanity’s Last Exam sin herramientas, y de ahí viene la confusión. Si lo republicas, republicas un error.
Fuera de la tabla hay otros dos datos interesantes: en una prueba de agente que navega por la web la tasa de tareas completadas llega al 82%, frente al 74% de Opus 5 y al 57% del modelo anterior. En investigación científica, Anthropic informa de trabajos de diseño de proteínas con una tasa de acierto cercana al 50% en doce dianas, y de una reescritura de código para tarjetas gráficas que ha hecho el procesamiento hasta 2,5 veces más rápido, bajando los costes entre un 30% y un 60%.
El recorte de costes: dónde está el ahorro de verdad
Aquí está la parte que importa a quien paga la factura, y conviene entenderla bien porque es fácil malinterpretarla:
| Concepto | Antes | Ahora |
|---|---|---|
| Entrada (por millón de tokens) | 10 dólares | 10 dólares, sin cambios |
| Salida (por millón de tokens) | 50 dólares | 50 dólares, sin cambios |
| Lectura desde caché | 1 dólar | 0,25 dólares, un 75% menos |
Traducido: el precio de tarifa no ha bajado. Lo que ha bajado es el coste de releer un contexto ya enviado. La caché sirve justo para eso: mandas una vez el documento, el código o las instrucciones largas, y en las peticiones siguientes el modelo las relee de ahí en lugar de reprocesarlas desde cero. En una sola pregunta no cambia nada. En un agente que trabaja horas sobre el mismo proyecto, releyendo el mismo contexto cientos de veces, lo cambia todo.
Un detalle técnico que lo explica mejor que los porcentajes: en el resto de modelos Claude la lectura desde caché cuesta una décima parte de la entrada normal, aquí cuesta una cuarentava parte. Es una decisión que empuja claramente hacia el uso agéntico. Anthropic declara alrededor de un 25% de ahorro en cargas típicas y hasta un 45% aproximado en las muy repetitivas. Si en cambio haces peticiones sueltas y distintas entre sí, tu factura se queda igual que antes: conviene saberlo antes de esperar un descuento que no va a llegar.
Fable y Mythos: mismo motor, reglas distintas
Es el punto que más confunde, así que lo digo sencillo: no son dos modelos distintos. Es el mismo modelo con dos niveles de protección. Fable 5.1 es el general, con los límites activos en ciberseguridad, biología y química. Mythos 5.1 tiene límites más permisivos en esos mismos ámbitos y está cerrado dentro de programas de acceso verificado, reservados a organizaciones estadounidenses comprobadas que trabajan en seguridad informática y ciencias de la vida.
La novedad útil para quien trabaja es que las protecciones se equivocan mucho menos. Anthropic declara un 60% menos de falsos positivos en seguridad informática e intervenciones reducidas un 85% en las peticiones inocuas de biología básica. Si alguna vez te han rechazado una pregunta totalmente legítima solo porque contenía ciertas palabras, es exactamente el problema que han atacado.
Vulnerabilidades: qué puede hacer y qué no
Sobre este punto circula mucha aproximación, y la distinción es importante. Anthropic escribe que el modelo puede usarse para detectar vulnerabilidades en el software, pero no para desarrollar exploits. Son dos cosas distintas: encontrar un fallo en un código y comprobarlo es trabajo defensivo, lo que hace un profesional cuando revisa un sistema; construir la herramienta que lo aprovecha es otra cosa, y sigue bloqueada.
Anthropic afirma también que es su modelo más sólido hasta la fecha frente al prompt injection, es decir, el intento de colar instrucciones ocultas dentro de un contenido que el modelo lee. Es un tema que afecta directamente a quien construye agentes que navegan por la web o leen correos: mientras un agente ejecute lo que se encuentra por ahí, el problema existe.
Las novedades que interesan a quien desarrolla
Esta parte los medios la saltan, pero si conectas el modelo por API es la que te hace perder o ahorrar un día de trabajo. Los nombres técnicos que se usan son claude-fable-5-1 y claude-mythos-5-1. Lo que hay que saber:
- El razonamiento está siempre activo y no se desactiva. El viejo parámetro que fijaba un tope de tokens para razonar ya no se acepta y devuelve error: en su lugar se regula el «esfuerzo» en cinco niveles, de bajo a máximo.
- Ya no se puede obligar al modelo a usar una herramienta: la vieja forma de forzarlo ahora da error. Se usa el modo automático más una instrucción explícita.
- No se puede reescribir la conversación pasada sin invalidar el razonamiento ya hecho. Quien haya montado sistemas que modifican el historial tiene que revisarlos.
- Sin carril prioritario: a diferencia de otros modelos de la familia, aquí el nivel de prioridad no está disponible.
- Hace falta la retención de datos a 30 días: quien trabaja con borrado inmediato necesita una autorización expresa, o la petición se rechaza.
Son cambios que rompen el código existente, así que si tienes una integración funcionando no cambies el nombre del modelo un viernes por la tarde.
Dónde se usa ya
Fable 5.1 está disponible ya en la API de Anthropic, en las apps de Claude, en Amazon Bedrock, en Google Cloud y en Microsoft Foundry. También se puede seleccionar dentro de Claude Code, el entorno de terminal para trabajar con código: en el menú de elección del modelo aparece junto a Opus 5 y a Sonnet 5. Mythos 5.1, en cambio, sigue accesible solo a través de los programas de verificación.
La marca de agua invisible en los textos
Junto a los modelos, Anthropic ha introducido una marca invisible en los textos generados, pensada también de cara a la transparencia frente a las normas europeas sobre inteligencia artificial. Es el mismo tema del que escribí al hablar de cómo quitar la marca de agua de IA de Claude, Grok y ChatGPT, con las mismas consideraciones prácticas: sirve para declarar el origen de un texto, no para castigar a quien lo usa.
Mi opinión
Llevo más de diez años trabajando con webs y contenidos, y ya uso estos modelos a diario, así que miro sobre todo dos cosas: qué cambia en el trabajo real y qué cambia en la factura. En el trabajo real, el salto más creíble es el de las tareas largas, donde el modelo tiene que mantener el hilo durante horas sin perderse. Es justo el punto en el que estas herramientas fallaban más y donde una mejora se nota enseguida.
Sobre la factura, en cambio, invitaría a la calma. El titular de «cuesta menos» solo es cierto para un tipo concreto de uso. Si usas Claude desde la app o haces peticiones sueltas, no ahorras nada, porque entrada y salida cuestan exactamente igual que antes. El ahorro es para quien construye agentes que releen el mismo contexto continuamente. Es una jugada dirigida a quien desarrolla, no un descuento general, y merece decirse claro en vez de dejar creer lo contrario.
En conclusión
Una actualización sólida, con un avance real en investigación científica y en tareas autónomas, y una política de precios que empuja hacia el uso agéntico. Las protecciones que se equivocan menos son la novedad más infravalorada, porque tocan la molestia diaria de quien trabaja con temas técnicos. Si desarrollas, mira bien los cambios que rompen el código antes de actualizar. Si eres usuario normal, cambia poco: el modelo es mejor, pero la cuenta sigue igual.
Preguntas frecuentes
¿Qué diferencia hay entre Fable 5.1 y Mythos 5.1?
Es el mismo modelo con protecciones distintas. Fable 5.1 está disponible para todos con los límites activos en ciberseguridad, biología y química. Mythos 5.1 tiene límites más permisivos en esos ámbitos y está reservado a organizaciones verificadas mediante programas de acceso controlado.
¿Cuánto cuesta de verdad y quién ahorra?
Entrada y salida se quedan en 10 y 50 dólares por millón de tokens. Solo baja la lectura desde caché, de 1 a 0,25 dólares. Ahorra quien relee a menudo el mismo contexto, es decir, quien construye agentes: alrededor de un 25% en cargas típicas y hasta un 45% en las muy repetitivas. Quien hace peticiones sueltas no ahorra nada.
¿Es verdad que detecta vulnerabilidades del software?
Sí, pero con una distinción precisa que hace Anthropic: puede usarse para detectar vulnerabilidades, no para desarrollar exploits. Sirve al trabajo defensivo de análisis, no a construir herramientas de ataque.
¿Cuál es la puntuación real en programación agéntica?
En la página oficial, Fable 5.1 obtiene un 55,8% en Terminal-Bench 4.0, frente al 52,3% de Opus 5 y al 42,0% del modelo anterior. El 60,9% que circula por la red pertenece a Mythos 5.1, no a Fable 5.1.
¿Dónde puedo usarlo?
En la API de Anthropic, en las apps de Claude, en Amazon Bedrock, Google Cloud y Microsoft Foundry, y dentro de Claude Code, donde se elige en el menú de modelos.
Si ya tengo una integración, ¿basta con cambiar el nombre del modelo?
No, hay cambios que rompen el código existente: el razonamiento está siempre activo y el viejo tope de tokens ya no se acepta, no se puede obligar al uso de una herramienta y no se puede reescribir el historial de la conversación. Hay que comprobarlos antes de actualizar.
¿Cuánto contexto maneja?
Un millón de tokens de contexto y hasta 128.000 tokens de respuesta, como el modelo anterior. El esfuerzo de razonamiento se regula en cinco niveles, del más bajo al máximo.
Fuentes
- Anthropic: el anuncio oficial con la tabla de benchmarks y los precios.
- Anthropic Newsroom: los anuncios de la compañía.
- El Output: precios, benchmarks y privacidad empresarial.
- ADSLZone: la lectura española del cambio de precios.
- Claude Code: la página oficial de la herramienta de terminal.
GPT-6 Astra y Gemini 3.8 Flash: benchmarks oficiales, precios reales
GPT-6 Astra y Gemini 3.8 Flash: benchmarks oficiales, precios reales y cuál conviene Por Daniele Forciniti En dos días han salido dos…
Agentes IA: la guía completa para construirlos, venderlos y no
Agentes IA: la guía completa para construirlos, venderlos y no quemar el presupuesto Por Daniele Forciniti Los agentes IA son sistemas que…
AWS abre 8 cursos certificación gratis
AWS abre 8 cursos certificación gratis: sin test, solo nube real y la credencial en dos horas Por Daniele Forciniti Amazon ha…
Gestión SEO de la web: la guía avanzada
Gestión SEO de la web: la guía avanzada para cuando lo básico ya no basta Por Daniele Forciniti La gestión SEO de…
15.000 logos gratis en SVG: la colección que te ahorra
15.000 logos gratis en SVG: la colección que te ahorra horas de búsqueda Por Daniele Forciniti Si alguna vez has perdido veinte…
Notion AI: todas las novedades de 2026
Notion AI: todas las novedades de 2026, de los agentes externos a los Workers Por Daniele Forciniti En 2026 Notion AI ha…