Ir al contenido principal

Claude Fable 5.1: el recorte del cache read que cambia la aritmética del enrutamiento

Camila Duarte
Camila Duarte1 de septiembre de 202610 min. de leitura
Claude Fable 5.1: el recorte del cache read que cambia la aritmética del enrutamiento

Claude Fable 5.1 llega, y el recorte del cache read es la parte que cambia el enrutamiento

El 1 de septiembre de 2026 Anthropic lanzó Claude Fable 5.1, el nuevo modelo de frontera para coding y trabajo de conocimiento, con el precio del cache read un 75% más barato, a US$ 0,25 por millón de tokens. El efecto va más allá de un modelo más capaz: cambió la forma del costo, y quien enruta cargas largas y agénticas debe recalcular la cuenta. La fuente primaria es el anuncio de Anthropic.

No es una baja en toda la tabla de precios. Fable 5.1 sigue costando US$ 10 por millón de tokens de entrada y US$ 50 por millón de salida, lo mismo que Fable 5. Lo que bajó fue el precio de reutilizar contexto ya procesado, el token de cache read. Como las cargas agénticas releen el mismo contexto decenas de veces, es justamente esa línea la que decide la factura final.

Lo que pasó

Fable 5.1 es el mismo modelo que Claude Mythos 5.1, con salvaguardas distintas: Mythos solo sale por programas de acceso confiable, para ciberseguridad y ciencias de la vida. Fable 5.1 es general, disponible hoy en AWS, Google Cloud, Microsoft Azure y la API de Claude, con el identificador claude-fable-5-1.

Los números que Anthropic publicó el 1 de septiembre de 2026:

  • Cache read a US$ 0,25 por millón de tokens, un 75% menor que el precio anterior.
  • Costo total ~25% menor que Fable 5 en cargas típicas, medido a default effort sobre cuatro semanas de uso real de agosto de 2026.
  • Hasta ~45% menor en cargas altamente agénticas, donde el cache read compone la mayor parte del costo.
  • Indexed cost de Fable 5 = 100; en Fable 5.1, 75 en el típico y 55 en el agéntico.
  • Precio de entrada y salida sin cambios: US$ 10 y US$ 50 por millón de tokens.

En los benchmarks la ganancia de capacidad es mayor que el recorte de precio. En Terminal-Bench-Science 0.1 Fable 5.1 hace 52,6% contra 24,7% de Fable 5. En Terminal-Bench 4.0, 55,8% contra 42,0%. En AutomationBench, 31,4% contra 17,1%. En OSWorld 2.0 strict, 41,7% contra 36,1%. En GDPval-AA v2, 1853 contra 1723. En CursorBench 3.2.0, 73,4% contra 70,5%. Fable 5.1 usa effort alto por defecto en Claude Code y medio en Claude Cowork y Claude.ai.

Por qué importa

El recorte del cache read es la parte del anuncio que atraviesa la cuenta de quien enruta LLM. Un modelo de frontera carga dos líneas de costo muy distintas: el token de entrada nuevo, que cobra US$ 10 por millón, y el token de cache read, que ahora cobra US$ 0,25 por millón. Una carga agéntica lee el mismo bloque de contexto cientos de veces en quince llamadas; el costo real de esa carga está dominado por la segunda línea, no por la primera.

La posición aquí es directa: la baja de precio no hace de Fable 5.1 solo un modelo más barato, remodela la forma de la cuenta. Los enrutadores que cobran todo input token en una sola línea cobrarán mal las cargas agénticas, de más o de menos, porque no ven la línea de cache read que ahora domina. Quien dirige tráfico por volumen de token, en vez de por costo por tarea completada, pierde la mayor parte del ahorro de este lanzamiento.

Para el CFO la cuenta reaparece a fin de mes. Para el CTO aparece en la política de enrutamiento: la tarea que antes no justificaba un agente de larga duración ahora cabe, porque el costo de releer contexto cayó a un cuarto. Para el CEO la señal es de precio: la inteligencia de frontera ya no es el techo que era, y decidir qué modelo sirve cada tarea depende más del diseño del gateway que de la lista de precios.

Qué significa en la práctica el cambio en la composición del costo

Lo que cambia es dónde se concentra la cuenta. Antes, en Fable 5, el costo de una carga agéntica se repartía entre entrada nueva y reutilización de contexto. Con Fable 5.1, el cache read pasó a responder por la mayor parte, pero esa parte cuesta un cuarto del precio anterior, y el resultado es una cuenta total menor. Es un cambio de forma, no de lista.

inline-01.png

La tabla de abajo compara el régimen anterior con Fable 5.1 para quien enruta LLM. Los valores vienen de la fuente primaria de Anthropic, publicada el 1 de septiembre de 2026.

DimensiónAntes (Fable 5)Después (Fable 5.1)
Precio de entrada y salidaUS$ 10 / US$ 50 por millón de tokensIgual: US$ 10 / US$ 50 por millón
Cache readPrecio completo del token de contextoUS$ 0,25 por millón, 75% menor
Costo total, carga típicaIndexed 100Indexed 75, ~25% menor
Costo total, carga agénticaIndexed 100Indexed 55, hasta ~45% menor
Dónde se concentra el costoRepartido entre entrada nueva y reusoDominado por el cache read, ya barato
Capacidad (Terminal-Bench-Science 0.1)24,7%52,6%

La lectura más concreta es la ventana de viabilidad de los agentes. Un agente que hace veinte llamadas al modelo sobre el mismo repositorio paga veinte veces el precio del contexto reutilizado. A US$ 0,25 por millón de tokens de cache read, esa repetición dejó de ser el cuello de botella que era. La misma carga que se descartaba por costo ahora admite un análisis largo y autónomo.

Qué hacer ahora

Revisar la política de enrutamiento es la respuesta, y cabe esta semana, mientras el precio nuevo está fresco y el mercado aún no repreció. Las decisiones de abajo están ordenadas por costo de implementación.

  1. Clasificar la carga por reuso de cache. Antes de enrutar hacia Fable 5.1, separe el tráfico en dos grupos: tareas de lectura única y tareas que releen contexto. El segundo grupo es el que más gana con este lanzamiento.
  2. Medir el costo por tarea completada, con y sin cache. La métrica que responde es el costo total de una tarea terminada, no el precio de un token. Recalcule el break-even de cada tipo de tarea con el cache read a US$ 0,25 por millón.
  3. Revisar la regla de selección de modelo en el gateway. Si la política aún elige modelo por precio por token, cobra mal las cargas agénticas. Pase a elegir por el reuso estimado.
  4. Probar Fable 5.1 en paralelo en un segmento real. Registre la tasa de retorno por tarea y el costo total antes de migrar todo el tráfico, porque la ganancia de capacidad no llega sin validar su carga específica.
  5. Reabrir tareas archivadas por costo. Las cargas de larga duración que salieron del presupuesto con el precio anterior merecen una nueva evaluación, siempre que la lectura repetida de contexto sea la mayor parte del costo.

Preguntas frecuentes

Tres preguntas cierran el recorte. Los valores usan la fuente primaria de Anthropic, leída el 1 de septiembre de 2026.

¿Qué cambió en el precio de Claude Fable 5.1? El precio de entrada y salida no cambió: US$ 10 y US$ 50 por millón de tokens. Lo que cayó 75% fue el precio del cache read, ahora US$ 0,25 por millón de tokens. En cargas típicas el costo total cae ~25%; en cargas agénticas, hasta ~45%, según Anthropic.

¿Por qué es relevante el cache read para el costo? Las cargas agénticas reutilizan el mismo contexto decenas de veces en varias llamadas. El token de cache read cobra ese reuso, y su factura suele dominar el costo final de un agente. El recorte en esa línea es lo que mueve el costo total de las tareas autónomas largas.

¿Esto cambia qué modelo sirve cada tarea? Cambia, porque comparar modelos por costo pasa a depender de la tasa de reuso de contexto de la carga. Para quien enruta LLM, decidir si Fable 5.1 sirve una tarea frente a un comparable no debe apoyarse solo en el precio del token, sino en el costo por tarea completada, medido con y sin cache.

¿Mythos 5.1 es distinto de Fable 5.1? No. Según Anthropic son el mismo modelo con salvaguardas distintas. Mythos 5.1 sale solo por programas de acceso confiable para ciberseguridad y ciencias de la vida, mientras que Fable 5.1 es de disponibilidad general.

¿Es este un lanzamiento de rutina? No. Es la primera vez que un recorte en el precio del cache read de un modelo de frontera remodela la forma del costo y, con eso, desplaza el costo de una carga agéntica hacia una línea mucho más barata. Para quien enruta, es un cambio de tabla con efecto de política.

Referencias y lectura complementaria

Qué esperar en las próximas semanas

El precio del cache read no es una promoción con vencimiento; es la tabla nueva. La prueba de mérito vendrá de cargas reales medidas por costo por tarea, no del ruido de benchmarks. Si el recorte de 75% en el cache read se sostiene en otras familias de modelo, la decisión de enrutamiento gana una dimensión nueva, porque la línea que separa un modelo de otro ya no es el precio del token, sino la capacidad del gateway de distinguir reuso de contexto de lectura nueva. La tabla nueva cambió la regla. Para Nexforce la lectura es directa: cuando un modelo de frontera baja de precio de forma tan desigual entre líneas de costo, la capa que ve esa asimetría y convierte la tabla en una decisión de costo por tarea se vuelve el punto de control. Mantener una capa que decide, por tarea, qué modelo sirve cada carga midiendo el costo real, y no el precio por token, es exactamente lo que hace el Nexforce Router: una API, decenas de modelos, y la elección de ruta basada en el costo completo de la tarea, en lugar de una sola línea de precio.

Nexforce

Acelera la eficienciaoperativa de tu negocio

Diseñamos tecnología de nivel global para impulsar escala del negocio

Hablar con un Especialista

Artículos relacionados