IA

Anthropic lanza Fable 5.1 con un 75% de reducción en caché y rendimiento agéntico más que duplicado

Susan Hill

Anthropic actualizó Claude con Fable 5.1, reduciendo el costo de los tokens de entrada almacenados en caché de US$1.00 a US$0.25 por millón: una disminución del 75% que llega justo cuando la mayoría de los desarrolladores de IA en producción ha descubierto que la acumulación de contexto, y no el cómputo bruto, es donde realmente se concentran sus presupuestos de infraestructura. En una sesión agéntica activa, una sola conversación con Claude puede mantener en caché cientos de miles de tokens a medida que el contexto se acumula entre turnos. A US$0.25 por millón, esa acumulación pasa a ser una decisión deliberada de diseño, en lugar de un techo de costos que el desarrollador debe sortear.

Los resultados de los benchmarks que acompañan el cambio de precio muestran mejoras de rendimiento que refuerzan el argumento económico. En Terminal-Bench-Science 0.1, que mide el razonamiento científico de varios pasos que requiere diseño experimental y análisis iterativo, Fable 5.1 obtuvo 52.6%, frente al 24.7% de Fable 5: más del doble del resultado anterior. AutomationBench mejoró de 17.1% a 31.4%, y Terminal-Bench 4.0, una evaluación más amplia de capacidades agénticas, subió de 42.0% a 55.8%. CursorBench 3.2.0 alcanzó 73.4%. El patrón en las cuatro evaluaciones es consistente: Fable 5.1 no es marginalmente mejor de forma incremental, sino sustancialmente más confiable en las categorías de tareas que definen el valor agéntico.

El efecto combinado reescribe la aritmética de costos de desarrollar con Claude. Una aplicación agéntica que completa una tarea en menos turnos —porque el modelo es más confiable— consume menos ciclos totales de tokens en el camino hacia un resultado exitoso. Si se aplica el recorte del 75% en caché a los tokens que sí utiliza, la reducción efectiva del costo por tarea en flujos de trabajo agénticos con alta reutilización alcanza 45% o más. Anthropic no ha publicado una cifra única y destacada para el ahorro compuesto, pero los desarrolladores que modelen su propia economía de tokens llegarán a cifras de ese rango para cargas de trabajo intensivas en contexto.

Fable 5.1 está disponible de inmediato a través de la API directa de Anthropic bajo el identificador de modelo claude-fable-5-1, y mediante Amazon Web Services Bedrock, Google Cloud Platform y Microsoft Azure. Anthropic anunció Enterprise Frontier Safeguards como una capacidad simultánea: retención de datos controlada por el cliente, claves de cifrado administradas por el cliente e implementación dentro del tenant de infraestructura en la nube existente de cada cliente, todo ello incluido sin cargos adicionales más allá de los costos subyacentes de la nube.

Junto con el lanzamiento general, Anthropic presentó Mythos 5.1, una variante del mismo modelo subyacente que opera con lo que la compañía describe como salvaguardas más permisivas para organizaciones evaluadas. El acceso está restringido a instituciones verificadas de investigación en ciberseguridad y empresas de ciencias de la vida. La compañía citó aplicaciones demostradas, entre ellas el diseño de aglutinantes de proteínas y la optimización de modelos biológicos, con un rendimiento de inferencia de hasta 2.5 veces el de la versión estándar. El acceso a Mythos 5.1 no es de autoservicio: Anthropic revisa las solicitudes de manera individual y no ha publicado el tamaño de la cohorte inscrita.

Las cifras agénticas de Fable 5.1, particularmente en Terminal-Bench-Science, sitúan los resultados publicados de Anthropic por delante de las cifras divulgadas más recientemente por OpenAI en evaluaciones comparables. Las comparaciones de benchmarks entre empresas exigen cautela metodológica —los proveedores seleccionan evaluaciones que favorecen a sus modelos, y las pruebas específicas destacadas por Anthropic presumiblemente fueron elegidas por sus resultados favorables—. Lo más difícil de descartar es el patrón interno de duplicación: Fable 5.1 no es el mismo modelo con una reducción de precio añadida. El cambio de rendimiento es lo bastante grande como para que la historia de precios y la historia de rendimiento no puedan separarse.

Para los desarrolladores que actualmente no usan Claude, el cambio en el precio de caché es la cifra que vale la pena traducir a su propia economía de tokens. Cualquier proveedor de IA que no se acerque a US$0.25 por millón de tokens almacenados en caché enfrentará ahora preguntas directas de comparación de costos en las conversaciones de ventas empresariales. El precio de caché de Anthropic ya era inferior al de varios competidores antes de esta reducción; la brecha se ha ampliado. Las mejoras de rendimiento son más difíciles de generalizar entre distintos casos de uso, pero en el segmento del razonamiento agéntico y científico, Fable 5.1 establece un nivel de referencia contra el que se medirá el próximo gran lanzamiento de cualquier proveedor.

Etiquetas: , , , ,

Discussion

There are 0 comments.