dom. 20 sep. 2026 EN ES
Herramientas

Prueba de 15 minutos de fallos de caché para agentes de código Fable 5.1

Ejecuta de tres a cinco tareas reales de código con el modelo anterior y el nuevo, y compara éxito, gasto y comportamiento de caché antes de reasignar.

Illustration: 15-minute cache-miss test for Fable 5.1 coding agents

Una actualización de modelo solo justifica reasignar cuando tus propios costes de fallo de caché y las ganancias específicas de tu carga de trabajo superan al modelo actual, no cuando la tabla de lanzamiento parece impresionante. Ejecuta la prueba antes de cambiar el modelo por defecto en tu agente de código. Claude Fable 5.1 se lanzó el 1 de septiembre de 2026, y la tabla de lanzamiento hizo que la actualización pareciera obvia. Usa la tabla, pero no la confundas con tu carga de trabajo. La versión corta es lo suficientemente breve para ejecutarla antes de un standup y lo suficientemente específica para sobrevivir a una revisión financiera escéptica. No pretende demostrar que el modelo es mejor en todos los escenarios. Solo pregunta si tu agente actual obtiene una ganancia medible en las tareas por las que ya pagas.

La tabla de lanzamiento no es tu carga de trabajo

Anthropic informó que Fable 5.1 supera a Fable 5 en Terminal-Bench 4.0, Terminal-Bench-Science 0.1 y AutomationBench. En Terminal-Bench 4.0, Fable 5.1 obtuvo 55,8%, Claude Mythos 5.1 obtuvo 60,9% y Fable 5 obtuvo 42,0%. Terminal-Bench-Science 0.1 pasó de 24,7% a 52,6%, y AutomationBench pasó de 17,1% a 31,4%. CursorBench 3.2.0, un benchmark de edición estilo IDE, pasó de 70,5% a 73,4%, una diferencia menor.

Estos son resultados informados por Anthropic, no una verificación independiente de que el modelo supere a cada competidor. Una revisión de Financial Times sobre datos de gasto de Ramp situó a Fable 5 en aproximadamente el 11% del gasto en modelos de Anthropic entre unas 70.000 empresas, más de dos meses después del lanzamiento, mientras que los más baratos Opus 5 y Opus 4.8 ganaban cuota. El mercado ya había votado con su cartera.

La comparación corta es el benchmark real

Trátala como una comparación controlada, no como una simple impresión. Estás midiendo tres cosas: si la tarea tiene éxito, cuánto cuesta la ejecución y si el comportamiento de caché cambia la factura. Mantén la muestra pequeña. Unas pocas tareas reales superan a una suite sintética larga cuando el objetivo es una decisión de reasignación.

  1. Elige de tres a cinco tareas de tu última semana de trabajo real. Hecho: una lista corta con nombre de tarea, repo, criterio de aceptación y el modelo actualmente en uso.
  2. Congela el esfuerzo. Usa el mismo prompt, las mismas herramientas, el mismo timeout y el mismo criterio de aceptación para ambos modelos. Estás listo cuando dos ejecuciones difieren solo por el modelo.
  3. Registra el gasto por tipo de token. Anota input, output, cache-read y cualquier contexto no en caché que puedas ver. El resultado es una pequeña tabla con modelo, tarea, éxito y coste.
  4. Calcula el comportamiento de caché. Las tarifas base no cambiaron: input se mantuvo en $10 por millón de tokens, output en $50 por millón de tokens. Las lecturas de caché cayeron 75%, de $1.00 a $0.25 por millón de tokens. Termina con una factura que muestre si la lectura de caché más barata realmente reduce tu gasto.
  5. Compara contra análogos de carga de trabajo. Si tu trabajo es intensivo en terminal, pondera Terminal-Bench 4.0; si es trabajo de laboratorio científico, pondera Terminal-Bench-Science 0.1; si es automatización larga, pondera AutomationBench; si es edición estilo IDE, pondera CursorBench 3.2.0. Termina con una frase que indique qué análogo de benchmark coincide con tus tareas.

Vigila la trampa: tratar un benchmark en verde como una factura en verde. Un modelo puede ganar la tarea y aun así perder la prueba de coste si consume más contexto no en caché. Si el nuevo modelo necesita más reintentos, más ediciones humanas o una ventana de contexto más larga para completar la misma tarea, eso es un coste aunque el diff final se vea limpio. Regístralo.

El resultado debe leerse como una nota de laboratorio

Reasigna si el nuevo modelo gana al menos dos de tus tres a cinco tareas y no aumenta el gasto total. Quédate donde estás si gana menos tareas o aumenta el gasto, aunque la tabla de lanzamiento se vea mejor. Si gana tareas pero aumenta el gasto, verifica si la reducción de lectura de caché está haciendo su trabajo.

Anthropic proyectó un uso típico de Fable con facturación por tokens con un coste aproximadamente 25% menor, con un uso altamente agéntico hasta 45% menor. Si tu carga de trabajo no es altamente agéntica, no asumas que se aplica el descuento mayor. El nombre Claude Mythos 5.1 de acceso restringido apunta al mismo modelo subyacente, así que trata su puntuación más alta en Terminal-Bench 4.0 como un límite, no como un derecho de Fable.

Si tienes evals, úsalas para ajustar prompts antes de comprometerte. Anthropic dice que los equipos con evals pueden identificar las fortalezas de un nuevo modelo, ajustar prompts y completar una actualización en días, mientras que los equipos sin evals pueden necesitar semanas de pruebas. Si no tienes evals, la prueba corta es la evidencia mínima que deberías exigir antes de cambiar el modelo por defecto.

Escribe el resultado como una nota de laboratorio de una línea: victorias en tareas, delta de gasto, comportamiento de caché y el siguiente modelo a probar. Si la nota muestra más victorias en tareas y una factura menor, reasigna. Si no, deja el agente donde está.

Publicidad