- 0
- 546 palabras
Anthropic presentó el 1 de septiembre de 2026 Claude Fable 5.1 y Claude Mythos 5.1, dos versiones del mismo modelo base con distinto nivel de salvaguardas. Fable 5.1 quedó disponible para usuarios Pro, Max, Team y Enterprise; Mythos 5.1 opera por invitación para organizaciones verificadas. El anuncio movió el tablero, pero la letra pequeña está en las métricas.
En Terminal-Bench-Science 0.1, Fable 5.1 obtuvo 52.6 por ciento, frente a 24.7 por ciento de Fable 5. El resultado más que duplica al antecesor en una prueba de investigación científica con herramientas. No significa que resuelva dos veces más problemas en cualquier laboratorio: describe esa evaluación concreta.
En Terminal-Bench 4.0, dirigido a programación en terminal, Fable 5.1 llegó a 55.8 por ciento contra 42.0 por ciento de Fable 5: 13.8 puntos más. La comparación mide progreso interno, pero no sustituye pruebas con el código, datos y herramientas de cada empresa.
Mythos 5.1 alcanzó 60.9 por ciento en la misma prueba. La diferencia frente a Fable 5.1 no proviene de otro modelo base, sino de salvaguardas más permisivas para tareas verificadas. Es el mismo motor con distintas reglas de circulación, y la ruta cambia lo que puede completar.
Una tabla reproducida por cobertura especializada colocó a GPT-5.6 Sol en 37.3 por ciento en Terminal-Bench 4.0. El dato permite comparar, pero no crea una liga universal: los puntajes cambian con esfuerzo, arnés, herramientas e intentos.
El precio de lista se mantuvo en 10 dólares por millón de tokens de entrada y 50 de salida. La lectura de caché bajó de 1 dólar a 0.25, una reducción de 75 por ciento. Anthropic estima ahorros de 25 por ciento en cargas típicas y hasta 45 por ciento en flujos agénticos.
La cuenta cambia al usar máximo esfuerzo. Un análisis citado por The Decoder, con datos de Artificial Analysis, calculó 1.7 veces más tokens de salida que Opus 5 y 3.76 dólares por tarea, frente a 2.34. ¿La rebaja es real? Sí para ciertas cargas con caché; no necesariamente para cada tarea.
### Seguridad, trazabilidad y uso editorial
Anthropic también anunció una marca de agua estadística invisible para el texto. Sostiene que no cambia la calidad, no agrega caracteres ocultos ni identifica al usuario. Su función es estimar si Claude participó en la redacción, no probar por sí sola quién escribió.
Para medios, la detección tiene límites: una muestra corta puede ser insuficiente y una corrección ligera quizá no deje señal clara. No es un semáforo de verdad o mentira, sino una pista técnica que exige revisión humana.
En la API, el identificador es `claude-fable-5-1`, con contexto de 1 millón y salida máxima de 128 mil tokens. El uso forzado de herramientas devuelve error y editar turnos anteriores invalida bloques de razonamiento. Conviene probar antes de migrar producción.
El retiro no está previsto antes del 1 de septiembre de 2027. Para una redacción no basta un porcentaje: hay que comparar precisión, latencia, consumo, seguridad y costo por tarea. La cifra más llamativa es 52.6; la pregunta útil es cuánto trabajo verificable entrega por dólar y bajo qué reglas.
