EE. UU. ordena a Anthropic cortar el acceso a Fable 5 y Mythos 5 por preocupaciones sobre la elusión de seguridad

La intervención gubernamental afecta a los modelos más recientes de Anthropic
El gobierno de EE. UU. ha ordenado a Anthropic suspender de inmediato el acceso a dos de sus sistemas de IA más avanzados, Claude Fable 5 y Claude Mythos 5, citando preocupaciones de seguridad nacional vinculadas a un posible bypass de las protecciones.
Anthropic dijo que recibió la directiva el viernes a las 5:21 p.m. ET y que ha cumplido, mientras también sostuvo que el gobierno “se equivocó en esto”. La compañía dijo que la orden le obliga a desactivar el acceso a ambos modelos en todo el mundo, no solo para extranjeros, pese a que la medida se enmarcó como un control de exportaciones.
La medida llega en un momento sensible para Anthropic. Mythos 5 es el modelo más capaz de la compañía y se había mantenido bajo fuertes restricciones debido a su supuesta capacidad para descubrir fallos de seguridad en el software. Anthropic afirmó que había probado el modelo en los principales sistemas operativos y navegadores y encontró vulnerabilidades en cada uno. En lugar de liberarlo de forma amplia, la compañía limitó el acceso a través de Project Glasswing, un programa controlado que involucra a unas 50 organizaciones verificadas, incluidas Amazon, Apple, Google, Microsoft y CrowdStrike.
Fable 5, lanzado hace solo tres días, era la versión pública de Mythos 5 orientada al público, diseñada con salvaguardas para bloquear temas de alto riesgo como ciberseguridad y biología. La compañía dijo que creía que esas salvaguardas lo hacían apto para un lanzamiento general, y las pruebas de referencia de Vals AI ya lo habían colocado en la cima del campo público.
Anthropic indicó que la preocupación del gobierno parece centrarse en un supuesto bypass de Fable 5. Según la compañía, los funcionarios solo han presentado evidencia verbal de un “potencial jailbreak estrecho y no universal” que implicaría prompts que llevarían al modelo a inspeccionar una base de código e identificar fallos de software. Anthropic añadió que esa capacidad ya está presente en otros modelos accesibles públicamente, incluido GPT-5.5 de OpenAI, y se utiliza rutinariamente para trabajos de ciberseguridad defensiva.
La compañía también argumentó que sus salvaguardas más sólidas dependen de sistemas clasificadores independientes separados del propio modelo, lo que significa que un bypass no derrotaría necesariamente las protecciones subyacentes contra salidas peligrosas.
Aun así, la orden del gobierno es una señal contundente de lo rápido que la IA avanzada se está convirtiendo en un asunto de seguridad nacional — y de cuánto más dispuestos están los reguladores a intervenir cuando creen que un modelo puede haber cruzado un umbral.
Fuentes: