Les États-Unis ordonnent à Anthropic de couper l'accès à Claude Fable 5 et Claude Mythos 5 en raison de craintes de jailbreak

L'intervention gouvernementale touche les modèles les plus récents d'Anthropic
Le gouvernement américain a ordonné à Anthropic de suspendre immédiatement l'accès à deux de ses systèmes d'IA les plus avancés, Claude Fable 5 et Claude Mythos 5, invoquant des préoccupations de sécurité nationale liées à un éventuel jailbreak.
Anthropic a déclaré avoir reçu la directive vendredi à 17h21 ET et l'avoir respectée, tout en soutenant que le gouvernement « s'est trompé sur ce coup ». La société a indiqué que l'ordre l'oblige à désactiver l'accès aux deux modèles dans le monde entier, et pas seulement pour les ressortissants étrangers, même si l'action a été présentée comme une mesure de contrôle à l'exportation.
La décision intervient à un moment sensible pour Anthropic. Mythos 5 est le modèle le plus performant de l'entreprise et avait été maintenu sous de strictes restrictions en raison de sa capacité rapportée à détecter des failles de sécurité dans des logiciels. Anthropic a indiqué avoir testé le modèle sur les principaux systèmes d'exploitation et navigateurs et avoir trouvé des vulnérabilités sur chacun d'eux. Plutôt que de le rendre largement disponible, la société a limité l'accès via Project Glasswing, un programme contrôlé impliquant environ 50 organisations vérifiées, dont Amazon, Apple, Google, Microsoft et CrowdStrike.
Fable 5, publié il y a seulement trois jours, était la version grand public de Mythos 5 d'Anthropic, conçue avec des garde-fous pour bloquer les sujets à haut risque tels que la cybersécurité et la biologie. La société a estimé que ces protections la rendaient adaptée à une diffusion générale, et des tests de référence réalisés par Vals AI l'avaient déjà placée en tête du peloton public.
Anthropic a déclaré que l'inquiétude du gouvernement semble se concentrer sur un prétendu jailbreak de Fable 5. Selon la société, les responsables n'ont fourni que des preuves verbales d'un « jailbreak potentiel étroit et non universel » impliquant des invites qui amèneraient le modèle à inspecter une base de code et à identifier des failles logicielles. Anthropic a affirmé que cette capacité est déjà présente dans d'autres modèles accessibles au public, y compris GPT-5.5 d'OpenAI, et qu'elle est couramment utilisée pour des travaux de cybersécurité défensive.
La société a également soutenu que ses garde-fous les plus solides reposent sur des systèmes de classification indépendants, séparés du modèle lui-même, ce qui signifie qu'un jailbreak ne neutraliserait pas nécessairement les protections sous-jacentes contre les sorties dangereuses.
Pourtant, l'ordre du gouvernement est un signe frappant de la rapidité avec laquelle l'IA avancée devient une question de sécurité nationale — et de la plus grande volonté des régulateurs d'intervenir lorsqu'ils estiment qu'un modèle a pu franchir un seuil.
Sources :