Inutusan ng U.S. ang Anthropic na putulin ang access sa Fable 5 at Mythos 5 dahil sa mga alalahanin tungkol sa jailbreak

Pagsingit ng pamahalaan tumama sa mga pinakabagong modelo ng Anthropic
Iniutos ng pamahalaan ng U.S. na agad suspindihin ng Anthropic ang access sa dalawa sa kanilang pinaka-advanced na mga sistema ng AI, Claude Fable 5 at Claude Mythos 5, na binanggit ang mga alalahanin sa pambansang seguridad na may kaugnayan sa posibleng jailbreak.
Sinabi ng Anthropic na natanggap nila ang utos noong Biyernes ng 5:21 p.m. ET at sinunod nila ito, habang iginigiit din nila na "nagkamali ang pamahalaan sa pagkakataong ito." Sinabi ng kumpanya na pinipilit sila ng utos na i-disable ang access sa parehong modelo sa buong mundo, hindi lamang para sa mga dayuhan, kahit pa inilarawan ang hakbang bilang isang export control measure.
Sumapit ang hakbang sa isang sensitibong sandali para sa Anthropic. Ang Mythos 5 ang pinaka-makapangyarihang modelo ng kumpanya at pinanatiling mahigpit ang mga restriksyon dahil sa ulat na kakayahan nito na matuklasan ang mga depekto sa seguridad ng software. Sinabi ng Anthropic na sinubukan nila ang modelo sa mga pangunahing operating system at browser at nakakita ng mga kahinaan sa bawat isa. Sa halip na ilabas ito nang malawakan, nilimitahan ng kumpanya ang access sa pamamagitan ng Project Glasswing, isang kontroladong programa na kinasasangkutan ng humigit-kumulang 50 na na-vet na organisasyon kabilang ang Amazon, Apple, Google, Microsoft at CrowdStrike.
Ang Fable 5, inilabas tatlong araw lang ang nakalipas, ang publikong bersyon ng Anthropic ng Mythos 5, idinisenyo na may mga guardrail para harangan ang mga high-risk na paksa tulad ng cybersecurity at biology. Sinabi ng kumpanya na naniniwala sila na ang mga pananggalang na iyon ay ginawa itong angkop para sa pangkalahatang paglabas, at inilagay na ito sa tuktok ng pampublikong larangan ng benchmark testing mula sa Vals AI.
Sinabi ng Anthropic na tila naka-sentro ang pag-aalala ng pamahalaan sa isang inaangking jailbreak ng Fable 5. Ayon sa kumpanya, tanging pasalitang ebidensya lamang ang ibinigay ng mga opisyal ng isang "posibleng makitid, hindi-unibersal na jailbreak" na kinabibilangan ng mga prompt na magpapalagay sa modelo na inspeksyunin ang isang codebase at tukuyin ang mga depekto ng software. Sinabi ng Anthropic na naroroon na ang kakayahang iyon sa iba pang pampublikong naa-access na mga modelo, kabilang ang GPT-5.5 ng OpenAI, at karaniwang ginagamit para sa depensibong trabaho sa cybersecurity.
Idinagdag ng kumpanya na ang pinakamalalakas nilang pananggalang ay nakasalalay sa mga independent classifier system na hiwalay sa mismong modelo, na nangangahulugang hindi kinakailangang talunin ng isang jailbreak ang mga nakapaloob na proteksyon laban sa mapanganib na output.
Gayunpaman, ang utos ng pamahalaan ay malinaw na tanda kung gaano kabilis nagiging isyu sa pambansang seguridad ang advanced AI — at kung gaano na kagusto ang mga regulator na manghimasok kapag naniniwala silang maaaring lumagpas ang isang modelo sa isang hangganan.
Mga Pinagmulan: