米国が脱獄懸念でAnthropicにFable 5とMythos 5へのアクセス停止を命じる

政府の介入がAnthropicの最新モデルに影響
米国政府は、潜在的な脱獄に関連する国家安全保障上の懸念を理由に、Anthropicに対して同社の最先端AIシステムであるClaude Fable 5とClaude Mythos 5へのアクセスを直ちに停止するよう命じた。
Anthropicによれば、同社は金曜の東部標準時午後5時21分にこの指令を受け、従ったと述べる一方で、政府は「見当違い」をしたと主張している。会社側は、この命令は輸出管理措置として説明されているにもかかわらず、外国籍に限らず両モデルへのアクセスを世界的に無効化することを強制すると述べた。
この決定はAnthropicにとって微妙な時期に下された。Mythos 5は同社で最も高性能なモデルであり、ソフトウェアのセキュリティ欠陥を発見する能力が報告されていたため厳しい制限下に置かれていた。Anthropicはこのモデルを主要なOSやブラウザ上でテストし、それぞれに脆弱性を見つけたと述べている。広く公開する代わりに、同社はAmazon、Apple、Google、Microsoft、CrowdStrikeなど約50の審査済み組織を含む管理下プログラムであるProject Glasswingを通じてアクセスを制限していた。
Fable 5はわずか3日前に公開されたもので、Mythos 5の公開向けバージョンとして設計され、高リスクなトピック(サイバーセキュリティや生物学など)をブロックするガードレールを備えていた。Anthropicは、これらの安全対策により一般公開に適していると考えており、Vals AIによるベンチマークテストでも既に公開分野のトップに位置づけられていた。
Anthropicによると、政府の懸念はFable 5の脱獄の主張に集中しているようだ。会社によれば、当局はモデルにコードベースの検査やソフトウェア脆弱性の特定を促すプロンプトに関する「潜在的で狭い、普遍的でない脱獄」の口頭による証拠しか提供していないという。Anthropicは、そのような能力はOpenAIのGPT-5.5を含む他の公開アクセス可能なモデルにも既に存在しており、防御的なサイバーセキュリティ作業で日常的に使用されていると主張している。
同社はまた、最も強力な安全対策はモデル本体とは独立した分類器システムに依存しており、脱獄が直接的に危険な出力に対する基礎的な保護を無効にするとは限らないと述べた。
それでも、この政府の命令は高度なAIがどれほど急速に国家安全保障の問題になり得るか、そしてモデルがある閾値を超えたと当局が判断する場合に規制当局が介入する意欲がどれほど高まっているかを如実に示すものだ。
情報源: