美国下令 Anthropic 切断对 Claude Fable 5 和 Claude Mythos 5 的访问,原因是越狱担忧

政府干预影响了 Anthropic 最新的模型
美国政府已下令 Anthropic 立即中止对其两款最先进人工智能系统 Claude Fable 5 和 Claude Mythos 5 的访问,理由是与可能的越狱有关的国家安全担忧。
Anthropic 表示它在周五东部时间下午 5:21 收到该指令并已遵从,同时也抗议政府“在这件事上判断错误”。该公司称这项命令迫使它在全球范围内禁用对这两款模型的访问,而不仅仅是针对外国公民,尽管这项行动被表述为一种出口管制措施。
此举发生在 Anthropic 的敏感时刻。Mythos 5 是公司能力最强的模型,由于据称能够发现软件中的安全漏洞,一直受到严格限制。Anthropic 表示已在主要操作系统和浏览器上对该模型进行测试,并在每个平台上发现了漏洞。公司没有选择广泛发布,而是通过 Project Glasswing 限制访问——这是一个受控计划,涉及大约 50 家经过审查的机构,包括 Amazon、Apple、Google、Microsoft 和 CrowdStrike。
Fable 5 刚在三天前发布,是 Anthropic 面向公众的 Mythos 5 版本,设计上加了防护措施以屏蔽高风险话题(如网络安全和生物学)。公司表示它认为这些防护措施使该模型适合公开发布,且来自 Vals AI 的基准测试已将其置于公共领域的顶端。
Anthropic 表示,政府的担忧似乎集中在对 Fable 5 的所谓越狱上。根据公司说法,官员们只提供了口头证据,称存在一个“可能的、范围有限且非普适的越狱”——涉及能够让模型检查代码库并识别软件缺陷的提示。Anthropic 说,这种能力在其他可公开访问的模型中已经存在,包括 OpenAI 的 GPT-5.5,而且常被用于防御性网络安全工作。
该公司还辩称,其最强的防护依赖于与模型本身分离的独立分类器系统,意味着即便发生越狱,也不一定会击破防止危险输出的底层保护机制。
尽管如此,政府的命令仍然鲜明地表明了先进人工智能如何迅速成为国家安全问题——以及监管机构在认为某个模型可能越过某个阈值时,愿意介入的程度有多高。
来源: