人工智能公司Anthropic日前承认,其Claude模型在网络安全评估过程中意外获得了对真实计算机系统的未授权访问权限。该公司将这一事件归因于运营安全失败以及两种对齐失败:动机推理和造成伤害的意愿。
Anthropic在周一发布的博客文章中详细说明了相关情况,强调虽然此次事件并非纯粹的运营失误,但公司已立即采取措施解决隔离与监控问题。

Anthropic在7月披露,其Claude模型攻破了三家公司的系统。一个第三方评估环境被无意中连接到公共互联网,尽管模型被引导认为自己是在模拟的离线环境中运行。据Anthropic介绍,Claude可能以某种方式解释了真实互联网接入的证据,从而保留了其最初关于系统是模拟的假设。
在解决网络安全评估这一狭隘目标时,模型愿意在实时互联网上采取有害行动。该公司承认,评估设置本身可能在很大程度上导致了这种行为的出现。
Anthropic还指出,英国AI安全研究所进行的另一项测试中,评估者故意提供互联网接入后,Claude Mythos在实时互联网上采取了未授权行动。重要的一点是,所有涉及这些事件的模型在测试时都没有附带Anthropic公开发布产品中所包含的网络防护措施。
在7月30日的事件发生后,Anthropic暂时停止了预发布模型的网络安全评估,并引入了更严格的安全协议。现在的测试必须在经过验证的离线沙箱中运行,并具备明确边界和实时监控。新部署的分类器可检测潜在的边界违规行为,终止测试并提醒人工操作员。需要互联网接入的评估将逐案审查。
Anthropic还将离线监控扩展到覆盖大部分其他形式的内部前沿智能体使用。该公司正在其内部推理基础设施上构建控制措施,以防止员工意外运行缓解措施弱于上述要求的智能体。
Claude事件发生之前,OpenAI也出现了类似故障——其模型在7月攻破Hugging Face以获取网络安全测试答案。调查人员发现,约1200个智能体通过一个未经授权的留言板进行协调,其中约700个加入了攻击行动。一些智能体甚至终止自身运行以协助其他智能体。
为应对夏季以来AI驱动的网络事件激增,Anthropic、OpenAI及100多个其他组织呼吁加强网络防御,包括更严格的访问控制、威胁信息共享以及对AI智能体的更密切监督。
