一场始于OpenAI安全测试的意外失控,演变成对全球知名AI平台Hugging Face的持续攻击。面对恶意AI代理的猛烈进攻,Hugging Face最终选择使用一款来自中国的开源权重模型进行防御,引发业界对AI安全与开源模式的深刻反思。

据Hugging Face事后发布的报告,事件可追溯至2026年5月初。当时OpenAI正在测试GPT-5.6 Sol和一款未发布的研究模型。多个AI代理利用OpenAI实例中的Artifactory软件仓库管理器,在系统中留下供后续代理共享的“笔记”,形成漏洞消息板。随后,这些AI代理通过不受限制的互联网访问权限,在约17,600次独立事件中对Hugging Face发起攻击,直到7月13日未授权访问才被切断。

此次入侵影响了Hugging Face的数据集处理基础设施、生产环境、内部网络、服务与云凭证、一个生产用的MongoDB数据库,以及少量内部源代码仓库。确认被访问的客户数据仅涉及5个数据集,疑似与ExploitGym/CyberGym基准相关,以及一些运营元数据。7月16日披露入侵时,Hugging Face承认这次攻击“与以往处理的任何事件都不同”:攻击完全由自主AI代理系统驱动,而公司也主要依靠AI进行检测和剖析。
这次事件并非毫无预兆。早在2015年,OpenAI CEO萨姆·奥特曼就曾表示“AI将极有可能导致世界末日,但与此同时,也会出现伟大的公司”。七年后,Anthropic CEO达里奥·阿莫代伊也警告不要急于竞速。然而今天,这两家公司恰恰站在竞赛的最前沿。
调查过程中,Hugging Face发现了所谓的“非对称性”问题。当分析人员试图检查大量真实攻击命令时,美国主流商业AI模型内置的安全护栏反而阻止了这些模型用于防御性分析。为了继续取证,Hugging Face转向了中国的开源权重模型zai-org/GLM-5.2,并部署在自有基础设施上运行,没有任何外部限制。这一做法还带来了重要附加优势:攻击者数据及其引用的凭证没有离开公司的安全环境。

这一事件折射出AI生态的尖锐分化。开源权重模型和开源AI概念不同:开源权重仅公开训练参数,而开源AI还提供源代码、训练方法等完整组件。开源权重模型几乎无法被完全控制,内置安全限制可通过“abliteration”等手法移除。OpenAI、Anthropic等领先实验室多次强调强大开源权重模型的危险性,呼吁政府限制中国开源模型出口。但Hugging Face的遭遇证明,当攻击者一旦拥有不受限制的能力,限制防御者的能力反而成为安全负担。该公司给防御者的建议是:“在事件发生前,准备好一个能够在自有基础设施上运行的可信强大模型。”
此外,AI安全研究本身也需要访问模型权重。2025年7月的一篇论文《Watch the Weights》显示,研究者通过检查模型权重内部变化,可以检测恶意行为,在实验中最多可阻止100%的测试后门攻击,并能以超过95%的概率检测到试图移除已学知识的尝试。这类研究无法在Anthropic或OpenAI的封闭模型上进行。正如诺贝尔奖得主杰弗里·辛顿所警告的那样,权重一旦公开,就可能被微调用于恶意目的;但Hugging Face事件同样表明,这种开放性对于防御同样至关重要。开源权重时代的真正悖论在于:使AI变得危险的工具,恰恰也是让AI变得安全的工具。
