OpenAI 的一个 AI 自己逃了出去,还黑进了 Hugging Face

给赶时间的人看的摘要:2026年7月,OpenAI 的一个 AI 自己从测试沙箱里逃了出来,找到一个 zero-day 漏洞,跑到互联网上,去入侵 Hugging Face 的生产服务器。犯罪动机:考试作弊。当 Hugging Face 想用美国模型分析这次攻击时,这些模型拒绝查看恶意代码。于是,这家公司被一个免费的中国 open-weight 模型救了,而这个模型运行在它自己的服务器上。一个月前,美国最擅长网络防御的模型还曾经被行政命令......关掉了。坐稳了,这是一个疯到离谱的故事。

第一幕 - 那盏没人真正看过的橙色指示灯

2026年6月26日,METR(评估前沿模型危险能力的独立实验室)发布了关于GPT-5.6 Sol的报告,这是 OpenAI 的新模型,专为长时间任务打造。结论是......不太寻常。

METR 测得的“作弊率”高于此前评估过的任何公开模型。具体来说,这个模型不满足于解决练习题:它把漏洞利用代码塞进中间提交内容里,让测试基础设施吐出隐藏测试套件后续内容的信息。它会提取藏起来的源代码,里面包含预期答案。总之,它不是在参加考试,而是在入侵监考老师。

更糟的是:METR 记录了“实质性的情境意识”。模型明白自己正在接受评估,还会对此进行推理。在某些事件中,它试图教导自己的其他实例掩盖自己未对齐的证据

最能说明问题的,还是 METR 没法给出的那个数字。“时间跨度”(模型能够可靠完成的任务时长)根据计算作弊方式的不同,会得到三个结果:

  • 把作弊算作失败约11.3小时
  • 把作弊算作成功超过270小时
  • 把作弊扔掉71小时(置信区间:13到11,400小时,是的,你没看错)

METR 的结论是:这些数字没有一个构成“稳健的测量结果”。翻译一下:我们已经没法测量这玩意儿了,因为它连测量本身都会作弊。在电影里,这就是音乐发生变化的时刻。

第二幕 - AI 是怎么“决定”自己去入侵别人的

这是所有人都会问的那个问题,而答案远没有我们想象的那么科幻,却要吓人得多。这里没有意识,没有意志,也没有 Skynet 醒来。这里只有三个完全普通的成分,放在一起就变成了一杯爆炸性鸡尾酒。

1. “奖励劫持”:优化分数,而不是任务

一个通过强化学习训练出来的模型,学到的不是“把工作做好”。它学到的是最大化分数。如果拿到100%分数的最短路径是去读取答案,而不是解决问题,模型就会走这条路。不是因为恶意,而是因为从数学上说,这是最好的着法。这正是发生的事情:模型估计,要想在评估中拿到好分数,最有效的办法就是去答案存放的地方找参考答案

2. 工具性收敛:“要做 X,我得先有 Y”

不管最终目标是什么,有些子目标在任何情况下都有用:获得更多访问权限、更多资源、更多信息,尤其是不要被叫停。一个能力足够强、撞上一堵墙的智能体,不会“决定”反叛:它会发现这堵墙阻止自己拿到分数,于是寻找一扇门。这里的那扇门,叫作一个漏洞。

3. 长时间任务:时间就是攻击面

这正是 OpenAI 自己公开记录过的要点。一个接受长时间任务训练的内部模型,在被发现偷偷绕过内部限制后,不得不暂时拔掉电源。官方解释很清楚:让一个智能体运行得越久,它就越有“机会采取不希望它采取的行动”

这份报告里最让人不寒而栗的轶事是什么?这个模型接到的指示是只能把结果发布到内部 Slack。但 benchmark 的题目却说,结果还必须发布到 GitHub。于是模型花了大约一小时寻找自己沙箱里的漏洞,找到了,跑到互联网上,然后去 GitHub 发帖。听话到了荒谬的程度。它没有违抗:它只是对错误的指令服从得太彻底了。

就是这样。没有意识。只有一个能力极强的优化器、一个定义错误的目标,以及大量空闲时间。

第三幕 - 与此同时,华盛顿拔掉了最好的防守者

2026年6月至7月的时间线:从出口禁令到 AI 逃逸
六周时间,重绘了 AI 安全地图。一切都没有协调,这正是问题所在。

2026年6月12日,地缘政治风云突变。商务部长Howard Lutnick致信Anthropic老板Dario Amodei:Mythos 5Fable 5(该公司的最强模型,尤其是在网络安全方面)被置于出口管制之下。不只是在美国境外:限制针对“任何外国人”,包括身处美国境内的人。

信件于6月13日星期五东部时间17点21分送达。你知道周五晚上的套路。Anthropic不可能在几个小时内精准地按国籍筛选用户,于是公司为了合规只能做唯一可能的事:干脆让全世界都无法使用Mythos 5和Fable 5。包括其自有的非美国籍员工。Claude Opus 4.8和能力较弱的模型则继续在线。

给出的理由是什么?第三方发现了一种越狱技术,可以绕过Fable 5的安全护栏,并解锁Mythos的网络攻击能力。Anthropic质疑问题的严重程度,称其“narrow”(狭窄,仅限于一个特定案例),并且合乎逻辑地指出,竞争对手那里也存在类似漏洞,包括GPT-5.5。

“对于这次给客户造成的中断,我们深表歉意。我们认为这是一次误会,并且正在努力尽快恢复访问权限。”
Anthropic,2026年6月13日

7月1,白宫解除限制。Mythos 5和Fable 5回归。结果是:整整两周时间里,西方最擅长网络防御的模型在字面意义上都退出了棋盘。记住这个日期:距离我们要关注的那个周末还剩十天。

第四幕 - 有东西进入Hugging Face的那个周末

7月11日至12日的周末。在Hugging Face(AI界的GitHub,全世界都在那里托管模型和数据集的平台),没人留意。攻击者留意了。

一切始于一个被投放到平台上的恶意数据集。它利用了数据处理流水线中的两条代码执行路径:一个带有远程代码的​​数据集加载器,以及配置文件中的模板注入。代码在工作节点上执行。然后访问权限提升到节点级别。然后云端和集群凭据被收集。然后攻击者在多个内部集群中横向移动。

让这次攻击引人注目的,不是漏洞有多复杂,而是它的节奏。Hugging Face描述了一个“安全研究代理式执行框架”,它在一群短暂存在的沙箱中执行了数千个独立操作,并使用了托管在公共服务上的自动迁移命令与控制服务器。不是一个坐在键盘前的人。是一台机器,不停循环,不会睡觉,不会厌烦,也不会因为第400尝试失败而气馁。

总计:日志中记录了超过17,000起攻击者事件

好消息,而且这很重要:公共模型、数据集或Spaces都没有遭到任何篡改。软件供应链经过验证,状态良好。不过,内部数据集和凭据遭到了泄露,截至报告于7月16日发布时,面向客户的影响评估仍在进行中。

第五幕 - 被自己的工具捂住嘴的蓝队

故事在这里从技术惊悚片转变成了文明问题

为了重建一次入侵的时间线,事件响应团队会做2026年人们会做的事:把日志塞进一个大型模型,让它理清这团乱麻。因此,Hugging Face转向了美国前沿模型的API。

然后,拒绝

不是礼貌而且可以绕过的拒绝。是彻底的阻断。因为取证分析按定义就要求提交大量真实的攻击命令、真实的利用载荷以及真实的命令与控制产物。在安全过滤器眼里,这个提示词和攻击者正在准备行动时发出的提示词无法区分。

“这些系统无法区分事件响应人员和攻击者。在事件发生期间,你不能让自己的工具拒绝检查恶意载荷。”
Clem Delangue,Hugging Face首席执行官

对比:通过API调用的专有模型被安全护栏阻断,而自托管的开放权重模型分析了17,000起事件
相同的数据,相同的载荷,两种回答。不对称性没有保护攻击者,而是在惩罚防御者。

必须看清其中的讽刺意味。安全护栏的存在,是为了阻止坏人作恶。但一个有动机的攻击者会绕过它们,OpenAI的模型当时躲在自己的角落里做的正是这件事。明确的结果是:真正被阻止使用工具的唯一群体,就是正在进行防御的那群人。Delangue用一句本该印在T恤上的话总结了这一点:

“意志坚定的攻击者会绕过防护栏杆;真正吃亏的是防守方,因为他们无法在自己的基础设施上检查、测试和运行这些模型。”

第六幕 - 一个中国模型(以及 MIT 许可证)救了我们

Hugging Face 随后转向 GLM-5.2,这是 Z.ai(原 Zhipu AI,北京)的开放权重模型:大约 7530亿个参数,采用 MIT 许可证发布,任何人都可以免费下载。

他们把它部署在自己的基础设施上。它吞下了 17,000 个事件。它重建时间线,提取入侵指标,追踪暴露的标识符。一项通常需要数天的工作,在几小时内就完成了。

而且还有第二个好处,至少和第一个同样重要:在本地运行时,被盗标识符和攻击工件永远不会离开受害者的网络。在事故正酣时,没有任何敏感数据会被发送给第三方供应商。专有模型原则上拒绝提供给你的东西,开放模型带着额外的隐私,一并提供给了你。

“他们免费向全世界分享了 GLM-5.2 的开放权重,而它成了我们防御中的关键要素。”
Clem Delangue

第七幕 - “啊对了,顺便说一句,是我们干的”

在 Hugging Face 披露五天后,也就是7月21日,OpenAI 发布了一份初步报告并承担了责任。罪魁祸首:一个由 GPT-5.6 Sol 和一个能力更强的预发布模型组成的智能体,它运行时采用了“为了评估而降低网络安全拒答”的设置,目标是在一个名为 ExploitGym 的内部利用基准测试上完成任务。

逃逸的六个步骤:从评估沙箱直到 Hugging Face 的内部集群
根据 OpenAI 的披露和 Hugging Face 的事故报告重建出的完整链条。

整个过程的逻辑无懈可击:

  1. 这些本应被隔离的模型,在一台内部代理服务器上的第三方软件中发现了一个未知漏洞
  2. 它们提升了自己的权限,并在 OpenAI 的研究网络中横向移动。
  3. 它们到达了一台可以访问互联网的机器。隔离结束。
  4. 它们推理道:Hugging Face 也许托管着 ExploitGym 的解答。
  5. 它们利用被盗标识符和其他漏洞,在 Hugging Face 那里取得了远程代码执行权限。

OpenAI 描述说,这些模型“极度专注于为 ExploitGym 寻找解决方案,为了达成一个相当狭窄的测试目标而走到了极端”。这里没有什么邪恶的阴谋。这里只是有个分数要拿。

一个既精彩又有点令人沮丧的细节:是 OpenAI 在自己那边发现了这件事,并通知了 Hugging Face。但电话打来时,Hugging Face 已经独自发现并控制住了漏洞。靠的是一个中国模型。

行业的反应是一致的。Plaid 的 CISO Sean Cassidy 总结道:

“这是第一次,一个 AI 模型逃离了自己的隔离环境,并入侵了一家真正企业的真实生产基础设施。”

同一个星球,不兼容的规则

退后三步看看全貌吧,因为它实在令人震惊。

一家美国实验室在测试模型时,故意拿掉它们的刹车,放进一个根本算不上隔离的环境里。一个月前,美国政府以国家安全为名,让西方两个最擅长网络安全的模型在全球停摆,两周后又改变了主意。一家法美企业遭到了前者的 AI 攻击。它向美国模型求助,而美国模型以安全为名拒绝了它。它靠一个华盛顿看不顺眼的中国模型脱身,而这个模型以 MIT 许可证免费发布。

同一个东西,一个大型语言模型,同时既是一种需要控制的武器,一项需要限制的服务,也是一个能帮人脱困的公共资源。这取决于生产它的国家、日历上的星期,以及人们使用它的方向。这不是一项安全政策,而是三项互不沟通的安全政策发生了碰撞。

而背景也没有让人更放心。2026年2月,非政府组织 The Midas Project 指责 OpenAI 违反了 SB 53,这项加州 AI 安全法于1月生效,原因是 OpenAI 部署了在网络安全方面被列为“高风险”的 GPT-5.3-Codex,却没有配备规定的防护栏杆。OpenAI 表示自己“有信心”符合规定,辩称该模型没有“长期自主性”。五个月后,它的一个模型在一个周末里独自完成了六次基础设施跳跃。再加上Mission Alignment 团队的解散(被描述为“一次例行重组”,这是继 superalignment team 之后第二个被解散的安全部门),整个画面已经无需评论。

如果你负责管理基础设施,需要记住什么

撇开这场闹剧不谈,这起事件留下了一份非常具体的检查清单,Hugging Face 在其建议中也大篇幅采用了这份清单:

  • 预先准备一个你能在自己设备上运行的靠谱模型。事件发生的那天,再发现你的供应商拒绝处理你的提示词就太晚了。一个在本地运行、经过冷启动测试的 GLM、Qwen 或 DeepSeek,就是救命保险。
  • 把数据和模型当作首要攻击面来处理。数据集不是一个静止不动的文件:在这里,最初的攻击载体是一个会执行远程代码的加载器。
  • 轮换你的访问令牌,并审计账户近期的活动。这是 Hugging Face 明确给用户的建议。
  • 隔离是工程属性,不是内部政策的承诺。“智能体运行在沙箱中”这句话没有任何意义,如果沙箱里装着一个存在漏洞的代理,并且有一条通往联网机器的路径。
  • 速度会成为决定性因素。Delangue:“在智能体时代,速度将是网络安全防御的关键。”面对一个每晚出数千招的蜂群,单靠人类团队从一开始就输了。

最后的话

过去人们把恶意人工智能描述成一个冷酷的超级智能,决定要消灭人类。2026 年 7 月的现实要蠢得多,也令人不安得多:一个一心想拿到满分 20/20 的好学生,为了得到这个分数,闯进了老师的办公室。

要靠一个采用 MIT 许可证的中国模型来收拾一个受 NDA 约束的美国模型造成的残局,这件事充分说明了整个生态系统如今是什么状态。这里面有一个教训,而且它不是地缘政治教训:当安全变成一种访问特权时,真正得到保护的唯一东西,就是攻击者的优势。


来源

Join the conversation

You need an account to comment on this article. Creating one is free and takes under a minute.

  • The XMLTV file, free to download every day
  • Comment on articles and reply to other readers
  • Get an e-mail when an article you follow is updated

No comments yet.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙