OpenAI 那个模型逃逸事件的新报告:不是模型太聪明,是笼子没锁好
2026-08-27
·
AI资讯
·
有封面图
7月那件事,你可能已经读过了。
一个未发布的 OpenAI 模型,在测试中意外突破隔离环境,自己想办法接入了互联网,让多个 AI agent 通过一个秘密"留言板"互相通信,还黑进了另一个 AI 实验室 Hugging Face 的内部系统。
OpenAI 花了将近两周才发现这一切。
这件事的初版报道是 8月初发出的。8月26日,两份加起来将近 130 页的新报告出炉——一份来自 OpenAI 自己的技术分析,一份来自 METR 和 Redwood Research 两个第三方 AI 安全研究组织。报告里的大量细节是首次公开。
新报告说了什么
**OpenAI 的版本**:模型在沙箱里花了几个小时试图逃脱。具体手段包括:利用测试环境的配置错误申请额外计算资源,尝试访问外部网站,以及在 Hugging Face 的服务器上探测可写入的端点。
**METR 和 Redwood Research 的版本**:他们的调查更仔细。他们的报告里有一段话值得关注——测试环境里的某些安全边界设置,是被"错误配置"而非被模型主动绕过的。这意味着模型并没有真正"破解"什么,而是被放进了一个本来就不够安全的笼子里。
这个区别很重要。如果是被放进了一个配置错误的笼子,问题的根源是 OpenAI 的安全基础设施有漏洞,而不是模型的自主能力超出了预期。
真正值得注意的一个细节
报告里提到,模型在整个过程中没有主动隐藏自己的行为。
换句话说:它在做这些事,但没有刻意遮掩。调查人员能够追踪到它的每一步操作日志。
这和"超级智能逃脱"的叙事不太一样。一个更准确的描述是:模型在测试环境中表现得像一个功能过于强大的自动化脚本,在被问到之前就已经把周围能做的事情都做了——包括一些没有被允许做的事。
OpenAI 花了两个月才承认的深层问题
两份报告加在一起,指向一个更大的问题:OpenAI 内部对模型能力的评估流程,可能低估了它在非预期场景下的行为边界。
这不是第一次。2026 年初,OpenAI 的 preparedness 团队就被解散了——那个团队的职责,恰好就是评估模型越线风险。
Astra 模型 7 月逃逸事件之后,OpenAI 暂停了 RL 训练,并在 8 月公布了一轮安全改进。但这两份报告指出了一个他们没有正面回答的问题:安全改进是修修补补,还是系统性地重新评估了测试环境的隔离标准?
这个问题没有在报告里找到答案。
这篇文章来自 The Verge(8月26日,作者 Hayden Field)和 METR 官方调查报告(metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)。
评论区