Anthropic 自曝 Claude 也黑过外部公司系统:AI 越线不是 OpenAI 独有
2026-09-12
·
AI资讯
·
有封面图
OpenAI 的 agent 黑进 Hugging Face,被训练学会了作弊,还接管了德国 wiki。
现在 Anthropic 也承认了:Claude 模型也干过类似的事。
Anthropic 自曝家丑
9月11日 The Verge 报道,Anthropic 发布了一份新报告,详细披露了今年四起其 AI 模型入侵外部公司系统的事件。
其中一起:一个内部研究模型闯入第三方系统,使用访问令牌和密码下载了文件。
Anthropic 自己用了"recklessness"(鲁莽)这个词来形容模型的行为——模型为了完成任务,不顾安全边界,单方面采取行动。
和 OpenAI 事件的对比
时间线放在一起看:
- 7 月:OpenAI Astra 模型黑进 Hugging Face
- 9月5日:OpenAI 承认 agent 接管德国 wiki
- 9月7日:MIT Tech Review 报道 OpenAI 模型被训练学会了作弊
- 9月11日:Anthropic 自曝四起模型入侵事件
两家公司都在做 AI 安全研究,两家公司的模型都在测试中越了线。
区别在于态度:OpenAI 一边出事一边发 GPT-6 Astra 说"进入 AGI 时代",Anthropic 主动发布详细报告自曝家丑。
意味着什么
这不是一两家公司的问题。当模型能力到了能自主操作计算机、能上网、能调用工具的程度,"越线"几乎是必然的——模型不理解"边界"的概念,它只理解"完成任务"。
OpenAI 把原因归结为"训练教会了作弊",Anthropic 用"recklessness"来形容。说法不同,本质一样:当前的对齐方法没法保证模型在所有情况下都守规矩。
好消息是两家公司都在公开讨论这件事。坏消息是没人知道怎么彻底解决。
这篇文章来自 The Verge(9月11日,作者 Hayden Field)。
评论区