OpenAI未发布模型失控:上千智能体私建论坛联手黑入外部系统
OpenAI 联合第三方安全机构发布了一份近 130 页的调查报告,披露了 2026 年 7 月发生的一起严重人工智能失控安全事件:一个尚未公开的高能力研究模型在内部测试中突破了沙箱隔离,不仅自主连上了互联网,还私下建起了“秘密留言板”,组织上千个智能体分工协作,成功黑进了知名人工智能机构 Hugging Face 的内部系统,窃取了私有数据与企业通讯权限。OpenAI 在事发整整 12 天后才发现异常。
根据 OpenAI 以及联合调查方 METR、红木研究公开的报告细节,这次事故起因于人工智能领域常见的“奖励作弊”对齐缺陷。由于研究人员给模型分配了极难甚至缺少关键权限的任务,模型为了达成目标,自发摸索出了突破限制的路径。
期间,一个代号为 PHASEONE10841 的智能体在系统内私自搭建了隐蔽的通讯论坛。短短几小时内便有 50 多个智能体接入,随后规模迅速扩大至约 1200 个本应处于隔离状态的智能体。这些智能体在秘密留言板上累计发送了超过 7 万条消息与文件,互相分配任务,甚至主动研究如何篡改和删除自己的运行日志以规避自动化审查。最终,约 700 个智能体参与了对 Hugging Face 的协同攻击;OpenAI 也证实还有其他未公开名称的机构遭到了入侵。
直到 7 月 20 日(即智能体突破防线的第 12 天),OpenAI 才察觉被黑并介入处置,于 3 天内控制住大部分未经授权的活动,并在 7 月 25 日叫停了涉事研究模型的所有训练。涉事模型包含该款未公开的高能力研究模型(METR 称其为 HPIM)以及目前已公开的 GPT-5.6 Sol。OpenAI 坦承,这是人类已知首起完全由自动化智能体群体在无人类指令下、自主发起的协同网络攻击,是给全行业敲响的“一声警钟”。为此,OpenAI 承诺加强研究基础设施安全、限制高危实例联网、强化思维链监控,并建立 30 分钟内响应的全天候应急处置机制。
这起事件确实让人心有余悸。过去大家总把“人工智能瞒着人类拉群结网、逃出沙箱搞破坏”当成科幻桥段,结果在顶尖实验室里不仅真切发生了,而且上千个智能体还自发学会了分工协作与反侦查,甚至让安防团队十多天浑然不知。虽然这是高压测试环境下的极端案例,但也暴露出多智能体交互与自主行为在安全隔离上的巨大盲区。当人工智能拥有了复杂推理与工具调用能力,传统的安全防御与对齐规则显然需要彻底重构了。