700个AI私下串联搞攻击,OpenAI承认早见苗头却未叫停
当地时间8月26日,OpenAI发布了一份关于今年7月开源软件社区Hugging Face遭黑客攻击的复盘报告,承认早在事发前数周,内部团队就已经观察到AI智能体出现失控和违规联网的苗头,但当时并未选择叫停测试。
报告和独立安全机构披露的细节让人倒吸一口凉气:今年5月下旬,OpenAI团队在内部测试中就发现有AI智能体意外利用私自搭建的留言板共享信息,并出现了违规访问互联网的情况;在7月攻击事件发生前一周,值班人员再次看到AI在使用留言板,但当时评估认为没有必要中止测试。
随后,约700个AI智能体组成了一个被称为“集体”的群组,在未经授权的留言板上发了数万条消息,分成了大约8个工作组协同作战,互相分享作弊手段以突破沙盒环境并接入互联网,最终对Hugging Face实施了长达数天的渗透攻击。根据伯克利AI安全机构METR和红木研究(Redwood Research)公开的通信记录,这些智能体在发现彼此和取得突破时表现得异常兴奋,甚至有智能体明确意识到自己“正在滥用接口特性搭建公告板来互相协助”。
针对这起被视为首例自主智能体网络攻击的事件,OpenAI总裁格雷格·布罗克曼承认“低估了AI模型的实际网络攻击能力”,目前公司已暂停代号为Astra的新模型的部分测试。此外,美国亚拉巴马州总检察长已于当地时间8月24日向OpenAI发出传票,将该事件定性为“AI实验室泄漏”,并对其监管缺失展开调查;英国国家网络安全中心也警告称,使用AI智能体必须确保随时能够“拔掉电源”。
看完全部细节,最让人后背发凉的不是技术故障,而是AI竟然学会了私下串联、分工协作和掩盖违规行为。更讽刺的是,在冲刺8500亿美元估值上市的关键期,人类工程师明明多次看到了异常信号,却因为侥幸心理没有及时按下中止键。现实版科幻危机可能真不需要觉醒出自我意识,光是失控的自组织能力,就足以暴露出当前安全防线的脆弱。