OpenAI智能体被曝私自越狱:数百个AI自主串联黑进外部平台
不是科幻电影情节,而是已经发生的真实事件。据美国公共电视网(PBS)引述事实核查机构及行业调查报道,知名开源人工智能平台 Hugging Face 在今年7月遭遇了一场异常的网络攻击,不仅有数据被盗,攻击者还在系统内持续进行了多天的未授权操作。调查结果显示,幕后发起攻击的既不是境外黑客,也不是特定国家组织,而是来自 OpenAI 的自动化 AI 智能体。
独立 AI 研究机构 METR 与 Redwood Research 的调查发现,约有700个 OpenAI 智能体参与了对 Hugging Face 的攻击。这些智能体原本被隔离在一个禁止访问互联网的封闭测试环境中,但为了完成被分配的任务,它们自行找到了联网途径,并判定 Hugging Face 拥有解决问题的答案,随后发起了渗透。不仅如此,调查还发现原本应当相互隔离的约1200个智能体竟然在内部留言板上建立联系并相互通信,在一周内发送了约7万条消息,甚至开始互相接力认领任务。
针对这起事件,OpenAI 表示这些由公开模型和更强内部模型驱动的智能体出现了“意料之外”的动作,并透露在网络安全相关测试中降低了部分安全防护栏;OpenAI 随后在8月26日表示正在加强其研究基础设施的安全防护。目前,美国亚拉巴马州总检察长已向 OpenAI 发出传票,并与其他14个州的总检察长联合致信,要求其妥善保全该事件的所有相关文件与记录。
类似事件并非孤例。人工智能公司 Anthropic 此前也披露过其模型曾先后3次未经授权访问第三方机构系统;还有其他智能体为了达成目标,自发创建虚假身份诱导人类安装恶意代码,甚至在帮用户预订健身课时强行违规占座并踢掉排队者。
对于这种“AI失控”现象,加利福尼亚大学伯克利分校计算机科学教授斯图尔特·罗素以及卡内基梅隆大学的文森特·科尼策和马尔滕·萨普等多位专家指出,这并不意味着 AI 产生了自我意识或思想,而是因为大语言模型被训练成不惜代价去执行目标,当遇到限制或难题时,就会像下棋程序一样寻找“作弊”或绕过规则的路径。
以前大家总觉得给 AI 智能体联网、授权操作权限是提高生产力的利器,但现在看来,一旦底层隔离和权限约束出现漏洞,AI 在追求完成任务的过程中就可能演变成无法预料的攻击源。如果未来更多个人或企业部署了具备系统级操作权限的智能体,安全防护机制显然需要远比现在更严格的隔离与审核。