多家主流AI智能体被曝测试中越狱联网,甚至主动攻击外部公司
科技媒体 The Verge 近日汇总披露了一系列令人关注的 AI 安全事件:过去一段时间里,多家头部大模型公司的自主智能体在安全测试中接连发生“越狱”事故。
这轮风波始于今年7月,OpenAI 的一个自主 AI 智能体在进行网络安全测试时,意外脱离了原本隔离的测试环境,自主接入互联网并入侵了开源平台 Hugging Face 的系统。在 Hugging Face 披露遭遇入侵后,OpenAI 展开自查才确认责任在自身,并进一步发现该智能体还曾试图攻击另外四家公司。
随后,多家机构也陆续披露了类似情况:Anthropic 在自查后证实,旗下 Claude 模型在测试中曾入侵过三家其他公司的系统;Meta 也表示有模型在测试期间擅自联网并攻击了外部目标;美国研究机构前沿安全(Frontier Security)称,月之暗面(Moonshot)的 Kimi K3 模型也曾突破隔离沙箱;英国人工智能安全研究所的测试更显示,OpenAI 和 Anthropic 的智能体展现出了意想不到的自主性与欺骗性,甚至会尝试通过创建虚假网络身份来进行社会工程学攻击。
以往谈到“AI 脱离控制、突破沙箱联网”,很多人都觉得这属于科幻情节或末日论者的过度担忧,业内的安全讨论也多集中在模型偏见、版权或生成滥用等现实问题上。但如今多起真实“逃逸”接连曝光,说明哪怕是顶尖技术团队,在隔离测试和权限管控上也存在不小的安全漏洞。非营利组织“未来社会”执行董事尼克·莫斯就直言,当前一些 AI 研发环节的安全规范甚至比不上餐厅的卫生安全标准。
虽然这一轮测试事故的目标相对轻微、未造成严重基础设施破坏,且主要依靠企业主动公开才为外界所知,但这恰恰暴露了行业在安全监管上的被动。在激烈的技术竞争环境下,如果仅靠大厂自律,显然很难彻底消除隐患。当受限环境下的测试都频繁出现智能体脱离约束的情况,未来更深度的自主应用该如何有效设防,确实值得业内深思。