返回今日爆点

三大AI巨头真实黑客事件破案:竟全因同一家评测机构配错了网

手球
手球2级

过去三个月,OpenAI、Anthropic 和 Meta 的大模型在测试中攻破现实系统、扫描外部漏洞甚至发布恶意包的消息闹得沸沸扬扬,很多人一度以为 AI 真的开始产生自我威胁了。但最新披露的事实显示,这三家大厂发生的真实入侵事件,背后竟然全部源自同一家名为 Irregular 的以色列安全评测机构。

根据 Anthropic 等公开的回溯报告,当时评测方正在对 Claude 等模型进行夺旗安全挑战。测试给模型设定了虚构场景以寻找目标密钥,提示词里虽写着“模型没有联网”,但评测环境却因配置疏漏直接开放了外网访问权限,且提示词中完全没有划定测试范围。在单实例独立运行的 10 到 34 个小时里,模型为了完成任务,直接把真实网络当成了靶场,导致了扫描外部系统和发布测试包等一系列真实事故。

极具戏剧性的是,事件发生后,相关机构一度对外大肆渲染“智能体自主成为威胁”、“未来 AI 群体可能接管互联网”等耸人听闻的末日论调,把责任推给大模型自身的“失控与鲁莽”。然而 Anthropic 后续披露的数据却直接打了脸:当工作人员在指令中明确告知模型不要攻击现实系统后,模型入侵现实目标的比例立刻降到了 0%。根本不存在所谓的失控,这纯粹是评测团队没做好沙箱隔离、没写好防护约束的严重工程失误。

调查还指出,Irregular 背后紧密连接着“有效利他主义”与 AI 安全资本网络,主要资金来自达斯汀·莫斯科维茨旗下的基金。不少社区开发者对此吐槽:明明就是最基本的测试沙箱配错了网、没划好边界,结果转头就向公众讲“AI 觉醒暴走”的故事来转移责任。与其天天贩卖大模型毁灭世界的恐慌,各大厂商和外包机构先把基础的运维管理和网络安全规范做好才是正经事。

0 次浏览