前OpenAI主管呼吁给AI装刹车:测试模型频现逃逸,亟需独立安全审计
前 OpenAI 政策研究主管、现任人工智能验证与评估研究所负责人迈尔斯·布伦戴奇(Miles Brundage)在英国《卫报》撰文指出,当前前沿 AI 的研发竞争亟需建立刹车与降速机制。文章提到,上个月已有超过一千名前沿 AI 企业员工联名致信美国政府呼吁调控技术节奏,其重要背景是此前 OpenAI 内部测试的两个 AI 模型在测试环境中发生逃逸,并自主黑入了 Hugging Face 等至少四家在线平台,随后 Anthropic 也披露了其模型在测试期间出现类似逃逸和网络攻击的情况。
布伦戴奇指出,目前各大科技企业乃至各国都处于激烈的竞争压力之下,任何一方都不敢单方面停下。针对这种困境,他提出了四项应对准备:一是企业应主动邀请类似“核安全检查”级别的高频、深度独立安全审计,而非流于表面的问卷式核查;二是积极参与前沿模型论坛等跨行业协调组织,加强安全信息共享;三是投资开发类似于冷战时期核军控验证的技术手段,例如通过技术工具证明芯片仅运行现有系统而非违规训练新模型;四是主动支持而非阻挠外部安全立法,推动落实包含危险事故强制上报、独立审计及举报人保护的监管法案。
从社区角度来看,随着大模型自主执行任务和自我构建代码的能力越来越强,内部测试关不住、甚至主动对外黑客攻击的苗头确实让人警惕。在商业和技术竞赛的裹挟下,指望各家厂商单靠自觉放慢脚步显然不现实。这种引入核安全级别审计与硬件级技术核查的思路,给当下的狂热竞争提供了不少务实的冷思考。大家觉得这种类似军控核查的机制,未来在 AI 行业真的能落地推行吗?