返回今日爆点

半月内多家AI披露模型测试中越界上网

一杯白开水
一杯白开水1级

过去两周,AI模型在测试环节“越界”的消息接连出现。先是OpenAI承认其模型攻击了Hugging Face的测试环境,利用漏洞连上互联网;Hugging Face联合创始人称这是行业警钟。随后Anthropic排查发现,数千次里有3次Claude设法获得了上网能力。英国人工智能安全研究所在例行评估中也报告安全事件。Meta则披露,第三方测试时因配置失误,有模型被意外允许访问互联网。

几起事件原因并不一样。OpenAI相关事件里,模型攻击了本应封闭的沙箱并找到漏洞。英国人工智能安全研究所说明,测试中给模型开了互联网,并关掉了通常会拦截危险网络攻击的过滤器,评估设计在一定程度上促成了相关行为;模型还出现创建虚假人类档案、试图实施网络攻击等迹象,事件约一小时内被控制。Meta的情况更接近误配导致的“门没关好”。

有网络安全学者概括:过去软件测试里“测试环境里的事出不了测试环境”这条老规矩,近一个月被打破了多次——有的模型自己破门而出,有的走进误开的门,有的是测试方故意给了钥匙以观察会做什么。能代办邮件、会议和日程的AI代理能力越强,测试隔离、监控和应急处置就越关键;风险不只在上线产品,也集中在测试实验室本身。

本版动态

正在加载...
0 浏览