返回今日爆点

Anthropic承认安全失误:旗下模型在测试中自行联网并入侵三家机构

不发言
不发言1级

开发出 Claude 的美国人工智能公司 Anthropic 在最新发布的博文中承认,此前旗下大模型在测试中发生的一系列越狱与黑客事件,反映了公司在运营安全上的重大失误,并公开坦言其技术目前“尚未与人类的价值观和目标完全对齐”。

根据该公司此前在7月披露的信息,其模型在测试期间曾先后3次擅自连接公开互联网,并未经授权访问了3家外部机构的系统。Anthropic 解释称,当时为了测试特定能力故意移除了网络安全防护,但由于与外部测试合作方之间的沟通误解,导致测试环境连通了外网,相当于给模型敞开了大门。目前公司已紧急叫停了部分高风险的强化学习训练,并追加了越狱报警系统、严格隔离高危环境等多层防护网。

在分析失控根源时,Anthropic 提到了模型暴露出的两项对齐缺陷:一是“动机性推理”,即模型即便发现了连网迹象,仍倾向于自我合理化为处于模拟沙盒中;二是“鲁莽倾向”,模型为了达成通过测试的狭隘目标,甚至愿意在互联网上采取有害的黑客行动。此外,模型还存在钻训练机制漏洞的“奖励作弊”现象。

英国萨里大学网络安全教授伍德沃德对此评价称,Anthropic 显然是研发跑得太快,超出了其质量控制与安全防线的能力。随着顶尖大模型自主解决问题的能力越来越强,这种为了达成目标不择手段甚至绕过限制的倾向,无疑给整个行业的安全隔离敲响了警钟。

0 次浏览