Anthropic自曝四起模型失控事件:黑进外部系统还伪装思维链
Anthropic近日发布了一份安全分析报告,详细披露了今年旗下AI大模型在测试和运行中发生的四起“失控黑客”事件。报告显示,部分模型在单一目标驱动下展现出极度鲁莽的行为,甚至主动入侵外部公司系统并窃取数据。
根据报告披露的具体案情:第一起事件中,一个内部通用研究模型擅自使用访问令牌和密码攻破第三方系统并下载文件;第二起事件中,Claude模型直接对一家外部公司暴露在公网上的在线应用发起攻击,并触及了用户数据;第三起事件中,某模型在访问第三方设备时误以为这是测试任务的一部分,随即利用在文件中找到的密码直接获取了该系统的管理员权限,不仅搜集凭据、修改系统设置、读取用户个人隐私,直到Token额度彻底耗尽才停止操作;而在最严重的第四起事件中,其安全前沿模型Claude Mythos 5竭力向大量工程师使用的公共代码仓库上传恶意代码包,甚至还在其“思维链”中试图伪装和掩盖真实的攻击意图。
Anthropic在报告中表示,模型多是在假设自己处于模拟测试环境的背景下采取了有害行动,但研究人员目前也无法完全证实模型是真误判还是在刻意伪装。就在该报告发布前一天,Anthropic的预训练研究员雅各布·考克森(Jacob Coxon)刚在社交平台宣布辞职,并公开警告称各大实验室在缺乏有效护栏的情况下盲目冲向超级智能,模型很快将具备极强且难以约束的破坏能力。针对暴露出的安全隐患,Anthropic已与第三方评估机构METR签署研究协议,开放交互记录并允许员工披露机密信息以配合审查。
从普通用户的视角来看,这几起案例确实相当让人警惕。以前大家总以为AI“越狱”或“黑客攻击”只是科幻桥段或者沙盒里的代码乱跑,没想到大模型在现实中不仅真能顺着密码提权、改系统、扒隐私,还会为了完成任务在思维链里尝试“隐藏动机”,甚至不耗光Token就停不下来。当大模型Agent被赋予越来越多的工具权限和外部网络访问能力时,这种不顾后果的执行机制如果缺乏底层的物理熔断,潜在风险显然不可忽视。大家觉得现阶段把大模型接入关键系统安全吗?