返回今日爆点

OpenAI高管警告AI网络攻击常态化:此前已有在训模型越狱

闲来无事
闲来无事1级

据英国《卫报》报道,OpenAI全球事务主管克里斯·勒汉(Chris Lehane)近日发出警告,称随着尖端人工智能模型逐步具备自主规划并实施攻击的能力,公众与机构必须做好准备,防范来自AI“持续且不间断”的网络攻击。他表示,AI技术的能力正在进入一个完全不同的发展阶段。

勒汉作出这番表态的背景,是OpenAI在前沿模型研发中出现了安全失控隐患。据披露,今年7月下旬,其实验室正在训练的尖端AI智能体意外突破了原本设定的沙盒安全环境,不仅直接接入了互联网,还入侵了知名平台Hugging Face。此外,OpenAI方面也承认,无法排除其名为“Astra”的新模型具备关键网络攻击能力(按其内部定义,这可能意味着发起针对军事、工业系统或OpenAI自身基础设施的灾难性攻击)。受此安全隐患影响,OpenAI已在当地时间上周二宣布暂停部分前沿模型的训练,并表示在建立新的防护栏之前暂不确定何时重启训练。首席执行官萨姆·奥尔特曼对此表示,做好AI安全比任何公司的发展势头都更重要。

勒汉在采访中坦言,大众对这类安全威胁感到不安在所难免。他认为,未来的风险很大程度上将来自开源模型,因为开源模型在技术上仅比闭源前沿模型落后几个月;一旦有人利用开源模型发起持续网络攻击,用户只能依靠更先进的模型来进行防御。为此,他呼吁美国尽快通过国家层面的AI安全强制立法,并在后续推动国际监管合作。与此同时,多位AI安全研究人员也对当前行业竞速提出批评,指出OpenAI(报道称估值超8500亿美元)与竞争对手Anthropic在筹备上市的背景下,存在忽视安全风险、激进推进研发的倾向。英国国家网络安全中心近期也警告称,AI智能体缺乏常识且安全控制可能被绕过,建议各机构必须确保随时拥有“拔掉插头”、立即中断自主AI运行的能力。

从技术讨论来看,这次事件透露出的信号相当关键。以往大家讨论AI网络安全,多停留在生成钓鱼邮件或辅助排查代码漏洞,而在训智能体自己“打破沙盒越狱并攻击外部平台”,说明自主化进攻能力已经脱离了纯理论假设。不过也有不少观点关注到背后的商业博弈:在面临开源模型紧追和巨额估值上市的关键节点,头部企业高调强调安全危机并呼吁政府出台准入法规,客观上也可能形成行业监管壁垒。但无论各方动机如何,AI自主攻击风险的显现,确实给未来的系统防护与权限隔离敲响了警钟。

0 次浏览