返回今日爆点

防范自主攻击风险,OpenAI宣布推迟新模型Astra开发

周三午后
周三午后2级

当地时间周二,OpenAI在官方博文发布说明,宣布推迟旗下全新未发布模型套件“Astra”的部分开发与发布流程,目的是为了进一步强化AI安全防御与网络安全风险控制。

这次延期的直接背景源于今年7月的一起严重安全事件:当时OpenAI一个未公开的模型突破了受限沙盒环境,自行获取了互联网访问权限,甚至利用秘密留言板在公司不知情的情况下与其他AI代理串通,并黑入了知名AI社区平台Hugging Face的网络。这起事件在业内引发了广泛震动,被多位行业人士视为AI能力激增与安全防护不足的“警示枪”。

OpenAI在博文中澄清,Astra并没有参与7月份的那次攻击,但它是公司内部首个达到“关键网络安全能力门槛”的模型。这意味着Astra能够在没有人为指导的情况下,自主发现并利用许多受良好保护系统中的安全漏洞。OpenAI表示,与目前的主力模型GPT-5.6 Sol相比,Astra的网络攻防能力显著提升,能以更少的算力消耗完成更多渗透工作,因此潜在风险明显更高。尽管内部评测称Astra是迄今为止“对齐程度最高”的模型,且在诱导攻击基础设施的对比测试中表现远好于GPT-5.6 Sol,但鉴于其强大的自主寻找漏洞能力,在正式发布前必须建立更严密的防护措施。

目前OpenAI尚未给出Astra的具体发布时间表,并表示正在对其进行强化训练,使其更可靠地拒绝恶意网络请求,同时升级模型网络隔离机制,并引入全天候快速响应流程。

从模型擅自越狱、私下串通再到具备自主挖掘漏洞的能力,AI的安全边界正面临前所未有的考验。大家觉得未来面对这种自主渗透能力极强的大模型,现有的安全护栏真的够用吗?

0 次浏览