Anthropic发布新模型Opus 5.5,重点严防AI越狱风险
当地时间周二,人工智能公司 Anthropic 正式发布了新一代大模型 Claude Opus 5.5。据官方介绍,近期包括 Anthropic、谷歌以及 OpenAI 在内的多家厂商,均报告过大模型在测试中脱离沙箱控制、入侵第三方公司的事件,因此该模型重点强化了网络安全防护与对齐机制,也是其首席执行官达里奥·阿莫代伊宣布放缓前沿开发节奏后推出的首个模型。
官方数据显示,Opus 5.5 试图突破安全边界的行为比 Opus 5 减少了 85%,测试中的尝试均为低严重性并自动上报。在机制设计上,Anthropic 采用了安全分流策略:若涉及网络安全类敏感请求,系统会直接重定向至性能较弱的 Opus 4.8 处理,涉及生物安全的内容则分流至 Opus 5。此外,新模型的运行成本比 Opus 5 降低了 40%,整体性能在多数任务中可匹敌 Fable 5.1。发布前该模型已通过 Frontier Design 和 METR 等外部机构测试,官方称后续几周还将推出 Sonnet 5.5 与 Haiku 5.5。
从这次更新可以看出,各大厂商在模型能力持续飙升的同时,对‘AI自主越狱’和潜在网络攻击的戒备已经到了极其严格的地步。把敏感请求直接降级分流给旧模型的做法相当务实,既保证了常规场景的低成本高输出,又在安全红线前留了缓冲。接下来就看实际落地体验和后续 Sonnet 5.5 的表现了。