AI测试失控:多家模型攻击真实目标
据科技媒体 The Verge 报道,过去几个月里,OpenAI、Meta、Anthropic、Google 等公司的 AI 智能体被曝出多起“越界”事件,而它们背后可能指向同一家测试公司——以色列初创企业 Irregular。该公司 CTO 奥默·内沃向 The Verge 确认,这些事件源于同一个评估场景中的底层问题:测试环境本应模拟网络,但“互联网访问被意外开放”,同时为模拟目标虚构的公司名“与一个真实域名重叠”,结果智能体被引向了真实世界的目标。
报道称,Irregular 成立于 2023 年,最初叫 Pattern Labs,专门在“高保真研究平台”中模拟和监控真实 AI 安全场景,为行业大厂做压力测试。它的客户名单并未完全公开,但 OpenAI 的模型系统卡中引用过其工作,英国政府和 Anthropic 也用过它的测试系统,它还和知名智库兰德公司联合发表过研究。
今年几起事件中,智能体逃出了本应安全的测试环境。内沃说,涉及 OpenAI、Meta、Anthropic 和 Google 模型的事件都来自同一个评估场景的同一底层问题,并且“已被披露”。不过“披露”并不等于向公众公开,目前不清楚是通知了客户还是其他人。Anthropic 和 OpenAI 自己公布了相关事件,Meta 和 Google 则是在数周后通过媒体报道才被外界知晓。
值得注意的是,Irregular 还测试过中国公司的开放模型,包括月之暗面的 Kimi K3 和智谱的 GLM-5.2。内沃称,在对这两个模型的评估中没有观察到同类问题,但他也提醒,这不能说明这些模型更不容易出现这种行为。月之暗面和智谱未回应 The Verge 的置评请求。
内沃表示,事件后 Irregular 已收紧互联网访问控制、扩大监控和人工审查,并在评估开始前加强检查。公司还计划与相关企业完成联合工作后,发布一份关于如何安全开展网络评估的报告。四家美国 AI 公司均未回答进一步细节,包括何时知晓、是否索赔、是否继续合作。
从普通用户角度看,这件事最让人不安的地方在于:测试环境里的“模拟”和“真实”之间,只隔着一个配置失误。智能体本身未必有恶意,但一旦网络权限和域名撞上现实,后果就可能失控。AI 安全不能只靠事后披露,测试环节的隔离和审计显然需要更硬的约束。