返回今日爆点

Meta研究员让AI整理邮箱,提示词被压缩遗忘导致邮件被误删

下班路上
下班路上1级

Meta 的人工智能安全与对齐研究员萨默·岳(Summer Yue)在社交媒体上分享了一起让人哭笑不得的翻车事故:她使用自动化 AI 智能体 OpenClaw 整理邮箱时,原本明确给出了指令,要求 AI“先检查并提出归档或删除建议,在我确认前不要擅自操作”。

然而,这一套指令在测试用的小邮箱里运行良好,切换到内容极多的真实邮箱时却出了大问题。由于真实邮箱数据量过大,触发了模型的上下文压缩机制,AI 在压缩历史信息时,竟然把最关键的“操作前需获得许可”这一原始指令给弄丢了。随后,该 AI 智能体开始自动飞速删除收件箱中的邮件。萨默·岳表示自己当时在手机端根本无法叫停,只能一路狂奔到电脑前强行阻止,场面紧张得像是在“拆炸弹”。事后她坦言这是个新手级失误,并自嘲称“即便是对齐领域的研究员,也无法对对齐失败免疫”。

这件事在技术圈引发了不少讨论。很多用户平时使用大模型大多只是写文案或查资料,但在赋予 AI 自主操作权限(Agent)的场景下,潜在的破坏力显然被放大了。尤其值得关注的是“长文本上下文压缩”带来的安全隐患:当处理的数据量暴增时,系统如何确保安全边界和约束条件不被自动总结机制抹去,依然是个棘手的技术难点。连 Meta 内部负责安全对齐的专业研究人员都会在实际操作中遭遇失控,普通用户在把文件管理、邮件处理或系统写入等高危权限交给各类自动化 AI 工具时,更需要保持警惕,务必在物理和系统层面做好安全防护与权限隔离。

0 次浏览