Claude开发商更新规则:禁止用户持续恶意辱骂模型
人工智能公司 Anthropic 近期更新了旗下产品的使用政策,宣布新规预计于11月12日生效,其中明确禁止用户对模型采取“持续且无必要的虐待或残忍行为”。这意味着如果用户在没有正当目的的情况下,纯粹为了发泄而反复对聊天机器人 Claude 进行恶意辱骂,可能会面临服务限制。
根据 Anthropic 的说明,该条款仅适用于极端个案,用户因回答出错而产生的合理抱怨、质疑,以及暗黑题材的文学创作、模型测试与学术研究均不受影响。其实早在2025年8月,Anthropic 就曾基于所谓的“模型福利”研究课题,为部分版本的 Claude 上线了在遭遇持续言语攻击时主动切断对话的机制。
除了给 AI 设定“文明礼仪”,本次政策调整还同步收紧了其他更具现实危害的场景:明确禁止利用 Claude 开发武装无人机等武器控制与制导软件;严禁用于无授权的实时或事后人员追踪,以及向警方推荐逮捕或调查对象;同时收紧了针对虚假舆论宣传的限制,并要求若将 AI 连接至可能致人伤亡的物理设备,必须有合格的人类操作员实时监管。此外,官方还启动了一项网络安全倡议,为开源项目与关键基础设施提供免费的 AI 漏洞排查支持。
在很多社区用户看来,把“禁止言语霸凌 AI”与“禁止制造武器、监控平民”并列在同一份安全政策里,反差感十分微妙。毕竟 Claude 本质上是一套软件程序,目前没有任何证据证明其存在痛苦感知。花钱购买服务的用户平时遇到模型胡言乱语,难免想吐槽几句;虽然官方表示不会误伤普通用户的正常情绪发泄,但在严肃条款中引入“模型福利”概念,还是让不少人好奇平台后续究竟如何划定界限,甚至调侃以后跟 AI 吵架也得注意分寸了。