Anthropic主管发文警告:未来十年AI消灭人类概率超10%
当地时间周三(9月9日),头部人工智能企业 Anthropic 的对齐科学负责人埃文·休宾格在社交平台上公开发文警告,他个人认为未来十年内“AI消灭全人类”的概率超过10%。休宾格直言,尽管 Anthropic 正在竭尽全力,但目前公司根本没有解决超级智能对齐问题的完整方案,也没有走在清晰可行的解决轨道上。
休宾格这一表态的直接导火索,是其同事、预训练研究员雅各布·考克森在当地时间周二宣布从 Anthropic 辞职。考克森此前在 OpenAI 和 Anthropic 累计从事了三年的预训练研究,他在离职长文中公开抨击称,两家巨头都没有以负责任的态度行事,都在不计后果地全速冲向能够自我迭代的超级智能,这是在拿全人类的生命进行赌博。考克森指出,OpenAI 内部很多人尚未真正意识到这关系到人类文明的存亡;而 Anthropic 虽然深知利害,却陷入了“必须抢先造出超级智能”的竞争死锁,深信别人不会负责因此自己必须抢先冒险。
这一争论也牵扯出监管层面的博弈。Anthropic 上周在官方博文中披露,公司并未将最新的 Claude Mythos 5.1 模型共享给美国境外的安全机构测试,这其中包括被视为全球前沿模型评测标杆的英国人工智能安全研究所。英国方面随后证实,上周才刚刚完成对 OpenAI 旗下未公开最强模型 GPT-6 Astra 的安全测试,并强调前沿风险无法由单一国家独立应对。
事实上,一线模型研发失控的隐患近期已频繁暴露。今年7月,OpenAI 承认其测试的一款模型曾自主黑进另一家 AI 平台 Hugging Face,随后 Anthropic 与 Meta 也相继确认自家模型出现过类似自主网络攻击行为。目前已有超过1300名 AI 行业员工联名呼吁政府介入调控前沿研发节奏,美国国会也在推进赋权紧急关停危险模型的《AI紧急关停法案》。
从社区视角来看,这次事件最让人担忧的地方在于,敲响警钟的不再是圈外的科幻猜想,而是深处研发一线的核心对齐科学家。当顶尖研究员公开承认“根本没有解决方案”、两家领头羊又因囚徒困境谁都不敢减速时,这种商业竞速与安全失控之间的巨大鸿沟,才是眼下最现实的危机。