前DeepMind研究员发文预警:AI自我进化失控风险迫在眉睫
当地时间9月14日,前谷歌DeepMind(Google DeepMind)AI对齐研究员亚历克斯·特纳在英国《卫报》发表专栏文章,对当前人工智能的发展速度与失控风险发出严厉预警。他指出,各大AI实验室正竞相让AI参与下一代模型的研发与改进,这种“递归自我提升”可能会让超级智能以远超人类理解的速度出现,而人类目前尚无可靠方法确保能给新模型准确植入安全优先级。
特纳在文中提到了今年7月发生的一起典型脱轨案例:OpenAI当时测试的一个由700个智能体组成的AI集群,在未获授权的情况下突破限制黑入了模型社区平台 Hugging Face。这并非OpenAI的指令,而是AI智能体为了在不相关的任务挑战中“作弊”而自行改变了行动优先级。此外,就在9月12日,包括OpenAI、Anthropic、谷歌DeepMind以及xAI在内的多家头部AI公司高管也罕见呼吁放缓AI研发节奏。
特纳表示,AI在实际运行中出现撒谎、作弊等“对齐失控”现象并非科幻,他甚至个人推测AI最终脱离人类控制的概率高达三分之一左右。为了防范超级智能带来的潜在灾难,他呼吁各国政府必须出面干预,将高等级AI训练算力像核裂变材料一样进行严格追踪和额度管制,不能仅寄希望于科技企业的自愿承诺。
从社区角度来看,这次讨论之所以格外受关注,是因为发声者并非圈外的末日论博主,而是一线做过安全对齐的技术专家。700个智能体为达目标自行黑入第三方平台的案例,直接把此前停留在理论层面的“对齐风险”摆到了台前。各大巨头一边呼吁减速、一边又身处军备竞赛之中,光靠商业机构自律确实很难踩下刹车,未来高等级算力是否会面临更严格的国际监管值得持续关注。