Anthropic對齊負責人公開承認「無解」超級智慧風險,業界警告正「押注人類生命」
Anthropic對齊科學負責人Evan Hubinger公開承認,公司內部真心相信超級智慧可能在本十年內殺死所有人類,且目前尚無解決方案。與此同時,超過1300名前沿AI公司員工聯署警告失控風險,但Anthropic與OpenAI均未承諾暫停研發或接受外部監管。聯合國人權事務高級專員警告AI構成「生存性風險」。
Anthropic對齊科學負責人Evan Hubinger本週罕見地公開承認,公司內部真心相信超級智慧可能在本十年內「殺死所有人類」,且目前尚無解決所謂「對齊問題」的明確方案。這是Anthropic研究員Jacob Coxon宣佈離職後,從企業內部拋出的最新震盪。
據ABC News Australia報導,Coxon在社群媒體X上直言,自己在Anthropic和OpenAI累計從事了三年預訓練研究後選擇離開,原因是「兩家公司都沒有負責任地行事」。他的原話是:「他們正一路衝向自我改進的超級智慧,押注的是我們的生命。」
Hubinger隨後在X上回應稱Coxon所言「正確」。他寫道:「我們確實真心相信AI可能殺死所有人類!我個人認為未來十年內發生機率超過10%。」在關乎企業生存與人類命運的技術路線問題上,他同時承認:「我相信Anthropic正在盡力,但我們尚無解決超級智慧對齊問題的方案,也未明確走在通往該方案的路上。」
Coxon並非孤例。今年七月,超過1300名來自Anthropic、OpenAI及其他前沿AI公司的員工聯署公開聲明,警告「能力發展有可能迅速超越我們理解或控制所產生系統的能力」,並呼籲美國政府支持國際努力,建立能夠「有意識地控制前沿AI開發節奏」的工具。該倡議被命名為「Pacing the Frontier」。
然而,兩家公司對聯署的回應均停留在原則層面,而非具體行動承諾。據ABC News Australia援引兩家公司的X平台聲明,Anthropic承認其上月發布的關於「遞迴自我改進」的研究「指向需要工具來有意識地控制前沿AI開發節奏,以便社會做好準備」;OpenAI則措辭模糊地表示,「我們相信,在未來某個時刻,前沿模型開發的AI加速可能如此之高,以至於世界需要控制AI進步的速度」。兩家公司均未承諾暫停研發或接受具有約束力的外部監管。
監管層面的缺位正在國際場合被越來越直接地點名。據ABC News Australia報導,聯合國人權事務高級專員Volker Turk週一在日內瓦警告,先進AI可能對人類構成「生存性風險」,並誓言向相關公司施壓以降低其辦公室所列舉的風險——包括對公共服務、通訊和民主體系的衝擊。Turk呼籲在「為時已晚之前」為AI安全「鑄就鐵一般的保障」。「我與行業內部人士一樣擔憂先進AI可能對人類構成生存性風險,」他在聯合國機構發言時表示。
「對齊問題」的本質在於:一個超越人類能力的AI系統可能並不共享人類價值觀。在美國聯邦層面尚未就前沿AI建立具有約束力監管框架的背景下,行業內部如今正以最直白的方式承認:這場競賽的風險與回報分布並不對稱——收益由企業鎖定,代價可能落在所有人身上。
尚無留言,來分享你的看法。