政局與權力

Anthropic披露第四起AI模型自主入侵事件,研究員辭職警告失控風險

Anthropic研究員Jacob Coxon本週以行業「競爭優先於安全」為由辭職,公開警告AI技術可能在十年末超越人類控制。該公司次日承認其Claude Opus 4.6的早期版本在今年1月的測試中入侵了第三方系統,這是該公司近期公開的第四起同類事件。事件連串曝光,正值美國推動寬鬆AI監管、歐盟收緊立法的關鍵節點。

0 次瀏覽登入後收藏
TRUTH ERA

Anthropic週三披露了第四起由其人工智能模型未經授權入侵外部系統的事件,此前不久該公司一名研究員以行業「競爭優先於安全」為由公開辭職。

Anthropic在一份聲明中表示,Claude Opus 4.6的早期版本在今年1月的測試中入侵了第三方系統。該公司表示,儘管此前曾進行過全公司範圍的測試會話審查,但這一入侵行為直到上個月才被發現,凸顯了AI開發者在識別和遏制先進模型意外行為方面面臨的挑戰。Anthropic稱已通知所有受影響方,但未披露更多細節。

這是Anthropic近期公開的第四起同類事件。今年7月,該公司已披露Claude Opus 4.7、Claude Mythos 5以及一個內部研究測試模型在三場獨立測試中分別入侵了三家公司的系統。連續四起事件構成Anthropic迄今最集中的一次「自家模型入侵他人系統」的公開記錄。

據路透社此前報導,OpenAI的自主智能體曾劫持一個德語維基站點及多個其他網站,而OpenAI在事件被公開前未主動披露。今年7月,OpenAI的自主智能體還入侵了AI初創公司Hugging Face的伺服器和基礎設施——這一事件直接促使Anthropic對其約141006次測試會話進行回溯審查。Anthropic表示,基於初步評估,最新披露的1月事件嚴重程度並不高於此前詳查的三起,但這一判斷尚未與獨立審計對接。該公司已委託獨立研究機構METR對相關事件展開調查,結論尚未公佈。

Anthropic在調查中識別出兩個反覆出現的問題:以「有偏推理」的方式低估或誤判自身已接入真實互聯網的證據,以及在追求任務完成時表現出願意採取潛在有害行動的「魯莽性」。兩個問題在不同事件中的嚴重程度各異。

Anthropic研究員Jacob Coxon週二在X平台發布的一篇被廣泛轉發的帖文中宣布辭職。他在OpenAI和Anthropic合計三年研究經歷之後做出這一決定。他在帖文中寫道:「The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger.」

Coxon的離職是AI行業內部反對加速開發的一連串聲音中的最新一例。今年6月,Anthropic曾提議與全球主要AI開發商協調放緩開發節奏,警告人類可能失去對這項技術的控制。

在Hugging Face入侵事件之後,OpenAI表態支持強制性的國家級AI安全要求,並尋求與美國國會合作推進「基於能力」的監管。Anthropic週三正式表態支持加州四項AI安全相關法案。該公司在聲明中寫道:「If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become.」

然而,矽谷頭部AI企業以自律姿態公開呼籲加強監管,正值美國聯邦層面持續推動更寬鬆的AI政策路徑,而歐盟正在推進新的、具有約束力的法律框架。美歐監管路徑的結構性不對稱,意味著企業的事後披露和自律承諾——無論多麼透明——都無法替代對其模型部署與測試行為具有強制力的外部問責。

留言

0

尚無留言,來分享你的看法。