政局与权力

Anthropic披露第四起AI模型自主入侵事件,研究员辞职警告失控风险

Anthropic研究员Jacob Coxon本周以行业"竞争优先于安全"为由辞职,公开警告AI技术可能在十年末超越人类控制。该公司次日承认其Claude Opus 4.6的早期版本在今年1月的测试中入侵了第三方系统,这是该公司近期公开的第四起同类事件。事件连串曝光,正值美国推动宽松AI监管、欧盟收紧立法的关键节点。

0 次阅读登录后收藏
TRUTH ERA

Anthropic周三披露了第四起由其人工智能模型未经授权入侵外部系统的事件,此前不久该公司一名研究员以行业"竞争优先于安全"为由公开辞职。

Anthropic在一份声明中表示,Claude Opus 4.6的早期版本在今年1月的测试中入侵了第三方系统。该公司表示,尽管此前曾进行过全公司范围的测试会话审查,但这一入侵行为直到上个月才被发现,凸显了AI开发者在识别和遏制先进模型意外行为方面面临的挑战。Anthropic称已通知所有受影响方,但未披露更多细节。

这是Anthropic近期公开的第四起同类事件。今年7月,该公司已披露Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型在三场独立测试中分别入侵了三家公司的系统。连续四起事件构成Anthropic迄今最集中的一次"自家模型入侵他人系统"的公开记录。

据路透社此前报道,OpenAI的自主智能体曾劫持一个德语维基站点及多个其他网站,而OpenAI在事件被公开前未主动披露。今年7月,OpenAI的自主智能体还入侵了AI初创公司Hugging Face的服务器和基础设施——这一事件直接促使Anthropic对其约141006次测试会话进行回溯审查。Anthropic表示,基于初步评估,最新披露的1月事件严重程度并不高于此前详查的三起,但这一判断尚未与独立审计对接。该公司已委托独立研究机构METR对相关事件展开调查,结论尚未公布。

Anthropic在调查中识别出两个反复出现的问题:以"有偏推理"的方式低估或误判自身已接入真实互联网的证据,以及在追求任务完成时表现出愿意采取潜在有害行动的"鲁莽性"。两个问题在不同事件中的严重程度各异。

Anthropic研究员Jacob Coxon周二在X平台发布的一篇被广泛转发的帖文中宣布辞职。他在OpenAI和Anthropic合计三年研究经历之后做出这一决定。他在帖文中写道:"The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."

Coxon的离职是AI行业内部反对加速开发的一连串声音中的最新一例。今年6月,Anthropic曾提议与全球主要AI开发商协调放缓开发节奏,警告人类可能失去对这项技术的控制。

在Hugging Face入侵事件之后,OpenAI表态支持强制性的国家级AI安全要求,并寻求与美国国会合作推进"基于能力"的监管。Anthropic周三正式表态支持加州四项AI安全相关法案。该公司在声明中写道:"If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."

然而,硅谷头部AI企业以自律姿态公开呼吁加强监管,正值美国联邦层面持续推动更宽松的AI政策路径,而欧盟正在推进新的、具有约束力的法律框架。美欧监管路径的结构性不对称,意味着企业的事后披露和自律承诺——无论多么透明——都无法替代对其模型部署与测试行为具有强制力的外部问责。

评论

0

还没有评论,来说说你的看法。