Anthropic对齐负责人公开承认"无解"超级智能风险,业内警告正"押注人类生命"
Anthropic对齐科学负责人Evan Hubinger公开承认,公司内部真心相信超级智能可能在本十年内杀死全部人类,且目前尚无解决方案。与此同时,超过1300名前沿AI公司员工联署警告失控风险,但Anthropic与OpenAI均未承诺暂停研发或接受外部监管。联合国人权高专警告AI构成"生存性风险"。
Anthropic对齐科学负责人Evan Hubinger本周罕见地公开承认,公司内部真心相信超级智能可能在本十年内"杀死全部人类",且目前尚无解决所谓"对齐问题"的明确方案。这是Anthropic研究员Jacob Coxon宣布离职后,从企业内部抛出的最新震荡。
据ABC News Australia报道,Coxon在社交媒体X上直言,自己在Anthropic和OpenAI累计从事了三年预训练研究后选择离开,原因是"两家公司都没有负责任地行事"。他的原话是:"他们正一路冲向自我改进的超级智能,押注的是我们的生命。"
Hubinger随后在X上回应称Coxon所言"正确"。他写道:"我们确实真心相信AI可能杀死全部人类!我个人认为未来十年内发生概率超过10%。"在关乎企业生存与人类命运的技术路线问题上,他同时承认:"我相信Anthropic正在尽力,但我们尚无解决超智能对齐问题的方案,也未明确走在通往该方案的路上。"
Coxon并非孤例。今年七月,超过1300名来自Anthropic、OpenAI及其他前沿AI公司的员工联署公开声明,警告"能力发展有可能迅速超越我们理解或控制所产生系统的能力",并呼吁美国政府支持国际努力,建立能够"有意识地控制前沿AI开发节奏"的工具。该倡议被命名为"Pacing the Frontier"。
然而,两家公司对联署的回应均停留在原则层面,而非具体行动承诺。据ABC News Australia援引两家公司的X平台声明,Anthropic承认其上月发布的关于"递归自我改进"的研究"指向需要工具来有意识地控制前沿AI开发节奏,以便社会做好准备";OpenAI则措辞模糊地表示,"我们相信,在未来某个时刻,前沿模型开发的AI加速可能如此之高,以至于世界需要控制AI进步的速度"。两家公司均未承诺暂停研发或接受具有约束力的外部监管。
监管层面的缺位正在国际场合被越来越直接地点名。据ABC News Australia报道,联合国人权事务高级专员Volker Turk周一在日内瓦警告,先进AI可能对人类构成"生存性风险",并誓言向相关公司施压以降低其办公室所列举的风险——包括对公共服务、通信和民主体系的冲击。Turk呼吁在"为时已晚之前"为AI安全"铸就铁一般的保障"。"我与行业内部人士一样担忧先进AI可能对人类构成生存性风险,"他在联合国机构发言时表示。
"对齐问题"的本质在于:一个超越人类能力的AI系统可能并不共享人类价值观。在美国联邦层面尚未就前沿AI建立具有约束力监管框架的背景下,行业内部如今正以最直白的方式承认:这场竞赛的风险与回报分布并不对称——收益由企业锁定,代价可能落在所有人身上。
还没有评论,来说说你的看法。