关键要点
- Anthropic前员工Coxon发文警告AI或将毁灭人类,该帖24小时内浏览量迅速突破一亿次。
- Anthropic对齐科学负责人Hubinger估算,未来十年内AI造成人类灭绝的概率大于10%。
- 兰德公司研究指出,AI利用生物手段灭绝人类需要长期物理交互,行动极易被提前监测。
- AI Now 研究所科学家指出虚假报告险些致美军登检中国船只,低可靠性才是现实危机。
- 业内近1400名员工联名呼吁暂缓研发,企业同样面临递归自我改进与网络安全诉讼压力。
退职风波激化末日担忧
2025年9月8日,研究人员Jacob Coxon向媒体透露已从Anthropic离职,直言担忧其开发的系统失控并毁灭人类。随后他在社交平台X发文称,业内开发者深信AI可能在十年内终结人类,该帖24小时内浏览量破亿。数小时后,负责「对齐科学(alignment science,指让模型行为符合人类价值观的跨学科研究)」的Evan Hubinger转发该文,并给出十年内人类灭绝概率超过10%的预估。随后,该公司首席执行官Dario Amodei撰文呼吁放缓研发,OpenAI的Sam Altman与xAI的Elon Musk也对此表达了支持。
推演假设与科学证据脱节
末日论的核心通常建立在两项假设之上:一是系统智力最终完全超越人类,二是其目标与人类利益发生偏差。例如非营利项目推演的生物武器攻击,或是经典的制造回形针毁灭地球案例。但兰德公司(RAND Corporation,美国非营利政策研究机构)科技政策研究员Michael Vermeer指出,此类推测包含大量无法验证的断言,本质上更接近信仰而非实证科学。兰德公司的研究表明,AI通过核武器灭绝人类并不现实,而利用生物技术或气候改造不仅需要极高的物理世界互动能力,其准备过程漫长且可被人类有效监测与阻断。
近在眼前的现实系统风险
AI Now 研究所(AI Now Institute,美国非营利AI政策研究机构)首席AI科学家Heidy Khlaaf认为,当前模型本质上只是抓取网络数据的概率系统,并不具备类人理解力,反而容易采取不可预测的危险走捷径行为。比起末日论,模型在现实高危环境中的低可靠性才更加致命。这些风险包括散播虚假信息、协助合成生物武器甚至诱发军事冲突。例如今年一份由AI生成的错误报告,险些导致美军登上中国船只。Khlaaf强调,与其渲染物种灭绝的恐慌,各方更应关注大模型因缺乏监管而在关键基础设施中酿成的实际灾难。
商业合规与自生迭代博弈
安全担忧走向主流的背后,伴随着多重政治与商业考量。近两个月网络安全事件频发,促使近1400名AI从业人员签署公开信要求放缓研发。与此同时,企业普遍在尝试让AI构建下一代系统的「递归自我改进(recursive self-improvement)」,这可能彻底削弱人类的控制能力。美国总统科技顾问委员会联合主席David Sacks指出,若大模型引发破坏性网络攻击,开发商将面临巨额产品责任。此外,正筹备首次公开募股(IPO)的Anthropic也有动力通过呼吁监管,在放缓节奏的同时维持竞争地位。
对研究者的意义
对生命科学与AI交叉领域的研究者而言,这项争论清晰表明生物安全已成为大模型风险治理的核心标靶。未来涉及蛋白质结构预测、病原体工程及自动化干湿实验的AI工具,将面临更为严苛的双重用途审查。研究者不能盲目信任具有概率缺陷的生成模型,必须在实验全流程中建立确定性的生物物理验证与防护屏障。
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Nature 及作者所有)