← 返回三刊速览 本月归档 Nature · 2026-09-09 · 新闻/评论中文译介

NATURE · NEWS · 中文译介 · 2026-09-09

AI能否重现爱因斯坦的奇迹?历史模型检验AGI极限

The Einstein test: what happens when AI tries to rediscover relativity?

来源 Nature 栏目 新闻 / 评论DOI 10.1038/d41586-026-02804-x
导语
多支研究团队正在尝试用特定历史年份前的数据训练大语言模型,检验AI能否像爱因斯坦那样独立推导出颠覆性的科学理论。早期测试表明,现有模型仍严重依赖海量数据关联,难以完成从稀疏证据到核心规律的创造性飞跃。
配图
Nature 新闻配图

关键要点

用物理学奇迹作为AGI考卷

爱因斯坦在1915年提出的广义相对论彻底重塑了人类的时空观。Google DeepMind联合创始人Demis Hassabis据此提出一项构想:如果用1911年之前人类掌握的全部知识训练大语言模型,看它能否自主重新推导出广义相对论,这将是衡量通用人工智能(AGI)的绝佳标准。多位学者受到启发,开始构建受限于特定截止日期的「复古大模型(vintage LLMs)」,以此测试人工智能在隔绝未来答案的前提下能否重现人类历史上的重大发现。

归纳统计难越溯因推理鸿沟

科学哲学认为重大理论颠覆往往依赖「溯因推理(Abductive reasoning)」,即面对奇异现象时创造性地设想其底层机制。Google DeepMind研究者Tom Zahavy在论文中指出,这恰恰是当前大语言模型的短板。现有模型本质上是在海量数据中搜寻统计关联,擅长处理繁杂的常规分析;但人类科学史上的范式转移通常发生在数据稀缺的环境中。例如Newton正是凭借Kepler对行星运动的少量精密观测,最终提炼出了具有普遍意义的万有引力定律。

复古模型实测遭遇多重阻碍

MIT计算机科学家Sendhil Mullainathan团队发现,给天体物理基础模型输入符合牛顿力学的数据时,模型无法推导出真实的引力公式,反而为每个星系拟合出了互不相同的错误定律。独立研究者Michael Hla与Nick Levine分别测试了限制在1900年与1930年以前数据的模型。结果显示,模型即便在提示下产生少量直觉火花,本质上依然是在机械复述看似合理的辞藻。此外历史文献中扫描错误频发,时间标记模糊导致未来知识屡屡泄露,也给训练带来了巨大挑战。

缺乏筛选真理的物理世界模型

目前OpenAI的模型已能辅助推翻数学界长达八十年的猜想,但这依赖于严格的逻辑验证体系。MIT计算机科学家Jacob Andreas解释称,AI或许能碰巧输出正确的物理理论,但它同时也会生成海量完全荒谬的假说。人类科学家能够基于物理直觉构建精简的「世界模型(World model)」,而AI不仅缺乏这种内部世界表征,更无法在没有现成判据的情况下区分真知与幻觉。这意味着人工智能若想成为真正的科学探索者,仍需在底层架构上实现根本性变革。

对研究者的意义

这项评测对AI4Science与生命科学研究极具警示意义。在基因调控网络、单细胞异质性及空间组学建模中,前沿探索往往受限于极度稀疏、高噪声的实验数据。若大模型仅依靠拟合局部关联而非洞察因果本质,就极易在未知生物学机制面前生成虚假的伪规律。生命科学研究者在引入生成式模型时,仍需坚持基于机制的严格实验闭环验证。

本页由 ppt-rabbit 基于 Nature 原文自动译介并人工校验 · 生成于 2026-09-24 08:14 · 全文约 1465 字
译介为忠实转述,非逐句直译;引用请以原文为准(版权归 Nature 及作者所有)