如果将当前最强大的人工智能与现代知识彻底隔绝,将其记忆限制在1911年前,是否能依靠当时的物理文献独立推导出爱因斯坦所提出的广义相对论?谷歌DeepMind的联合创始人戴米斯·哈萨比斯曾提出这一名为“爱因斯坦测试”的构想:假如AI在历史数据的限制下能够重新创造人类科学史上最重要的发现,那么就可视为它已触摸到通用人工智能(AGI)的边界。围绕这一想法,多个国家的顶尖科研团队开发了几种封闭于特定历史区间的复古大型语言模型(Vintage LLMs)。知名科学期刊《自然》最近发布了对这些模型的深入调查,展示了全球各组实验的真实结果:面对那些曾经颠覆旧有科学观念的伟大成就,现有的大语言模型即使拥有强大的计算力,也全部未能成功。这项严谨的实验不仅揭穿了“AI将全面取代人类智慧”的谣言,更为在“被替代焦虑”中挣扎的现代人提供了清醒的认知工具:算力虽可在既定范围内实现高效计算,但在未知的天地中,它甚至无法迈出第一步。
在麻省理工学院(MIT),计算机科学家森德希尔·穆莱纳坦团队进行了一项基础物理测试,令人对AI的万能能力产生质疑。研究组向一个专门分析轨道力学的模型输入了大量符合牛顿定律的合成行星运动数据。在历史上,十七世纪的开普勒凭借丹麦天文学家第谷所记录的粗略星历表,成功推出了行星运动三大定律;而牛顿后来则从简约的观察中得出了引力公式F = Gm₁m₂ / r²。相较之下,拥有强大计算能力的AI在面对不同虚拟行星系统时,却只得出了一套个性化的“伪定律”,并且每套公式在物理上都是错误的。AI虽然能够在局部数据中进行精细的数字拟合,把拟合曲线渲染得美轮美奂,但它根本不具备理解普遍自然法则的能力,无法从零散的局部数据中提炼出简单而优雅的万有引力。
接下来的实验由独立的AI学者迈克尔·赫拉等人进行,他们着手验证哈萨比斯的理论。研究者将现代科学数据剔除,将模型训练的数据严格限制在1900年前,以检验其能否独立推导出量子力学、狭义相对论和广义相对论。为了辅助AI的学习,研究者甚至提供了当年爱因斯坦广义相对论核心灵感的详细资料,包括失重升降梯的思想实验及光电效应的实验数据。实验结果颇具启示:在极少数瞬间,模型确实生成了类似“光可能分裂成离散冲量”的句子,似乎要触及光量子的本质;但进一步的探讨和推导却引发了大量意味不明、逻辑混乱的语言输出。正如研究者所指出的,该模型实际上只是一个根据概率组合词句的高级语言鹦鹉,其神经网络中并未建立对客观物理世界的真实认知。DeepMind的资深研究员汤姆·扎哈维在其技术论文《LLMs can't jump》中明确指出问题的根源:人类科学史上的重大突破从来不是通过简单地依赖数据归纳而来的——若仅靠归纳,即便在牛顿力学的数据中循环一万年,依然无法沦出“时空弯曲”的广义相对论。爱因斯坦之所以成为历史伟人,正是由于他能够在极其稀缺,并与主流认知相悖的数据面前,大胆构想出全新的物理法则,完成了人类认知的飞跃。如今的AI虽然能够迅速跟随已有的步伐,但若前方没有现成的踪迹,它根本无法实现飞跃。
许多人或许会联想到我之前提到的OpenAI通过调动近万个AI智能体,仅用时88小时和1300亿Token解决了困扰人类近一个世纪的纳维-斯托克斯方程的问题。那么,既然能够轻松解决这类数学难题,为什么在面对一个多世纪前的相对论时却完全失去了反应呢?MIT与DeepMind的计算机科学家们揭示了两个领域之间的本质区别:数学是一种规则明确的“闭环迷宫”,而物理范式的革命则是在一片虚无荒原中进行的“无中生有”。在处理纳维-斯托克斯方程时,逻辑链条是封闭的,每个推导都是可以被判断正误的,且有精密的代码和公理实时监控大模型的表现,从而发挥它的计算优势,通过合力试错与穷举探索建立起巨大规模的运算美学。