DeepMind论文重提科学发现难题:大模型为何还迈不过“爱因斯坦式跃迁”?

DeepMind认为,大模型缺的不是知识,而是提出新公理的“科学跃迁”。

冷月清谈:

文章围绕 DeepMind 论文《LLMs can't jump》展开,讨论大语言模型能否在掌握既有科学知识后独立完成真正的科学发现。论文以“如果把1905年前后爱因斯坦可获得的全部知识交给今天的AI,它能否提出广义相对论”为思想实验,认为答案是否定的。关键并非知识不足或计算力不够,而是当前模型缺少从物理经验跃迁到基础公理的能力。文章指出,爱因斯坦提出等效原理并不是由数据或公式直接推导,而是来自自由落体、电梯、加速度等物理直觉的抽象。论文将这类过程称为“溯因跃迁”,它位于数据建模和演绎验证之前。大语言模型虽然能处理符号、公式和文本关系,却缺少与真实物理世界的锚定。未来若要让AI更接近科学家角色,可能需要可交互的世界模型、反事实实验能力,以及能约束搜索方向的物理先验。

怜星夜思:

1、如果AI缺少真实物理经验,那机器人或世界模型能补上这块短板吗?
2、科学发现里最关键的是直觉、数据,还是数学推导?
3、大语言模型现在算不算“理解”科学?还是只是会说科学语言?
4、如果未来AI真的能提出新公理,人类科学家的角色会变成什么?

原文标题:把1905年的全部知识交给AI,它能成为下一个爱因斯坦吗?DeepMind重新审视科学发现缺失的那一步

原文作者:数据派THU

原文内容

图片
来源:ScienceAI
本文约2300字,建议阅读5分钟
关于世界模型与科学创造的那一下跳跃。


2024 年以来,大语言模型不断刷新人们对人工智能能力的认知。从自动证明数学定理,到辅助科研,再到能够自主完成实验规划,越来越多研究开始讨论一个更大胆的问题:如果把人类已有的全部科学知识交给 AI,它是否能够完成下一次真正意义上的科学发现?

DeedMind 在他们的论文「LLMs can't jump」中这个问题具体化为一个更经典的思想实验:如果把 1905 年前后爱因斯坦能够接触到的全部知识交给今天的大语言模型,它还能独立提出广义相对论吗?

答案是不能。原因并不在于模型缺少知识,也不是计算能力不足,而是目前的大模型仍然缺失科学发明过程中最关键的一步——从物理经验跃迁到基础公理(Axiom)的能力。

论文链接:https://philsci-archive.pitt.edu/28024/1/Scientific_Invention_Position_Paper%20%2817%29.pdf

科学发现并不是推导

今天回顾广义相对论,人们往往会把注意力集中在复杂的张量计算、黎曼几何或者爱因斯坦场方程上。但论文指出,这些实际上属于发现之后的数学推导。真正困难的地方,是在所有数学开始之前——为什么会想到引力和加速度等价?

论文认为,爱因斯坦完成科学发明并不是遵循一条连续的逻辑推导链,而是经历了一次从物理体验到抽象公理的跃迁。

最著名的例子便是「自由落体中的电梯」。

当一个人身处自由下落的电梯内时,他会短暂失去重量;而如果身处远离引力、持续向上加速的飞船中,又会重新感受到与重力几乎一致的作用力。正是这种来自现实世界的感知体验,让爱因斯坦提出了后来被称为等效原理(Equivalence Principle)的思想:局域范围内,引力与加速度无法区分。

这一原理并不是由实验数据直接推导出来,也不是数学公式计算得到,而是一种建立在物理直觉上的假设。随后,爱因斯坦才进一步发展出时空弯曲、测地线、应力—能量张量以及最终的场方程,将这一思想不断扩展为完整理论体系。论文认为,这一步才是真正意义上的科学发明起点。

一条被忽略的科学发明路径

围绕这一历史案例,DeppMind 进一步提出,现代 AI 对于科学发现过程的理解其实过于简单。

目前,大多数自动科学发现框架通常默认遵循这样一条路径:

数据 → 建模 → 验证 → 新理论。


图示:爱因斯坦 E-J-A 图表的生成式人工智能重构图。

但实际上,中间隐藏着最重要的一个概念——Abductive Jump(溯因跃迁)。这并非传统意义上的统计推断,更像是面对现象时,主动提出一种能够解释这些现象的新假设。爱因斯坦真正完成的正是这样一次跃迁——他并没有根据已有理论进行推导,而是提出了一个此前从未存在的新公理。

只有完成这一步之后,科学研究才进入人们熟悉的 Deduction(演绎)阶段。数学推导负责不断扩展理论、导出可验证预测,再通过实验完成最终验证。

图示:爱因斯坦等效原理的思想实验(AI 生成)。

AI 究竟缺少了什么

如果说前文叙述了为什么 Abductive Jump 如此重要,接下来就是今天的大模型为什么完成不了这一步。

这里可以套用一下「中文房间(Chinese Room)」的思想实验。在外部看来,一个不会中文的人,只要按照规则手册操作,也能够输出正确的中文回答;但实际上,他并没有真正理解这些文字所对应的意义。

同样,大语言模型能够熟练运用物理学语言、推导公式,甚至讨论广义相对论,却始终停留在符号层面,它理解的是不同符号之间的统计关系,而不是这些符号所对应的物理世界。

这种缺乏物理锚定的问题,正是模型无法完成科学发明的原因。

对于大语言模型而言,「重力」「加速度」「自由落体」都只是训练语料中的词汇,它们之间虽然能够形成复杂的语言联系,却没有对应的真实物理经验。因此,大模型能够完成演绎推理,却难以从经验中建立新的公理体系,也就无法完成文中所说的 Abductive Jump。

所谓世界模型

目前的大多数视频生成模型,例如能够模拟自然运动的视频模型,确实已经表现出一定的「直觉物理」。但这归根结底只是来自于训练数据,而非真正的理解。真正值得关注的是另一类能够进行交互式模拟(Interactive Simulation)的世界模型。

以 Google DeepMind 提出的 Genie 为例,这类模型最大的变化并不是画面更加真实,而是在生成环境之外,引入了可操控的动作空间(Action-controllability)

图示:世界模型的仿真(AI 生成)。

如果希望 AI 重复爱因斯坦关于电梯的思想实验,仅仅生成一段电梯下落的视频是不够的。真正重要的是让它主动改变实验条件,例如「剪断电梯钢缆」「改变加速度」「修改引力方向」,并不断比较这些不同假设带来的物理后果。

一种直觉

不过,论文内也指出,即使拥有世界模型,AI 也未必能自动产出科学发明。爱因斯坦完成广义相对论并不仅仅依赖模拟能力,还拥有一种能够主动缩小搜索空间的 Physical Prior(物理先验)。这种先验并不是数学公式,而是一种关于世界如何运行的强烈直觉。

如果未来世界模型能够提供稳定、可交互的物理环境,使 AI 拥有持续进行反事实实验的能力,再结合能够约束搜索方向的世界先验,那么连接经验、直觉与逻辑之间的那一步,或许才真正有机会被自动化。

真正的创造从来不是已有知识的简单重组,而是在经验世界中建立新的公理,再由数学和实验不断验证它们。当 AI 开始尝试迈向科学家而不仅仅是科学助手时,这个关于「如何产生第一性假设」的问题才会更具价值。

相关链接:https://x.com/HowToPrompt__/status/2081739847614845288

编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



说句不严肃的:数据像食材,数学像厨具,直觉像知道今天要做什么菜。只有食材和锅,AI可能能炒出一桌“看起来很科学”的菜,但未必能发明新菜系。

3 个赞

我倾向于谨慎乐观。现在的视频世界模型更多像“会梦到物理规律”,但不一定知道自己梦得对不对。要补短板,关键可能不是生成多逼真的画面,而是能不能主动问:如果我把这个变量改掉,会发生什么?

2 个赞

回答一下第一个问题:世界模型像是给AI装了个“脑内实验室”,机器人像是给它装了手和脚。可问题是,爱因斯坦不是因为坐过一次电梯就悟了,他是能从电梯里抠出一个宇宙级设定。这一步目前还挺玄学。

1 个赞

这个问题不能简单说“只是鹦鹉学舌”。大模型内部确实可能形成了复杂的抽象表示,不然很难完成跨领域迁移。但它的弱点也明显:这些表示主要来自文本统计,而不是来自对世界的主动干预和纠错。

1 个赞

针对“直觉、数据、数学谁最关键”,我觉得不同阶段答案不一样。发现早期直觉更重要,理论成型阶段数学更重要,验证阶段数据更重要。硬要选一个,可能是能把三者串起来的人最关键。

3 个赞

从科学史看,工具越强,科学家的问题意识越重要。望远镜没有取代天文学家,粒子加速器也没有取代理论物理学家。AI如果能提出新公理,人类角色可能会转向设定研究目标、制定验证标准和解释理论意义。

1 个赞