Google提出LEAP框架:通用大模型借助可迭代证明蓝图,形式化数学通过率跃升至70%

Google LEAP用可迭代证明蓝图,让通用大模型在形式化数学证明中大幅提效。

原文标题:破解率从低于10%直升70%,Google团队凭「可迭代的数学证明」斩获Putnam竞赛满分

原文作者:数据派THU

冷月清谈:

Google Cloud AI Research 与 Google DeepMind 团队发布论文《LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks》,指出通用大模型在形式化数学证明中表现差,未必是数学能力不足,而是缺少与 Lean 验证器进行结构化交互的工作流。LEAP 不要求模型一次性写出完整证明,而是先生成非正式证明蓝图,将复杂目标拆成支持性引理,并用 AND-OR DAG 维护可迭代的证明计划。研究团队还构建了 Lean-IMO-Bench,用 60 道正式化后的 IMO 风格难题测试模型的机械验证能力。结果显示,通用 LLM 的单发求解率原本低于10%,在 LEAP 框架下提升至70%;在 2025 Putnam 竞赛测试中,传统单发生成模型得分为0,而 LEAP 完成12题全解。文章认为,通用基础模型结合合适的智能体工作流,可能比单纯依赖高度专用化证明模型更具潜力,未来混合架构或将成为形式化数学推理的重要方向。

怜星夜思:

1、LEAP 的提升到底说明了什么:是大模型真的更会数学了,还是工作流设计更聪明了?
2、如果通用大模型加智能体框架已经能做到这么高,通过专用证明模型还有必要吗?
3、形式化数学证明如果继续突破,会最先影响数学研究、软件验证,还是AI训练本身?
4、Putnam 12题全对听起来很震撼,但这种竞赛成绩能代表真实数学能力吗?

原文内容

图片
来源:ScienceAI
本文约1500字,建议阅读5分钟
用大模型把数字证明拆成一张可迭代的施工图。


在通用人工智能(AGI)的发展之路上,形式化数学证明(Formal Theorem Proving)一直被公认为是最难啃的硬骨头之一。

在 Lean 这种严苛的机械验证语言面前,哪怕是人类最顶尖的非正式数学推理模型,一旦被要求一次性写出完美的完整证明,其通过率往往惨不忍睹,甚至不足 10%。这种尝试的失败,过去常被归咎于通用模型的数学底层能力不足,迫使整个学术界走向了高成本、重度依赖微调的专用证明模型(Specialized Provers)路线。

2026 年 6 月 3 日,Google Cloud AI Research 与 Google DeepMind 团队发表的一篇论文彻底打破了这一迷思:「LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks」文内表示,这种弱点不仅仅是模型的数学能力问题,而是使用方式的问题——缺少与验证器的结构化交互。

论文链接:https://arxiv.org/abs/2606.03303

LEAP

前文已提出当下研究界的主流路线:很多工作依赖专门的 prover model,并默认通用 LLM 不够适合严谨的 formal theorem proving。

针对此,研究团队推出了 LEAP(意为跃迁) 智能体框架。在不进行任何专用微调的前提下,LEAP 直接让通用 foundation 模型在极其硬核的 Lean-IMO-Bench 上将形式化求解率直接拉升至 70%,并在极其艰难的 2025 年普特南数学竞赛(Putnam 2025)中斩获了 12 题全对(100% 胜率) 的绝佳成绩。

LEAP 不是一次性综合完整证明,而是逐步绘制蓝图,将精益目标分解为支持引理,并以 AND-OR DAG 形式维护不断演变的证明计划。

图 1:LEAP工作流程。

它先尝试直接形式化内容;如果失败,就生成一个 informal blueprint,把大问题拆成一串支持性引理,并把这些依赖组织成一个 AND-OR DAG。这个 DAG 不只是记录进度,还承担交错非正式-形式规划与预见引理规划职能。

Lean-IMO-Bench

为了避免在已经饱和的基准上做表面文章,作者新建了 Lean-IMO-Bench,把 IMO-Bench 里的挑战题正式化到 Lean 中。这个基准保留了题目短、但证明很长、很绕、很非套路的特征,专门测试模型是否真的能把一串复杂推理落到机械可验证的证明上。

这个基准测试包含 60 个问题,涵盖了代数、数学、数论、几何等方面,并由专家手工形式化再复核一次。团队对其的期望是成为对形式化定理证明更尖锐的测量尺,而不是简单换个题库。

在最新的 2025 Putnam Competition 这场惨烈的比拼中,传统的单发生成模型全军覆没,得分为 0。而 LEAP 凭借精妙的 DAG 蓝图设计,直接斩获 100% 满分。论文把这和近期一些前沿形式推理系统并列看待,说明它已经进入了形式化数学的最前沿区间。

表 1:Putnam 2025 的竞赛成绩。

更有代表性的,是 LEAP 在 Lean-IMO-Bench 上的提升:通用 LLM 的原生单发胜率从 10% 以下 提升到 70%,这个成绩将之前号称达到 IMO 金牌标准的专用系统 Aristotle 远远甩在了身后。

表 2:基础与高级题集中的分类求解率。

从空白到直白

LEAP 的成功带来了需要思考的问题:我们真的需要倾注所有资源去无限微调那些极度偏科、缺乏泛化能力的专用小模型吗?

答案是否定的。通用的 FM 本身就蕴含着一片未被完全开发的浩瀚汪洋。它们海量的常识、出色的宏观规划能力和长文本逻辑留存,搭配恰当的学术支架,完全可以在专业壁垒极高的领域上演从无到有的逆袭。

未来团队的主要目标是突出通用大型语言模型在代理式工作流中的独立强大性,但他们也给出了超出现有文本之外的期待:结合基础模型的高层结构推理与精细调优的专业模型中专注、形式化的步骤生成相结合的混合架构,将会成为一种极为高效的设计。

相关链接:https://x.com/rohanpaul_ai/status/2062658115603218493

编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



我觉得未来不是二选一,而是分层合作。大模型像项目经理,专用模型像熟练工,Lean 验证器像质检。项目经理再聪明,也不能自己把每块砖都砌完。

2 个赞

专用模型肯定还有必要。通用模型负责宏观规划,专用 prover 负责局部证明生成,这种组合听起来才是正解。就像写论文的人和改格式的人不是同一个岗位,但都很重要。

1 个赞

竞赛像打排位,研究像开荒副本。LEAP 排位上王者了,很牛;但能不能开新地图,还得看后续。

1 个赞

针对“专用证明模型还有没有必要”:我觉得必要性会下降,但不会消失。形式化证明里很多步骤非常机械、非常依赖库检索和 tactic 选择,专用模型在这些细节上可能仍然更省算力、更稳定。

3 个赞

数学研究也会被影响,但不是替代数学家,而是变成“证明助理加强版”。人负责提出猜想和路线,AI 帮你补引理、查漏洞、形式化。以后数学家可能要多学点 Lean,不然像不会用 LaTeX 一样尴尬。

3 个赞