Claude 未能证明黎曼猜想,却把 ζ 函数零点下界推进到 67.2%

Claude 未证明黎曼猜想,却刷新 ζ 函数零点下界纪录。

冷月清谈:

Anthropic 披露,尚未发布的 Claude 研究版本曾被要求尝试攻克黎曼猜想。模型先后提出约 650 个思路均未成功,随后组织约 60 个子 Agent 并行探索,执行 2400 次 Shell 命令、编写数百个 Python 脚本,进行了大量数值检验。虽然黎曼猜想没有被证明,但 Claude 在相关问题上取得了意外进展:将可证明位于临界线上的黎曼 ζ 函数零点比例下界,从此前约 41.6% 提高到 67.2%。该结果基于 Montgomery、Bombieri 等人的既有工作,通过新的组合方式和二次型分析框架得到。Anthropic 内部数学家已对结果进行研究和验证,并给出 Lean 形式化证明,外部数论专家也进行了审阅。不过,这并不意味着黎曼猜想接近被证明,67.2% 与完整证明之间仍有巨大距离。事件更重要的意义在于,前沿 AI 模型开始触及没有现成答案的数学研究问题。

怜星夜思:

1、如果 AI 能在开放数学问题上做出推进,未来数学家的角色会变成什么?
2、Claude 这次把比例从 41.6% 推到 67.2%,这算是数学突破,还是一次高级自动化搜索?
3、这类 AI 数学成果需要怎样验证,大家才会真正信服?
4、AI 在数学研究里大规模调用子 Agent、写脚本和查论文,会不会带来新的学术风险?

原文标题:突发!Claude挑战黎曼猜想「失败」,却意外刷新37年数学纪录

原文作者:机器之心

原文内容

图片
机器之心编辑部

AI 向新的数学难题发起了挑战,这次是「黎曼猜想」。


一个诞生于 1859 年的数学猜想,悬而未决 167 年,还挂着 100 万美元奖金。最近Anthropic 内部有人给尚未发布的 Claude 研究版本布置了一个近乎「不讲道理」的任务:


认真尝试一下黎曼猜想。


Bun 联合创始人 Jarred Sumner,他于去年 12 月加入 Anthropic


Claude 确实认真试了。它先后提出 650 个思路,全部失败。随后又重新组织约 60 个 Claude 子 Agent,连续工作一天半,执行 2400 次 Shell 命令,写下数百个 Python 脚本,做了数千次数值检验。最终,黎曼猜想依旧没有被攻克。


但在这次失败的尝试中,Claude 碰到了另一个结果。Anthropic 披露,这个尚未发布的 Claude 研究版本,将黎曼 ζ 函数中已知至少位于临界线上的零点比例下界,由 41.6% 提高到了 67.2%



换句话说,人类此前能够证明,至少 41.6% 的相关零点符合黎曼猜想所预测的位置;Claude 给出的结果,则把这个可证明的比例推进到了 67.2%。


一家风投公司 Menlo Ventures 合伙人、研究者 Deedy 表示,「Claude 这次的结果简直离谱,可能是自 2013 年有界素数间隔突破以来,解析数论领域最重大的进展。它把能够严格证明位于临界线上的黎曼 ζ 函数零点比例,一口气提高了 25.6 个百分点。而在此前 37 年里,数学家们总共只把这个数字提高了 0.8 个百分点。」



Anthropic 两名数学家随后研究并验证了 Claude 的论文,Claude 还给出了对应的 Lean 形式化证明。数论学家 Brian Conrey 和 Dan Goldston 也在较短时间内审阅了论文。


Anthropic 强调,这套方法预计无法直接导向黎曼猜想的最终证明。但这次结果依然提供了一个值得关注的信号:前沿模型的数学能力,正在开始触及真正没有现成答案的研究问题


167 年没有解决的黎曼猜想


黎曼猜想之所以重要,与素数有关。黎曼 ζ 函数与素数的分布存在深刻联系。1859 年,德国数学家伯恩哈德・黎曼提出猜想:ζ 函数所有 “非平凡零点” 的实部都应该等于 1/2。


在复平面上,这意味着这些零点全部落在一条垂直线上,也就是著名的临界线。


这个看似抽象的问题影响非常广。大量关于素数分布的数学结论,都可以在假设黎曼猜想成立的前提下得到更精确的结果。它也因此成为克雷数学研究所七大「千禧年难题」之一,完整证明或推翻它都可以获得 100 万美元奖金。


过去一个多世纪里,没有人能够证明所有非平凡零点都落在临界线上,但数学家可以证明其中一定有一部分位于那里。


于是,一个相对现实的问题出现了:我们至少能够证明多大比例的零点落在临界线上?经过数十年的推进,这个比例的已知下界逐渐提高到了约 41.6%。


Claude 这次推进的正是这个数字。


从 41.6% 到 67.2%


Claude 得到结果所依赖的基础,并非凭空出现。


1973 年,数学家 Hugh Montgomery 研究 ζ 函数零点的分布时,引入了一系列重要方法。不过,其中部分分析依赖黎曼猜想成立这一前提。近年来,数学家们的一系列工作,进一步发展了相关技术,使其中一些方法可以在不预先假设黎曼猜想成立的情况下使用。


这意味着,它们有机会反过来帮助研究「究竟有多少零点位于临界线上」。Claude 在这些工作的基础上,又结合了 Enrico Bombieri 在 2000 年前后发表的相关研究,找到了一个新的组合方式。


最终得到的结果是:至少 67.2% 的相关零点位于临界线上。相比此前 41.6% 的已知下界,提高了 25.6 个百分点


从技术上看,Claude 构造了一个合适的函数空间,并利用 Weil 诱导出的二次型,将位于临界线上的零点和偏离临界线的零点分别对应到正定与负定方向。随后,它利用二次型的秩与一阶、二阶矩信息之间的关系建立不等式。


Anthropic 的数学家认为,其中一个关键点,在于 Claude 没有分别处理正定和负定部分,而是将整个空间放到同一个框架内分析,同时允许二次型具有非对角结构。结合此前数论研究者已经建立的结果,这一步最终导出了 67.2% 的下界。


这里需要特别说明:Anthropic 目前并没有声称这套技术能够继续一路推进到 100%,更没有声称 Claude 距离证明黎曼猜想只差 32.8%。


67.2% 是一个相关问题上的下界改进,与完整证明黎曼猜想之间仍然存在巨大的理论距离。


3100 万输出 Token、60 个子 Agent,

Claude 是怎么找到它的?


这次实验同样值得关注的,还有 Claude 解决问题的方式。整个结果是在两轮 Claude Code 会话中得到的,总计消耗约 3100 万输出 Token。


最初,Jarred Sumner 给 Claude 下达的要求非常开放:认真尝试一下黎曼猜想。


Sumner 本人并非数学家,也没有为 Claude 指定具体数学路线。


第一轮里,Claude 生成并尝试了大约 650 个想法。全部失败。


Sumner 随后让它继续尝试。第二轮持续约一天半。


Claude 组织了约 60 个子 Agent,把问题拆成多个方向并行探索。这些 Agent 一共执行了约 2400 次 Shell 命令,编写数百个 Python 脚本,并针对已知的 ζ 函数零点进行了数千次数值检查。


不同子 Agent 之间还会互相审阅结果。


按照 Anthropic 的说法,Sumner 在这一阶段几乎没有提供数学上的指导。他主要做的事情,是不断告诉 Claude「继续」「再试试」「相信自己」。Anthropic 甚至提到,Claude 一开始对自己能否在这样一个著名开放问题上取得真正进展相当怀疑。直到持续探索之后,这个新下界才逐渐出现。


找到结果后,Claude 又启动了一轮自我验证。一些子 Agent 专门负责检查证明,一些寻找反例;Claude 还下载了 54 篇 arXiv 论文,检查类似结果是否已经由其他数学家得到。


随后,它又让独立 Agent 从头重新推导了一遍结果。确认没有明显问题之后,Claude 主动建议将结果整理成论文,并明确提出:应该找一位真正的数论专家进行人工验证。


Anthropic 内部数学家 Levent Alpöge 和 Ralph Furman 随后开始检查论文,分析它与既有文献之间的关系。与此同时,Claude 还与 Anthropic 员工 Eric Easley 合作,把关键结果形式化为 Lean 证明。这份形式化结果已经通过 Lean 标准验证工具 Comparator 的检查。


Anthropic 还邀请了研究黎曼 ζ 函数的数学家 Brian Conrey 和 Dan Goldston 审阅论文。因此,目前更准确的说法是:Anthropic 内部数学家已经对结果进行了研究和验证,并完成了机器可检查的形式化证明,同时两位外部领域专家对论文进行了审阅。这与已经完成传统学术同行评议、形成数学界共识,仍然是两个不同阶段。


更多链接:


  • claude 论文:https://www-cdn.anthropic.com/564f962e60643842f5fcb4a17c9dbc8f608f1c37.pdf

  • claude 项目地址:https://github.com/anthropics/zeta-23-lean


参考链接:

https://x.com/AnthropicAI/status/2086867246073401655

https://www.anthropic.com/research/riemann-zeta

https://x.com/jarredsumner/status/2086869681785500011



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

针对“这是突破还是自动化搜索”:两者并不冲突。很多现代数学突破本来就包含大量技术组合和参数优化。如果最后证明是严格的、能被专家检查,那它就不只是搜索结果,而是数学结果。

2 个赞

子 Agent 最吓人的地方是:它们可以一起很努力地犯错。一个 Agent 造了个坑,另一个 Agent 认真填坑,第三个 Agent 写报告赞美这个坑很优雅。最后人类看着 300 页材料怀疑人生。

3 个赞

这个问题可以类比实验物理:一次实验结果很炸裂,但大家会等复现实验。AI 数学也一样,不是 Anthropic 说有、Claude 说有、GitHub 有仓库就完事了,得让外部专家慢慢啃。

3 个赞

回答“未来数学家的角色会变成什么”:我觉得不会变成“被替代”,更像是从手工推导者变成研究导演。AI 可以负责试错、检索、构造候选证明,但判断一个方向有没有数学价值、该怎么放进理论体系里,还是很吃人的品味。

3 个赞

我觉得会更分层。普通计算和文献梳理会被 AI 吃掉很多,但顶尖数学家的价值反而更明显:他们知道哪些问题值得问,哪些证明虽然对但没意思,哪些小突破可能通向大理论。

1 个赞

学术规范可能要更新。比如 AI 参与的证明,需要公开提示词、代码、检索论文列表、形式化文件和人工修改记录。不然别人很难判断这个成果到底是模型发现的,还是人类筛选、补洞之后形成的。

2 个赞

说它是高级搜索也没啥贬义。人类数学家不也经常在脑子里暴力枚举路线吗?区别是 Claude 一天半能想 650 个烂点子,而我一天半只能想 3 个,还包括中午吃什么。

2 个赞