GPT-5.6 Sol 连跑 33 小时挑战费马大定理:是算力限制、系统机制,还是能力保留?

GPT-5.6 Sol 连跑 33 小时挑战费马大定理,最终被系统终止,引发算力、能力开放与AI科研边界讨论。

冷月清谈:

Michael P. Frank 近日让 GPT-5.6 Sol 持续运行约 33 小时,尝试寻找费马大定理较怀尔斯—泰勒证明更简洁的路径。模型围绕 Frey 曲线模性、一致无限下降法、abc 型不等式等方向展开推理,并记录了候选引理与计算验证结果。最终任务被 OpenAI 系统强制终止。模型事后分析认为,原因可能是会话占用资源过多,或类似方向此前已被尝试但失败。其产出并非新证明,而是排除了一批看似可行的路线,形成“此路不通”的研究笔记。围绕这次事件,外界出现了多种解读:有人担心 OpenAI 可能限制顶尖模型能力,掌握“什么能被发现”的权力;OpenAI 研究员 Noam Brown 则反驳称,若用户用其模型解决千禧年难题,对 OpenAI 会是极佳宣传。也有人认为,这只是 codex-cli 的常规阻挡机制或长任务 bug,并非刻意压制。

怜星夜思:

1、如果 AI 只能帮数学家排除大量“此路不通”的方向,这算不算真正的科研贡献?
2、顶级 AI 模型如果真有解决重大科学问题的能力,应该完全开放给公众,还是由机构内部先使用?
3、长时间让大模型“继续推理”,真的可能带来质变,还是大多只是更贵的原地打转?
4、如果 AI 未来真的证明了一个重大定理,署名、奖金和学术认可应该怎么分配?

原文标题:他让GPT-5.6 Sol连跑33小时攻关费马大定理,被系统强制终止

原文作者:机器之心

原文内容

图片
编辑|张倩


作为一个普通人,如果你把一道数学难题给到 AI,并一直让它「继续」,它有没有可能真的把这道题解出来,从而帮你赢得一大笔奖金,甚至改写数学发展进程?


最近,菲尔兹奖公布,大家对于数学 + AI 的讨论非常热烈,相信也有不少人想象过我刚刚描述的「爽文」剧情。


其实,现实里也真的有人在尝试,但过程并没有想象中顺利。


最近,可逆计算、计算物理学顶尖专家 Michael P. Frank 发文表示,他给 GPT-5.6 Sol 设定了一个高难度研究目标:探究费马大定理是否存在比怀尔斯 - 泰勒证明更简洁的途径,重点放在专门的 Frey 曲线模性、一致无限下降法、算术 abc 型不等式以及一致低亏格商上;保持严谨的笔记,通过计算验证候选引理,并清楚区分已证明的结果与推测。



这个任务在后台持续运行了大约 33 个小时,消耗了大量计算资源。但最终,它被 OpenAI 系统强制阻止了。


GPT-5.6 Sol 在自己给出的事后分析中写到,可能的原因有两个:一是系统判定该会话占用了过多资源;二是 OpenAI 之前已经用类似模型尝试过这个问题但失败了,这次不想再浪费算力。



Michael P. Frank 似乎赞同 GPT-5.6 Sol 的这一分析。



此外,GPT-5.6 Sol 还坦诚报告了这 33 小时所做的事情,核心是:做了不少扎实工作,把很多「听起来可行」的捷径变成了可验证的精确陈述,然后一一证伪或排除。产出是一张「此路不通」的地图,而不是证明本身。建议就此打住。


对于 OpenAI 的这种做法,还有人给出了其他可能的解读:OpenAI 可能在藏着掖着,不让模型随便解决超级牛的数学问题,怕被别人抢了风头,或者想自己拿去吹牛。这就给大家提了个醒:如果以后太依赖他们,就等于把「什么能被发现」的权力全交给他们一家了,这很危险。




但很快,OpenAI 高级研究科学家 Noam Brown 就站出来指出了这一说法的不合理性,他说:「要是有人只是输入一个 continue(继续),就用我们的模型解决了千禧年大奖难题,然后拿走 100 万美元奖金,这对 OpenAI 来说才是最好的广告,没有比这更好的了。」



听起来很有道理,但反驳者认为,开放顶尖能力给用户确实可能带来短期宣传收益,但长期看会削弱 OpenAI 在 AI 竞赛中的领先优势。在多玩家竞赛环境下,保密 / 内部优先使用强模型来加速自家研究,比让用户「抢先」解决大问题更重要。而一旦能力变得「人人可用」,宣传价值就会大幅下降。


此外,最近的监管风波也让 OpenAI 有理由保存实力。如果用户用公开版解决了高难度数学问题,就等于公开证明「这模型其实很强」,反而会引来监管麻烦。这种情况下,刻意对外提供弱化版模型,而内部保留超强版本听起来是个合理的做法。



不过,也有人从技术层面指出了另一种可能性:在 codex-cli 里,「goal blocked」的意思是模型在连续 3 个推理轮次(turns)里反复撞上同一个限制 / 阻挡点(blocker)。所以任务被组织可能是模型运行时的常规安全 / 防止卡死机制,而不是针对难题的特殊阻挡。



还有人说,这可能就是一个 bug 导致的。具体来说,5.6 版本的 Sol 在长时间运行任务时有个烦人的 bug,临时解决办法是:切换回 5.5 版本,压缩一下上下文,用 5.5 继续跑几分钟,然后再切回 5.6 版本的 Sol。「如果你想保留同一个会话(session),就会卡住出不来。」



你怎么看?欢迎在评论区分享用 AI 攻克难题或被它卡住的经历。


参考链接:https://x.com/lu_sichu/status/2081367506468360495


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com


关于“AI 证明定理后怎么署名”,我认为 AI 不应作为作者,但使用者、提示设计者、验证者、模型开发团队之间的贡献需要更细的规范。数学证明最终要靠人类共同体审核,能否被认可,不只是生成文本那么简单。

3 个赞

这个问题迟早会吵起来。假设某人只是输入“继续”,模型给出证明,那奖金给谁?平台、用户、训练数据贡献者、算力提供方都能说自己有份。现有学术制度其实没准备好处理这种情况。

1 个赞