微软rStar2-Agent:14B模型在数学推理上超越巨型模型DeepSeek-R1的关键创新

微软rStar2-Agent:14B模型通过主动式强化学习,在数学推理上超越671B大模型,展现小模型巨大潜力。

原文标题:14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1

原文作者:机器之心

冷月清谈:

大型语言模型(LLM)的推理能力通常依赖于延长思维链和大规模强化学习。然而,对于复杂问题,传统方法面对中间错误识别和纠正的局限性日益凸显,需要模型具备“更聪明”的思考能力。微软研究院最新推出的rStar2-Agent正是为了实现这一目标,它采用主动式强化学习,使模型能够与专用工具(如Python编程环境)交互,并根据实时的反馈信号调整推理方式。令人瞩目的是,仅有14B参数的rStar2-Agent-14B模型,在数学推理性能上媲美甚至超越了671B的DeepSeek-R1等领先模型。

该研究解决了在使用编程工具进行主动式强化学习时的两大挑战:一是环境噪声引入的推理错误和低效的“仅结果奖励”机制;二是大规模主动式强化学习训练对基础设施的高要求。为此,rStar2-Agent引入了三大创新:首先,构建了高效可靠的基础架构,能够处理数万次并发工具调用,并通过负载均衡的调度程序最大限度提升计算利用率,显著提高了训练效率。其次,提出了基于正确重采样的组相对策略优化(GRPO-RoC),它通过非对称采样策略,筛选高质量的正确轨迹进行正向监督,同时保留信息丰富的负向信号,有效解决了稀疏奖励和环境噪声问题,提升了模型对Python编程工具的使用效率和推理简洁性。最后,设计了一套优化的训练方案,从灌输基础指令遵循和工具使用的非推理SFT阶段开始,避免了过拟合,随后进行多阶段、成本受控的强化学习训练,快速使14B模型达到了前沿数学推理水平。

最终结果显示,rStar2-Agent-14B在AIME24、AIME25和HMMT25等多个数学推理基准上均表现优异,甚至在部分任务上领先于Claude Opus 4.0。该模型还展现了良好的泛化能力,在科学推理和Agent工具使用任务中也取得了有竞争力的结果,证明了主动式强化学习在提升小模型认知能力方面的巨大潜力。

怜星夜思:

1、这次微软rStar2-Agent-14B用体量小得多的模型实现了超越,大家觉得未来AI发展趋势会更偏向“大而全”还是“小而精”呢?我们普通用户能从这种“小而精”的突破中获得什么好处?
2、文章里rStar2-Agent通过Python编程工具才实现了这么好的效果。大家觉得以后AI Agent能用上更多、更复杂的“工具”吗?比如像设计软件、多媒体编辑工具,甚至直接操控物理设备,那是不是就能实现更智能的Agent了?
3、文中提到虽然是强化学习,但他们通过优化各种方案大大降低了训练成本。对于我们这些没有巨头公司那么多GPU资源的研究者或小团队来说,这种“以小搏大”的训练思路有什么实操性建议吗?比如从数据集、模型架构选择上怎么做?

原文内容

机器之心报道

编辑:Panda


现在,LLM 已经可以获得非常强大的推理能力,而其中关键便是测试时扩展(test-time scaling)


通常而言,延长思维链(CoT)就可以延长「思考时间」,从而显著提升性能,尤其是当使用大规模强化学习和可验证奖励 (RLVR) 进行优化时。


然而,对于容易出现细微中间错误或需要创造性推理转变的难题,较长的思维链仍然存在根本性的局限性。在这些情况下,模型往往依赖内部的自我反思,但这又常常无法发现错误,也无法在初始方法存在缺陷时进行自我纠正。


因此,模型不仅要能更长时间地思考,还应该要能「更聪明」地思考。为此,可以引入更高级的认知能力,让模型可以自主地利用合适的工具,从工具环境提供的反馈信号中进行推理、验证和学习。


近日,微软研究院的一个研究团队探索了使用主动式强化学习(agentic reinforcement learning)来实现这一目标,也就是说,模型会与专用工具环境中的工具进行交互,并根据收到的反馈调整其推理方式。


而他们的探索成果便是 rStar2-Agent,这是一种强大的主动式强化学习方法。使用该方法,这个微软团队训练了一个 14B 的推理模型 rStar2-Agent-14B—— 该模型达到前沿级别的性能,媲美甚至超越了 671B 的 DeepSeek-R1!



这项研究在社交网络上获得了广泛关注。



下面我们就来简单了解一下微软是如何造出了这个能以小搏大的模型。



  • 论文标题:rStar2-Agent: Agentic Reasoning Technical Report

  • 论文地址:https://arxiv.org/pdf/2508.20722

  • 代码地址:https://github.com/microsoft/rStar


环境与问题描述


本研究使用的环境是 Python 编程工具和解释器。



Python 编程工具可拓宽模型的行动空间,使其能够探索替代方案并验证中间步骤,从而在单靠较长的 CoT 不足的情况下补充内部的自我反思。


然而,在该环境中有效地扩展主动式强化学习非常困难。


首先,编程工具和 Python 解释器的固有复杂性会将环境噪声引入推理过程。当模型不可避免地生成语法或逻辑上错误的代码时,由此产生的环境反馈(例如,错误消息)可能会导致模型浪费宝贵的 token 来纠正错误,而不是推进推理。遗憾的是,当前的强化学习方法主要依赖于「仅结果奖励」,而这只会加剧这个问题,因为即使中间工具调用失败的轨迹仍然会获得正奖励,只要最终答案正确即可。如此一来,该模型就会将错误视为可接受的,并生成冗长且低质量的推理轨迹。


其次,大规模主动式强化学习训练对基础设施的要求很高。单个训练批次可以触发数万个并发工具调用,这使得构建可靠且响应迅速的代码执行环境变得极具挑战性。


此外,与环境交互的智能体部署会放大标准强化学习系统中部署效率低下的现象,从而显著减慢整体训练速度。


rStar2-Agent 三大创新


微软提出的 rStar2-Agent 包含三大关键创新。


第一,该团队为大规模主动式强化学习构建了一个高效可靠的基础架构


他们构建了一个高吞吐量、独立的代码环境,能够处理 45K 个并发工具调用,平均执行反馈仅需 0.3 秒即可返回。



为了解决强化学习 rollout 效率低下的问题,他们引入了一个负载均衡的 rollout 调度程序,该调度程序会根据 GPU 上可用的键值缓存容量动态分配 rollout 请求,从而最大限度地提高计算利用率。


即使在 GPU 资源有限的情况下,该基础架构也能实现高效的强化学习训练。使用 64 块 MI300X GPU,该团队仅用一周时间就完成了 rStar2-Agent-14B 的训练。


第二,为了在代码环境中实现有效的主动式强化学习,该团队提出了基于正确重采样的组相对策略优化 (GRPO-RoC),它将 GRPO 与基于正确重采样 (RoC) 的 rollout 策略相结合,以解决稀疏且仅关注结果的奖励条件下环境引起的噪声。



具体而言,RoC 首先对较大的 rollout 组进行过采样,然后下采样至标准批次大小。正向轨迹经过筛选,仅保留质量最高且工具导致错误或格式问题最少的轨迹,而负向轨迹则进行均匀下采样。



这种简单而有效的非对称采样方法将各种故障模式保留为信息丰富的负向信号,同时强调更高质量的成功案例以进行正向监督。


相比于在奖励函数中明确惩罚工具使用错误的方法,GRPO-RoC 可提高训练稳定性,并可避免 reward-hacking 的风险。


通过学习更清洁、更高质量的正向轨迹,该模型不仅能提升 Python 编程工具的使用率,还展现出高级认知能力,能够在真实的代码环境交互下更高效、更简洁地进行推理。


第三,该团队还提出了一套训练方案,能以最少的计算量将一个 14B 预训练基础模型提升到前沿数学推理水平。


不同于先前的研究(在强化学习之前应用推理密集型 SFT ),该团队从非推理 SFT 阶段开始 —— 仅用于灌输一般的指令遵循、编程工具使用和格式,而不增强推理能力。这可避免潜在的 SFT 过拟合,并保持初始平均响应较短,从而使强化学习能够更有效地培养推理能力,同时充分利用模型的预训练能力。



然后,该团队使用 GRPO-RoC 进行多阶段强化学习训练,逐渐增加任务难度和最大训练时长。不同于之前的强化学习方法,这些方法需要将 rollout 规模大幅扩展至 16K→48K 甚至更高,该团队将每个阶段的长度限制在较短的范围内(8K→12K)。这可显著降低强化学习成本,同时鼓励更高效的推理策略。


该模型仅需 510 个强化学习步骤,即可快速实现前沿水平的数学推理,展现出强大的能力和卓越的训练效率。



结果很惊艳


最终,使用新方法,他们训练得到了一个模型并将其命名为 rStar2-Agent-14B。它只有 14B 大小,但却实现了超越 DeepSeek-R1 和 Kimi k1.5 等领先推理模型的强大数学推理性能。



值得注意的是,在 AIME24 上,它的准确度达到了 80.6%,比 o3-mini (medium)、DeepSeek-R1 和 Claude Opus 4.0 (thinking) 分别高出 1.0%、0.8% 和 3.6%,在 AIME25 和 HMMT25 上分别达到了 69.8% 和 52.7%,展现了稳定一致的强大能力。



除了数学之外,尽管这里只使用数学的主动式强化学习进行训练,它仍然能够有效地泛化。



它在 GPQA-Diamond 科学推理基准上的表现优于 DeepSeek-V3,在 BFCL v3 的智能体工具使用任务上也表现不错,并在 IFEval 和 Arena-Hard 等通用基准测试中取得了具有竞争力的结果。


该团队还报告了未成功的尝试和分析,并重点介绍了由 rStar2-Agent 主动式强化学习带来的对更高级认知推理行为的发现,例如驱动更有效推理的环境反馈反思 token。


更多分析和消融研究请见原论文。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

针对问题3的回答:
感觉就是告诉我们,“省钱也是一种技术活”!哈哈。对于咱们来说,就是别老想着“大力出奇迹”,而是要“巧力出神迹”。比如数据集,就跟做菜一样,不是料越多越好,而是要食材新鲜,配料精准。模型架构嘛,就选个“瘦身版”的,然后通过高效的“教练”(训练范式)来调教它,让它在某个技能上远超那些“大块头”。可能以后我们小团队的项目,用上这种思路,也能做出让人眼前一亮的AI产品,不用羡慕那些“有钱人”啦!

针对问题2的回答:
想想都觉得激动!如果AI Agent能用上各种工具,那简直就是“钢铁侠”里的贾维斯现实版!它不仅仅是聊天、写代码,而是可以直接帮我画出脑海中的设计图,剪辑视频里的精彩瞬间,甚至帮我改装家里的智能设备。未来可能我们只要说一句“帮我设计一个能自动浇水的花园并下单购买材料”,AI Agent就能真的联动各种软件和外部商家帮你搞定一切。感觉我们离电影里的智能生活更近了,就怕它哪天觉得自己无所不能,直接把人类从地球上“优化”掉了。

针对问题1的回答:
我觉得这绝对是好事!“小而精”的模型意味着更低的运行成本,更快的响应速度,甚至可能直接部署到我们自己的设备上。想想看,以后我们的手机、智能家居都能跑上这种高效的AI,本地就能处理很多复杂任务,既保护隐私,又不用担心网络延迟。对开发者来说,也能降低门槛,不再是只有财大气粗的公司才能玩转AI了。可能我们很快就能看到更多针对特定场景的App或服务,用起来又快又好,而不是现在一个万能大模型啥都想干反而啥都没干好。

针对问题1的回答:
这个问题很有深度。从技术角度看,“小而精”的路径意味着我们正在深入挖掘每个参数的潜力,通过更精妙的训练范式(比如主动式强化学习)和数据高效利用来提升特定领域性能。这并不完全否定“大而全”,因为基础大模型仍然是许多高级能力的基石。但这种趋势预示着未来可能会出现更多专业化、高性能的定制模型,它们在特定任务上可能超越通用大模型,同时拥有更低的部署成本和更高的效率。对于普通用户而言,这意味着未来我们可能会在设备侧(如手机、电脑)体验到更智能、响应更快的AI助手,或者在特定行业(如医疗、金融)享受到更专业、更精准的AI服务,而且这些服务的成本可能会因为模型小型化而降低。

针对问题2的回答:
从技术上看,集成更多工具是可行的,但复杂性会指数级增长。编程工具相对比较结构化,有明确的语法和逻辑。但像设计软件、多媒体编辑工具,它们的“动作空间”和“反馈信号”会复杂得多,Agent需要理解的不仅仅是按键和菜单,更是背后的创作意图和美学判断。至于直接操控物理设备,这涉及到安全、伦理和实时的环境感知。一个细微的错误都可能造成无法挽回的后果。所以,技术上是可能的,但安全性和可靠性将是关键,需要极其严格的测试和监管。而且,教会AI“理解”人类的模糊指令和意图,始终是最大障碍。

针对问题2的回答:
当然可以,这是AI Agent发展的重要方向。Python编程工具只是一个起点,它提供了逻辑推理和数据处理的能力。未来的AI Agent如果能与CAD、Photoshop这类设计软件集成,甚至通过API或物理接口控制机器人手臂、无人机等硬件设备,那将极大地扩展其在现实世界中的应用范围。挑战在于如何建立高效的工具API接口、如何让Agent理解不同工具的语义和操作逻辑,以及如何处理复杂环境中的不确定性。一旦这些问题得到解决,我们将会看到能够自主完成设计、制造、甚至科学实验的Agent,这将是真正意义上的“通用人工智能”迈出的关键一步。

针对问题3的回答:
这篇文章的核心启发是,并非所有任务都必须依赖“巨无霸”模型。对于资源受限的团队,可以从以下几方面考虑:首先,数据集方面,与其追求海量数据,不如聚焦于高质量、任务相关的SFT数据,并考虑数据增强策略。文中的“非推理SFT”阶段,即灌输基础能力,是个很好的思路,可以降低后续RL的探索成本。其次,模型架构选择上,不再盲目追求最大参数量,而是选择参数效率更高的基座模型,并针对特定任务进行深度优化。最后,也是最关键的,训练范式上要善用像“主动式强化学习”这类能让模型“更聪明地思考”的方法,让模型通过高效的工具交互和反馈学习,而不是简单地堆砌计算。GRPO-RoC的非对称采样思想也值得借鉴,即在有限的rollout中最大化学习效率。

针对问题3的回答:
我觉得最有价值的一点就是他们没直接拿个大模型去硬怼,而是通过非常巧妙的训练流程和资源调度来“省钱”。对咱们普通团队来说,首先得明确目标任务,然后找那个任务领域内“刚刚好”够用的模型,别一开始就想着上百亿参数。数据上,与其花大价钱买通用数据,不如自己精细标注一小部分高质量的特定任务数据来做微调。工具集成这块,没必要一上来就想让AI操控所有,先从文章提到的编程解释器这种相对规整的外部工具开始,逐步扩展。还有就是他们的rollout调度器和高效环境,这部分可能对小团队来说搭建难度大,但可以借鉴其思想,比如优化代码,减少不必要的计算,提升每次rollout的价值,而不是盲目增加rollout次数。