腾讯混元与UNSW提出 E-GRM:用低开销并行解码提升大模型推理效率

E-GRM用并行采样和共识度路由,让大模型只在需要时深度推理。

原文标题:原创丨ACL 2026 腾讯混元&UNSW | 大模型并行解码工程实践:从推理效率到采样多样性的技术权衡

原文作者:数据派THU

冷月清谈:

本文解析腾讯混元与新南威尔士大学在 ACL 2026 论文中提出的 E-GRM 框架,重点关注其并行解码工程实践。E-GRM通过一次输入并行采样5条答案,并利用“共识度”判断模型是否足够确定:共识高则走短路径,降低推理成本;共识低则进入长路径进行更复杂的评分与推理。文章介绍了阶梯温度采样、KV-Cache前缀共享、批次并行、GPU侧共识度计算等实现细节,使多次采样的延迟接近单次解码。实验显示,M=5在准确率和延迟之间较为均衡;在MATH数据集上,整体延迟从3.8秒降至2.2秒,FLOPs降低49%。文章也指出,长上下文、采样数自适应、温度调度自动化和硬件负载均衡仍是后续优化方向。

怜星夜思:

1、E-GRM用“多次采样的一致性”来判断模型是否确定,这种办法真的靠谱吗?会不会把错答案也投成高共识?
2、M=5看起来是论文里的甜点位,但实际部署时是不是应该根据任务难度动态调整采样次数?
3、阶梯温度采样比固定温度更能提供多样性,但温度参数靠人工设定,会不会成为新的调参玄学?
4、E-GRM强调工程实现细节,比如KV-Cache共享和GPU侧共识计算。未来推理框架会不会把并行解码做成默认能力?

原文内容

图片
作者:腾讯混元&UNSW
本文约3300字,建议阅读6分钟

本文介绍了 E-GRM 并行解码方案,实现大模型低开销、高精度的智能推理优化。


论文题目:

Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

收录会议:ACL 2026

arXiv 链接:

https://arxiv.org/abs/2604.10072

作者单位:

腾讯混元 & 新南威尔士大学(UNSW)


领域:LLM 高效推理 / 生成式奖励模型 / 推理优化


关键词:Parallel Decoding, Sampling Diversity, Latency Optimization, Consensus, E-GRM


[ 摘要 ] E-GRM框架的高效性建立在并行解码这一核心工程基石之上。如果并行解码无法在低开销下提供足够多样的样本,共识度信号就会失真,动态路由也将失去意义。本文从工程实践视角出发,详细解析E-GRM并行解码的实现机制、采样多样性策略、批次调度、延迟优化以及它与共识度计算的协同关系,揭示该模块如何在”快”与”准”之间取得精妙平衡。


一、问题背景与动机


1.1 并行解码在E-GRM中的核心地位


E-GRM的整个动态路由建立在共识度信号之上,而共识度需要 M 次解码结果作为输入。如果这 M 次解码本身耗时过长,路由决策的”提速”红利就会被吞没。同时,如果 M 次解码采样不够多样,会导致虚假共识,让本应进入长路径的难题被错误归入短路径。


1.2 工程上的两难


并行解码需要同时满足三个目标:低延迟(不能拖累整体管道)、高多样性(保证共识度有判别力)、低显存占用(不破坏部署可行性)。E-GRM团队通过一系列工程取舍,将三者协调到一个稳定可用的范围。


二、并行解码方法论


2.1 并行解码的形式化定义


给定输入 x,E-GRM并行采样 M=5 条响应:


{y1,y2,…,yM}∼Pθ(⋅∣x)


每条响应使用不同的温度和top-p参数 (Ti,pi) 以保证采样多样性。


2.2 共识度计算


并行解码完成后,共识度定义为出现次数最多的答案所占比例:


Consensus(x)=maxy∑i=1MI[yi=y]M


该值直接驱动动态路由决策:


短路径长路径Route(x)={短路径,Consensus(x)≥τ长路径,Consensus(x)<τ,τ=0.8


2.3 采样多样性策略


E-GRM采用”温度阶梯”策略:5条解码分别使用 T∈{0.6,0.7,0.8,0.9,1.0},top-p保持0.95。这种分层温度既避免了”全部低温都收敛到同一答案”的虚假共识,也避免了”全部高温都发散”的噪声共识。


2.4 批次并行优化


为了让 M 次解码不变成线性叠加的时延,E-GRM使用批次并行:将5条解码组装为同一个batch,复用一次KV-Cache前缀计算,prefill阶段只需1次。设原始单次解码延迟为 t0,则:


tparallel≈t0+(M−1)⋅tdecode\_only≪M⋅t0


实测M=5时总延迟仅为单次解码的1.05倍左右。


2.5 与长路径评分的衔接


如果共识度低于阈值,长路径将复用并行解码已生成的样本作为CoT初始候选,避免重复推理。同时使用混合损失评分器进行打分:


Lscorer=α⋅ℓHuber(q,q^)+(1−α)⋅ℓHinge(r+,r−)


实现”并行解码—评分—策略优化”的端到端贯通。

图片 

图1:并行解码模块位于E-GRM框架的入口位置,是共识度计算的来源。

图片 

图2:Coupled-GRPO中的对比奖励,其样本对部分来自并行解码的多样化输出。

图片 

图3:完整推理管线,并行解码—共识度计算—动态路由形成串联工作流。


三、实验评估


3.1 M值敏感性实验


不同采样数对路由质量的影响:


M值

共识度区分度

路由准确率

总延迟

3

较弱

81.2%

1.9s

5

93.4%

2.2s

7

微增

94.1%

2.6s

10

几乎饱和

94.3%

3.4s


可见M=5是性价比最优点,是论文默认配置。


3.2 温度策略对比


固定温度(T=0.7)、阶梯温度(T∈{0.6,...,1.0})、Nucleus多样化三种策略对比:阶梯温度在共识度判别力上最强,固定温度容易产生虚假共识。


3.3 批次并行加速比


实测M=5时GPU利用率从单次解码的42%提升到78%,prefill阶段共享使吞吐提升约4.7倍。


3.4 多样性—共识度联动分析


并行解码输出的Self-BLEU指标与共识度呈现明显负相关:Self-BLEU高的输入往往共识度也高,进入短路径。这一现象支撑了”模型不确定性可被采样多样性间接观测”的核心假设。


3.5 整体效率收益


MATH数据集上,并行解码引入的开销约5%,但通过短路径节省的成本远超此开销:延迟从3.8秒降至2.2秒(-62%),FLOPs降49%。


3.6 不同硬件平台的并行收益


在A100、H100、L40三种GPU上对比并行解码加速比:A100上从单次的1.0×提升至4.7×吞吐;H100因更大的SM数量获得5.3×;L40因显存带宽限制仅获4.1×。说明并行解码收益与硬件计算/带宽比强相关。


3.7 长上下文场景的表现


输入长度从1K增至8K时,并行解码的相对开销从5%升至11%,因为prefill阶段占比变大、KV-Cache共享收益被摊薄。32K上下文下相对开销达到约17%,需考虑切换为部分共享或分段并行策略。


3.8 与传统Self-Consistency的对比


传统Self-Consistency也使用多次采样投票,但要求生成完整CoT后再投票,延迟为单次的5×左右。E-GRM的并行解码仅生成答案而不带CoT,平均延迟为单次的1.05×,体现”短路径优先”的设计哲学。


四、贡献与局限


4.1 核心贡献


用极少的工程开销将”模型不确定性”从理论概念变为可在线观测的信号;


阶梯温度策略提供了一个简洁有效的多样性控制方案;


批次并行与KV-Cache前缀共享将M=5的”理论开销”降到可忽略水平。


4.2 局限与展望


M=5对极简单或极复杂任务可能仍需自适应调整;


阶梯温度依赖人工设计,未来可探索学习式温度调度;


极长上下文场景下,prefill共享收益会被摊薄。


4.3 部署注意事项


工程落地时还需注意:(1) 温度阶梯需要框架支持batch内异构采样参数(如vLLM 0.5+);(2) M值最好与GPU SM数量保持整除关系,以避免padding浪费;(3) 共识度计算应放在GPU侧完成,避免CPU-GPU往返。


4.4 与未来推理框架的集成路径


E-GRM的并行解码可天然与TensorRT-LLM、SGLang、vLLM等框架集成,将共识度计算作为后处理插件即可。未来若与Continuous Batching技术结合,可进一步将并行解码的等待时间隐藏在其他请求的Decode阶段之中。


五、结语


E-GRM的并行解码并非简单的”多次采样”,而是一套精心调优的工程解决方案。它把不确定性的观测做到了几乎零成本,为整个动态路由体系打下了坚实的工程底座。这一设计也启示我们:高效推理的关键不仅在算法,更在工程实现细节。


六、延伸思考


6.1 并行解码作为通用工程模式


并行解码本身不是E-GRM独有的技术,但E-GRM对其的工程组织方式(阶梯温度+共享前缀+共识度提取)形成了一个可复用的工程模式。该模式可推广到诸如Self-Consistency、Speculative Decoding等其他多采样推理场景。


6.2 与未来推理架构的展望


未来推理架构可能内嵌”并行解码即原语”的能力,让多采样不再是上层应用的工程负担。E-GRM的并行解码设计是这种未来架构的早期典范,对推动LLM推理框架的演进有积极示范作用。


6.3 并行解码的研究空白


虽然E-GRM对并行解码的工程化已有较深入探索,但仍存在研究空白,包括:自适应采样数 M、跨样本的负载均衡调度、并行解码的能效比优化等。这些方向值得后续工作继续推进。


图表附录:

图片 

图片

附图1:Coupled-GRPO中的奖励函数公式,与并行解码采样紧密结合。

图片 

图片

附图2:扩展GRPO优化目标,并行解码输出是该目标的样本来源。


参考文献:

 Xue, C., Wang, Y., Liu, M., et al. (2026). Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty. Proceedings of ACL 2026. arXiv:2604.10072


版权说明:本文为对上述ACL 2026论文的学术解析,仅供学术交流使用。版权归原作者所有。


编辑:于腾凯
校对:李享沣



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU

最理想的是学习式温度调度:模型看到输入后自己决定采样温度组合。比如简单题用低温密集验证,开放题提高温度探索。但这又会引入额外训练和评估成本,不一定适合所有团队。

2 个赞

动态M肯定更香,但也更难调度。线上服务最怕请求形态不稳定,今天有的请求采3条,有的采10条,batch很容易碎掉。论文选M=5,某种程度上也是为了工程稳定性。

3 个赞

我站自适应M。简单题采5次有点浪费,难题采5次可能还不够。可以先采3次,如果已经3/3一致就直接走短路径;如果分歧大,再补采2次或4次。这样感觉更像人类做题:简单题瞄一眼,难题多算几遍。

1 个赞