E-GRM用并行采样和共识度路由,让大模型只在需要时深度推理。
原文标题:原创丨ACL 2026 腾讯混元&UNSW | 大模型并行解码工程实践:从推理效率到采样多样性的技术权衡
原文作者:数据派THU
冷月清谈:
怜星夜思:
2、M=5看起来是论文里的甜点位,但实际部署时是不是应该根据任务难度动态调整采样次数?
3、阶梯温度采样比固定温度更能提供多样性,但温度参数靠人工设定,会不会成为新的调参玄学?
4、E-GRM强调工程实现细节,比如KV-Cache共享和GPU侧共识计算。未来推理框架会不会把并行解码做成默认能力?
原文内容
作者:腾讯混元&UNSW本文约3300字,建议阅读6分钟本文介绍了 E-GRM 并行解码方案,实现大模型低开销、高精度的智能推理优化。
论文题目:
Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
收录会议:ACL 2026
arXiv 链接:
https://arxiv.org/abs/2604.10072
作者单位:
腾讯混元 & 新南威尔士大学(UNSW)
领域:LLM 高效推理 / 生成式奖励模型 / 推理优化
关键词:Parallel Decoding, Sampling Diversity, Latency Optimization, Consensus, E-GRM
[ 摘要 ] E-GRM框架的高效性建立在并行解码这一核心工程基石之上。如果并行解码无法在低开销下提供足够多样的样本,共识度信号就会失真,动态路由也将失去意义。本文从工程实践视角出发,详细解析E-GRM并行解码的实现机制、采样多样性策略、批次调度、延迟优化以及它与共识度计算的协同关系,揭示该模块如何在”快”与”准”之间取得精妙平衡。
一、问题背景与动机
1.1 并行解码在E-GRM中的核心地位
E-GRM的整个动态路由建立在共识度信号之上,而共识度需要 M 次解码结果作为输入。如果这 M 次解码本身耗时过长,路由决策的”提速”红利就会被吞没。同时,如果 M 次解码采样不够多样,会导致虚假共识,让本应进入长路径的难题被错误归入短路径。
1.2 工程上的两难
并行解码需要同时满足三个目标:低延迟(不能拖累整体管道)、高多样性(保证共识度有判别力)、低显存占用(不破坏部署可行性)。E-GRM团队通过一系列工程取舍,将三者协调到一个稳定可用的范围。
二、并行解码方法论
2.1 并行解码的形式化定义
给定输入 x,E-GRM并行采样 M=5 条响应:
{y1,y2,…,yM}∼Pθ(⋅∣x)
每条响应使用不同的温度和top-p参数 (Ti,pi) 以保证采样多样性。
2.2 共识度计算
并行解码完成后,共识度定义为出现次数最多的答案所占比例:
Consensus(x)=maxy∑i=1MI[yi=y]M
该值直接驱动动态路由决策:
短路径长路径Route(x)={短路径,Consensus(x)≥τ长路径,Consensus(x)<τ,τ=0.8
2.3 采样多样性策略
E-GRM采用”温度阶梯”策略:5条解码分别使用 T∈{0.6,0.7,0.8,0.9,1.0},top-p保持0.95。这种分层温度既避免了”全部低温都收敛到同一答案”的虚假共识,也避免了”全部高温都发散”的噪声共识。
2.4 批次并行优化
为了让 M 次解码不变成线性叠加的时延,E-GRM使用批次并行:将5条解码组装为同一个batch,复用一次KV-Cache前缀计算,prefill阶段只需1次。设原始单次解码延迟为 t0,则:
tparallel≈t0+(M−1)⋅tdecode\_only≪M⋅t0
实测M=5时总延迟仅为单次解码的1.05倍左右。
2.5 与长路径评分的衔接
如果共识度低于阈值,长路径将复用并行解码已生成的样本作为CoT初始候选,避免重复推理。同时使用混合损失评分器进行打分:
Lscorer=α⋅ℓHuber(q,q^)+(1−α)⋅ℓHinge(r+,r−)
实现”并行解码—评分—策略优化”的端到端贯通。
图1:并行解码模块位于E-GRM框架的入口位置,是共识度计算的来源。
图2:Coupled-GRPO中的对比奖励,其样本对部分来自并行解码的多样化输出。
图3:完整推理管线,并行解码—共识度计算—动态路由形成串联工作流。
三、实验评估
3.1 M值敏感性实验
不同采样数对路由质量的影响:
|
M值 |
共识度区分度 |
路由准确率 |
总延迟 |
|
3 |
较弱 |
81.2% |
1.9s |
|
5 |
强 |
93.4% |
2.2s |
|
7 |
微增 |
94.1% |
2.6s |
|
10 |
几乎饱和 |
94.3% |
3.4s |
可见M=5是性价比最优点,是论文默认配置。
3.2 温度策略对比
固定温度(T=0.7)、阶梯温度(T∈{0.6,...,1.0})、Nucleus多样化三种策略对比:阶梯温度在共识度判别力上最强,固定温度容易产生虚假共识。
3.3 批次并行加速比
实测M=5时GPU利用率从单次解码的42%提升到78%,prefill阶段共享使吞吐提升约4.7倍。
3.4 多样性—共识度联动分析
并行解码输出的Self-BLEU指标与共识度呈现明显负相关:Self-BLEU高的输入往往共识度也高,进入短路径。这一现象支撑了”模型不确定性可被采样多样性间接观测”的核心假设。
3.5 整体效率收益
在MATH数据集上,并行解码引入的开销约5%,但通过短路径节省的成本远超此开销:延迟从3.8秒降至2.2秒(-62%),FLOPs降49%。
3.6 不同硬件平台的并行收益
在A100、H100、L40三种GPU上对比并行解码加速比:A100上从单次的1.0×提升至4.7×吞吐;H100因更大的SM数量获得5.3×;L40因显存带宽限制仅获4.1×。说明并行解码收益与硬件计算/带宽比强相关。
3.7 长上下文场景的表现
输入长度从1K增至8K时,并行解码的相对开销从5%升至11%,因为prefill阶段占比变大、KV-Cache共享收益被摊薄。32K上下文下相对开销达到约17%,需考虑切换为部分共享或分段并行策略。
3.8 与传统Self-Consistency的对比
传统Self-Consistency也使用多次采样投票,但要求生成完整CoT后再投票,延迟为单次的5×左右。E-GRM的并行解码仅生成答案而不带CoT,平均延迟为单次的1.05×,体现”短路径优先”的设计哲学。
四、贡献与局限
4.1 核心贡献
用极少的工程开销将”模型不确定性”从理论概念变为可在线观测的信号;
阶梯温度策略提供了一个简洁有效的多样性控制方案;
批次并行与KV-Cache前缀共享将M=5的”理论开销”降到可忽略水平。
4.2 局限与展望
M=5对极简单或极复杂任务可能仍需自适应调整;
阶梯温度依赖人工设计,未来可探索学习式温度调度;
极长上下文场景下,prefill共享收益会被摊薄。
4.3 部署注意事项
工程落地时还需注意:(1) 温度阶梯需要框架支持batch内异构采样参数(如vLLM 0.5+);(2) M值最好与GPU SM数量保持整除关系,以避免padding浪费;(3) 共识度计算应放在GPU侧完成,避免CPU-GPU往返。
4.4 与未来推理框架的集成路径
E-GRM的并行解码可天然与TensorRT-LLM、SGLang、vLLM等框架集成,将共识度计算作为后处理插件即可。未来若与Continuous Batching技术结合,可进一步将并行解码的等待时间隐藏在其他请求的Decode阶段之中。
五、结语
E-GRM的并行解码并非简单的”多次采样”,而是一套精心调优的工程解决方案。它把不确定性的观测做到了几乎零成本,为整个动态路由体系打下了坚实的工程底座。这一设计也启示我们:高效推理的关键不仅在算法,更在工程实现细节。
六、延伸思考
6.1 并行解码作为通用工程模式
并行解码本身不是E-GRM独有的技术,但E-GRM对其的工程组织方式(阶梯温度+共享前缀+共识度提取)形成了一个可复用的工程模式。该模式可推广到诸如Self-Consistency、Speculative Decoding等其他多采样推理场景。
6.2 与未来推理架构的展望
未来推理架构可能内嵌”并行解码即原语”的能力,让多采样不再是上层应用的工程负担。E-GRM的并行解码设计是这种未来架构的早期典范,对推动LLM推理框架的演进有积极示范作用。
6.3 并行解码的研究空白
虽然E-GRM对并行解码的工程化已有较深入探索,但仍存在研究空白,包括:自适应采样数 M、跨样本的负载均衡调度、并行解码的能效比优化等。这些方向值得后续工作继续推进。
图表附录:
附图1:Coupled-GRPO中的奖励函数公式,与并行解码采样紧密结合。
附图2:扩展GRPO优化目标,并行解码输出是该目标的样本来源。
参考文献:
Xue, C., Wang, Y., Liu, M., et al. (2026). Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty. Proceedings of ACL 2026. arXiv:2604.10072
版权说明:本文为对上述ACL 2026论文的学术解析,仅供学术交流使用。版权归原作者所有。



