人大高瓴与蚂蚁提出扩散语言模型扩展定律,并训练 LLaDA MoE v2

LLaDA MoE v2 揭示 MoE 扩散语言模型扩展规律,并以更少训练词元逼近自回归强模。

冷月清谈:

中国人民大学高瓴人工智能学院与蚂蚁集团联合发布 LLaDA MoE v2,并首次系统研究混合专家扩散语言模型的扩展定律。论文围绕超参数、算力分配和 MoE 架构设计展开,指出扩散语言模型由于采用掩码去噪目标,其最优批量大小、学习率衰减规律与自回归模型存在明显差异。团队还发现,在固定算力下,MoE 扩散模型更偏向增加训练数据而非单纯扩大模型侧计算。架构上,较低激活比例、中等专家粒度,以及约三分之一共享专家容量表现更优。基于这些规律训练出的 LLaDA MoE v2 为 30B 总参数、每词元激活约 3B 参数,预训练使用 23.5T 词元,在多项知识、推理和代码基准上达到当前扩散语言模型领先水平,并以约 Qwen3 30B-A3B 65% 的预训练词元逼近其表现。团队预计近期开放推理代码和模型权重。

怜星夜思:

1、扩散语言模型如果真能并行解码,它未来有机会替代自回归模型吗?
2、文章里说扩散语言模型更“亲数据”,这是不是意味着以后堆数据比堆参数更重要?
3、LLaDA MoE v2 用更少预训练词元逼近 Qwen3,这个对比能说明扩散路线更高效吗?
4、MoE 扩散模型里共享专家比例固定在三分之一左右,这个发现为什么有意思?

原文标题:揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2

原文作者:机器之心

原文内容


本文介绍的工作由中国人民大学高瓴人工智能学院李崇轩、文继荣教授团队与蚂蚁集团共同完成。朱峰琪是中国人民大学高瓴人工智能学院的博士生(蚂蚁集团实习生),导师为李崇轩副教授。


扩散语言模型的快速发展,正成为大语言模型领域备受关注的技术方向:凭借双向上下文建模与多词元并行解码的独特优势,这一新兴范式已从前沿学术探索逐步成长为大语言模型的重要技术路线之一,受到学术界与产业界的持续关注。随着模型规模与训练算力不断增大,如何高效地扩大规模成为亟待回答的问题 —— 最优超参数如何随算力调整、有限算力在模型与数据间如何分配、稀疏专家架构如何随规模演进,都需要扩展定律给出科学的答案。


在自回归模型上,扩展定律已相当成熟,支撑了一代又一代大模型的训练;然而,离散扩散语言模型采用掩码去噪目标,监督信号仅落在被掩码的位置,每个预测又都基于受损序列而非因果前缀,自回归的扩展经验无法直接照搬。混合专家架构作为大模型扩容的主流选择,与扩散建模结合后的扩展规律仍缺乏系统刻画,大规模扩散语言模型的训练仍在很大程度上依赖经验与试错。


为此,高瓴人工智能学院李崇轩、文继荣团队与蚂蚁集团首次系统画了混合专家扩散语言模型的扩展定律,并据此从头训练了 30B-A3B 的新一代扩散语言模型 LLaDA MoE v2。该工作将扩展定律贯穿超参数配置、算力分配与架构设计,标志着扩散语言模型从 “经验驱动” 迈向 “定律指引” 的关键一步:LLaDA MoE v2 激活约 3B 参数,仅用同规模自回归模型 Qwen3 30B-A3B 约 65% 的预训练词元,即在知识、推理、代码等多项基准上逼近 Qwen3 水准,且仅经有监督微调便在 8 项推理与代码基准中的 7 项超越现有领先扩散模型,实现扩展效率与智能的双重突破,标志着扩散语言模型迈入 “定律指引、稀疏并行、高效扩展” 的规模化时代。



  • 论文标题:LLADA MOE V2: SCALING MIXTURE-OF-EXPERTS DIFFUSION LANGUAGE MODELS

  • 论文链接:https://arxiv.org/pdf/2608.03457


团队预计近期将开源推理代码以及 LLaDA MoE v2 模型权重。


在优化超参数方面,联合团队在 158M 至 3.6B 的模型规模与   至  FLOPs 的算力跨度上系统搜索批量大小与学习率,拟合出扩散语言模型专属的超参数扩展定律:最优批量大小随算力的增长比自回归模型更陡,最优学习率随算力的衰减更快。在   FLOPs 算力下,自回归定律预测的最优批量大小约为 102 万词元,而新定律给出 343 万词元 —— 这一差异源于掩码去噪目标下,名义词元仅在被掩码时才贡献监督信号,有效监督强度的下降改变了梯度噪声水平与优化稳定性。该定律在   FLOPs 的外推验证中与实测最优配置高度吻合,为大规模训练提供了可靠的超参数标尺。


图 1:LLaDA MoE v2 的超参数扩展定律:最优批量大小(左)与最优学习率(右)随训练算力的扩展曲线,红色虚线为本文拟合定律,蓝色虚线为自回归模型参考定律


在算力分配方面,团队通过 IsoFLOP 分析刻画了固定算力下模型规模与训练数据的最优权衡:最优模型侧算力随总算力以 0.475 次幂增长,最优训练词元数以 0.525 次幂增长,整体接近均衡并略微偏向数据一侧。与已有稠密扩散模型的扩展定律相比,混合专家扩散模型的分配前沿是迄今最偏向数据侧的,稀疏激活与扩散建模各自带来的 “亲数据” 倾向在其中叠加显现,意味着边际算力投向训练词元比投向模型侧计算更为划算。


图 2:LLaDA MoE v2 的算力分配扩展定律:固定算力下模型 - 数据分配的 IsoFLOP 曲线(左),以及最优模型侧算力(中)与最优训练词元数(右)随总算力的幂律前沿


在架构设计方面,团队沿激活比例、专家粒度与共享专家比例三个关键维度解析了混合专家架构的扩展规律:随着规模扩大,更低激活比例、即更大的路由专家池愈发占优;8 至 16 的中等专家粒度在各规模下均保持稳健;共享专家承载约三分之一激活容量(33.3%)在所有规模下恒为最优,与自回归混合专家模型惯用的 25% 甚至不设共享专家的经验形成鲜明对比,由此得到了扩散语言模型专属的稀疏激活架构设计准则。


图 3:混合专家架构的扩展规律:激活比例(a)、专家粒度(b)与共享专家比例(c)在不同算力规模下的受控扫描,红星标记各规模的最优配置


在上述扩展定律的指引下,联合团队从头训练了 LLaDA MoE v2 30B-A3B 模型:总参数 30B、每词元激活 3B 参数,采用 128 个细粒度路由专家,激活比例 9.09%、专家粒度 8、共享专家比例 33.3%,落在扩展定律给出的最优区间。模型经五阶段预训练累计学习 23.5T 词元,全程消耗约 46 万 NVIDIA B200 GPU 小时。在 15 项基准测试中,LLaDA MoE v2 取得扩散语言模型中的最高平均分 58.60,较同规模扩散模型 SDAR Sci 高出 3.78 分,其中 HumanEval 与 BigCodeBench 分别领先 16.46 分与 7.98 分;与自回归模型 Qwen3 相比,模型在 OlympiadBench、HumanEval 等多项推理与代码基准上的差距不足 3 分,而预训练词元用量仅为其约 65%


图 4:LLaDA MoE v2 基座模型与其他扩散语言模型和自回归模型在 15 项基准上的核心指标对比


扩展定律的指导价值在算力效率上体现得尤为直观:与未受扩展定律指引的上一代 LLaDA-MoE 7B-A1B 相比,LLaDA MoE v2 在 MMLU、GSM8K 和 KorBench 上仅以约一半的训练算力便实现超越,展现出 “定律指引” 将预训练算力高效转化为下游性能的路径。


图 5:扩展定律指引的 LLaDA MoE v2 在多项基准上以更少训练算力达到并超越上一代 LLaDA-MoE


在有监督微调方面,团队使用 700 万条指令数据进行训练,所得模型即在 8 项数学推理与代码生成基准中的 7 项上超越同规模扩散模型 SDAR Chat,并在 AIME 2024/2025、MBPP、LiveCodeBench 等基准上逼近经历额外强化学习阶段的 Qwen3,更在多语言代码生成基准 MultiPL-E 上实现反超,表明扩展定律指引的基座模型经简单微调即可释放扎实的指令遵循与复杂推理能力。


图 6:LLaDA MoE v2 指令微调模型与 Qwen3 和 SDAR Chat 在推理与代码基准上的核心指标对比


LLaDA MoE v2 首次为混合专家扩散语言模型建立了覆盖超参数、算力分配与架构设计的系统性扩展定律,突破了非自回归模型规模化依赖经验迁移的瓶颈。通过定律指引的稀疏架构与掩码去噪训练,模型以更少的预训练词元与更低的激活开销逼近同规模领先自回归模型,为扩散语言模型的规模化提供了 “定律指引”,为进一步扩大模型规模、探索智能上限铺平了道路。




© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于“会不会替代自回归”,我个人偏谨慎。扩散模型生成图像时已经很强,但文本有离散性、语义连贯性和指令遵循的问题,不是简单并行就能赢。现在 LLaDA MoE v2 的意义更像是证明扩散路线可以规模化,而不是马上宣判 Transformer 自回归退场。

2 个赞

“65% 词元逼近 Qwen3”听起来很香,但我会等开源后看三个东西:实际推理速度、中文任务表现、长上下文稳定性。榜单赢了是入场券,日常好用才是饭票。

2 个赞

回答“共享专家三分之一为什么有意思”:因为它暗示扩散语言模型的专家分工方式可能和自回归模型不同。扩散模型每次是在受损序列上恢复被掩码内容,可能更需要一部分共享容量承载通用语义和全局去噪能力,而不是完全依赖路由专家分摊任务。

2 个赞

回答“堆数据还是堆参数”:从这篇文章看,MoE 扩散语言模型在固定算力下确实更偏向数据侧,但这不等于参数不重要。更准确的说法是,在某个规模区间内,把边际算力继续投到更多高质量 token 上,收益可能比单纯增大模型更好。

2 个赞