阿里云灵骏真武M890超节点完成 Kimi K3 Day0 适配,首Token时延降低约35%

阿里云真武M890超节点适配Kimi K3,推理首Token时延降约35%。

冷月清谈:

阿里云宣布,灵骏真武M890超节点实例已完成对月之暗面旗舰模型 Kimi K3 的 Day0 适配。Kimi K3 参数规模达2.8万亿,采用 MoE 架构,对显存容量、高速互联和推理框架协同要求很高。真武M890超节点通过64卡互联、9TB显存和800GB/s All-to-All通信能力,将专家并行通信尽量限制在单一高带宽域内,降低跨节点通信瓶颈。阿里云、平头哥与Kimi团队还围绕EP专家并行、MXFP4混合精度推理、KDA混合注意力算子进行了联合优化。实测阶段性结果显示,相比迁移初期基线,Kimi K3在该超节点上的首Token时延降低约35%,单卡解码吞吐提升约1.8倍,并可稳定支持最长1M上下文。文章重点体现了国产AI芯片、推理框架与云平台在万亿级模型部署上的全栈协同能力。

本文部分链接为合作推广

怜星夜思:

1、万亿级MoE模型为什么特别依赖“超节点”,普通多机GPU集群差在哪里?
2、MXFP4这种低精度推理真的能做到“效果无损”吗,还是只是厂商宣传口径?
3、1M上下文会不会成为大模型应用的标配?实际业务里真的需要这么长吗?
4、国产AI芯片在大模型推理上追赶GPU生态,最大的难点是硬件性能还是软件生态?

原文标题:灵骏真武M890超节点实例 Day0 适配 Kimi K3

原文作者:阿里云开发者

原文内容

727日晚,阿里云灵骏真武M890超节点实例已成功适配2.8万亿参数大模型Kimi K3,基于芯片、推理平台和模型的联合优化,有效提升模型推理效率。实测结果显示,该超节点运行Kimi K3的首Token时延降低约35%,长上下文场景下用户体验更流畅。

Kimi K3是月之暗面(Moonshot AI)最新的旗舰模型,参数规模达到2.8万亿,采用混合专家(MoE)架构,其完整模型权重于今日正式开放下载。作为目前业界参数规模最大的模型之一,Kimi K3的高效运行不仅需要大规模算力和显存支撑,还需要高速互联网络让几十张GPU紧密协作,仅靠传统AI集群无法满足高吞吐、低延迟、低成本的推理需求。根据月之暗面官方博客,推荐将Kimi K3部署在“64 卡以上加速器组成的超节点上。

灵骏真武超节点实例基于平头哥训推一体AI芯片真武M890打造,通过ICN Switch 1.0互联芯片,可让64张真武M890实现800 GB/sAll-to-All高速互联,显存规模也达到9TB,可将万亿级MoE模型的EP专家并行通信流量,跑在一个高带宽通信域内,有效保证Token生成的效率。

为了让Kimi K3在真武M890超节点实例上实现Day0高效运行,阿里云、平头哥与Kimi 团队从算子、软件栈等层面进行了深度联合适配。依托真武AI芯片的T-Head SAIL软件栈,Kimi自研的Mooncake推理框架实现了快速部署及开箱即跑。例如在算子层面,真武M890Triton的良好支持让大量基于Triton编写的自定义算子无需重写即可直接运行,大幅降低了适配工作量。

在此基础上,三方还针对K3的超大规模MoE架构做了三方面重点优化:

  • EP 专家并行通信优化

借助ICN64高带宽通信域对MoE最核心的All-to-All专家路由通信进行深度调优,将2.8 万亿参数的专家并行流量完整承载在单一超节点内部,避免跨节点通信成为瓶颈。

  • MXFP4 混合精度推理

结合真武M890原生支持的MXFP4低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。

  • KDA 混合架构算子深度优化

Kimi K3采用KDA(Kimi Delta Attention)线性注意力与全注意力相结合的混合架构,联合团队在真武M890上深度调优了KDA核心算子。充分对齐芯片的并行计算架构与访存特性,并通过算子融合减少Kernel启动与中间访存开销,使注意力计算的算力与带宽利用效率大幅提升。

经过联合优化,Kimi K3在灵骏真武M890超节点实例上不仅实现了Day0平稳跑通,关键推理指标也获得可观提升(以下为阶段性优化实测经验值,供参考):
  • 相比迁移初期基线,首Token时延(TTFT)降低约 35%,长上下文场景下体感更流畅;单卡解码吞吐(Decode Tokens/s)提升约 1.8倍

  • 借助MXFP4混合量化,提升整体推理效率;

  • 得益于KDA线性注意力混合架构与算子优化,长序列推理算力开销随长度近线性增长,稳定支持最长 1M上下文,从容应对长文档理解、复杂推理等场景。

此次Day0适配背后,是阿里云、平头哥、Kimi团队从芯片、推理框架到云平台的全栈协同。这不仅为Kimi K3 这类万亿参数大模型提供了开源开放的软件栈、国内可获取的高算力选择。未来,三方将继续在模型适配、性能调优与工程化部署上深化合作,持续提升Kimi 系列模型在真武超节点上的推理性能与性价比。

立即体验:

千问AI平台模型市场

点击阅读原文即可体验!

长上下文不是越长越好,还涉及成本、延迟和注意力质量。很多模型虽然能“塞进去”,但不代表能稳定“找得准”。所以我更关心长上下文下的检索准确率、位置鲁棒性和推理稳定性,而不只是最大长度数字。

2 个赞

回答“硬件还是软件”:成年人不做选择,两个都难。硬件要算得快、连得快、供货稳;软件要让工程师少掉头发。生态不好,再强的芯片也容易变成PPT算力。

1 个赞

我理解这个问题的关键在通信。MoE不是所有参数每次都算,而是Token会被路由到不同专家,所以All-to-All通信非常频繁。普通多机集群一旦跨节点,网络延迟和带宽就容易拖后腿,GPU算力反而等通信。超节点的价值就是把更多卡放进一个高带宽通信域里,让专家并行不那么痛苦。

2 个赞