阿里云真武M890超节点适配Kimi K3,推理首Token时延降约35%。
冷月清谈:
本文部分链接为合作推广
怜星夜思:
2、MXFP4这种低精度推理真的能做到“效果无损”吗,还是只是厂商宣传口径?
3、1M上下文会不会成为大模型应用的标配?实际业务里真的需要这么长吗?
4、国产AI芯片在大模型推理上追赶GPU生态,最大的难点是硬件性能还是软件生态?
原文标题:灵骏真武M890超节点实例 Day0 适配 Kimi K3
原文作者:阿里云开发者
原文内容
7月27日晚,阿里云灵骏真武M890超节点实例已成功适配2.8万亿参数大模型Kimi K3,基于芯片、推理平台和模型的联合优化,有效提升模型推理效率。实测结果显示,该超节点运行Kimi K3的首Token时延降低约35%,长上下文场景下用户体验更流畅。
Kimi K3是月之暗面(Moonshot AI)最新的旗舰模型,参数规模达到2.8万亿,采用混合专家(MoE)架构,其完整模型权重于今日正式开放下载。作为目前业界参数规模最大的模型之一,Kimi K3的高效运行不仅需要大规模算力和显存支撑,还需要高速互联网络让几十张GPU紧密协作,仅靠传统AI集群无法满足高吞吐、低延迟、低成本的推理需求。根据月之暗面官方博客,推荐将Kimi K3部署在“64 卡以上加速器组成的超节点”上。
灵骏真武超节点实例基于平头哥训推一体AI芯片真武M890打造,通过ICN Switch 1.0互联芯片,可让64张真武M890实现800 GB/s的All-to-All高速互联,显存规模也达到9TB,可将万亿级MoE模型的EP专家并行通信流量,跑在一个高带宽通信域内,有效保证Token生成的效率。
为了让Kimi K3在真武M890超节点实例上实现Day0高效运行,阿里云、平头哥与Kimi 团队从算子、软件栈等层面进行了深度联合适配。依托真武AI芯片的T-Head SAIL软件栈,Kimi自研的Mooncake推理框架实现了快速部署及“开箱即跑”。例如在算子层面,真武M890对Triton的良好支持让大量基于Triton编写的自定义算子无需重写即可直接运行,大幅降低了适配工作量。
在此基础上,三方还针对K3的超大规模MoE架构做了三方面重点优化:
-
EP 专家并行通信优化
借助ICN64高带宽通信域对MoE最核心的All-to-All专家路由通信进行深度调优,将2.8 万亿参数的专家并行流量完整承载在单一超节点内部,避免跨节点通信成为瓶颈。
-
MXFP4 混合精度推理
结合真武M890原生支持的MXFP4低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。
-
KDA 混合架构算子深度优化
Kimi K3采用KDA(Kimi Delta Attention)线性注意力与全注意力相结合的混合架构,联合团队在真武M890上深度调优了KDA核心算子。充分对齐芯片的并行计算架构与访存特性,并通过算子融合减少Kernel启动与中间访存开销,使注意力计算的算力与带宽利用效率大幅提升。
-
相比迁移初期基线,首Token时延(TTFT)降低约 35%,长上下文场景下体感更流畅;单卡解码吞吐(Decode Tokens/s)提升约 1.8倍;
-
借助MXFP4混合量化,提升整体推理效率;
-
得益于KDA线性注意力混合架构与算子优化,长序列推理算力开销随长度近线性增长,稳定支持最长 1M上下文,从容应对长文档理解、复杂推理等场景。
立即体验:
