# 国产算力突破:海光 DCU 成功适配 Kimi K3,896 专家并行实现万亿参数大模型推理
近日,海光信息宣布其 DCU 系列加速卡成功适配月之暗面(Moonshot AI)的最新大模型 Kimi K3,并在 896 专家并行模式下实现流畅运行,标志着国产 GPU 首次具备支撑万亿参数级别 MoE(混合专家)大模型完整推理的能力。这一进展不仅验证了海光 DCU 在 AI 基础设施中的替代潜力,也为国产算力生态的自主可控注入了强心剂。
## 技术细节:从“能跑”到“流畅”的跨越
Kimi K3 采用 MoE 架构,总参数量达万亿级别,但每个 token 仅激活部分专家(如 896 个专家中的 Top-K)。其核心难点在于:如何高效地将不同专家分片到多个计算节点,并最小化通信开销。海光 DCU 团队通过深度优化底层通信库(兼容 ROCm 生态)和算子库,实现了专家并行(Expert Parallelism)与数据并行的混合调度,使得 896 个专家单元在 DCU 集群上达到接近线性扩展的加速比。据披露,在 64 卡海光 DCU 测试环境下,Kimi K3 的推理吞吐量达到每秒 1200+ tokens,延迟低于 50ms,足以满足交互式对话场景需求。
## 生态兼容性:CUDA 替代路径的验证
海光 DCU 基于通用 GPU 架构,原生支持 ROCm 5.0 以上版本,并通过二进制翻译层兼容部分 CUDA 算子。本次适配中,Kimi K3 的分布式训练框架由 PyTorch 与 Megatron-LM 构建,海光团队仅需修改约 10% 的底层通信代码即可完成迁移,剩余 90% 的算子直接跑在 DCU 的 ROCm 运行时上。这意味着,对于主流 MoE 模型,国产 GPU 已具备“开箱即用”的潜力,而非依赖定制化开发。
## 战略意义:国产算力“卡脖子”环节的破局
长期来看,大模型训练与推理对 GPU 的依赖是国产 AI 产业的最大瓶颈。此前,华为昇腾、寒武纪等国产芯片已能运行百亿级密集模型,但面对万亿级 MoE 模型的专家并行需求,因显存带宽、通信拓扑及算子生态的不足,多停留在实验室阶段。海光 DCU 的突破表明:在 7nm 制程下,通过优化分布式策略和软硬件协同,国产 GPU 完全有能力承接部分大模型推理负载,尤其是在企业对数据主权和供应链安全要求极高的场景(如金融、政务、医疗)。
## 挑战与展望
当然,我们仍需冷静看待差距。海光 DCU 在单卡算力(FP16 约 100 TFLOPS)和显存容量(32GB HBM2e)上仍落后于 NVIDIA H100(80GB HBM3,约 2000 TFLOPS),且 ROCm 生态的成熟度与 CUDA 尚存差距,尤其是在稀疏计算和动态 shape 优化方面。但本次适配证明:**国产 GPU 已从“能不能用”进入“好不好用”的阶段**。随着月之暗面、阿里、百度等头部模型厂商主动适配国产硬件,一个“模型-芯片-框架”三方协同的国产大模型生态正在加速形成。未来,当 896 专家并行不再是新闻,而是国产算力的标配时,中国 AI 产业的自主化才算真正落地。