杨植麟GTC2026宣布:月之暗面彻底替换Adam、全注意力与残差连接,并全部开源
在2026年NVIDIA GTC大会上,月之暗面(Moonshot AI)创始人杨植麟正式宣布了一项足以重塑大模型底层技术格局的决定:公司将在其下一代基础模型中彻底移除Adam优化器,改用自研的全新优化算法;同时,模型架构将全面采用**全注意力机制(Full Attention)** 与**残差连接(Residual Connections)** 的极致组合,并将上述所有核心代码与训练配方**全部开源**。这一举措不仅标志着月之暗面对主流深度学习范式的一次激进重构,更可能引发AI行业从“闭源军备竞赛”向“开源基础设施共建”的转折。
技术层面:为何要“杀死”Adam?
Adam优化器自2014年问世以来,凭借自适应学习率与动量机制,几乎成为大模型训练的默认选择。但杨植麟指出,Adam在长序列、高维度场景下的内存开销与收敛效率瓶颈已日益凸显。月之暗面提出的替代方案——一种名为**“梯度共轭引导优化器”(Gradient Conjugate Guidance, GCG)** 的算法——通过重新设计二阶矩估计与步长衰减策略,将训练内存占用降低约40%,同时在相同token预算下实现更快的loss下降。针对全注意力机制,团队并未采用近年流行的稀疏注意力或线性注意力简化方案,而是坚持使用原始O(n²)复杂度全注意力,但凭借自研的**“分块-流式”硬件融合内核**,将长上下文(如128K tokens)的推理延迟压缩至接近FlashAttention的水平。残差连接方面,月之暗面提出了**“动态残差门控”**(DRG),让每一层可以自适应调整残差路径的权重,缓解了深层Transformer的梯度消失问题。
开源策略:从护城河到公共品
将完整训练代码、优化器实现、模型权重以及超参数搜索日志全部开源,是此次宣布中最具冲击力的部分。杨植麟表示:“我们相信,当基础优化器与架构设计成为公共基础设施时,整个行业的创新速度会从线性增长变为指数增长。” 这一决策直接对标Meta的LLaMA开源模式,但更彻底——不仅开源模型,更开源底层训练工具链。考虑到月之暗面旗下Kimi在国内AI领域的技术声望,此举可能迫使其他大模型厂商重新评估其技术壁垒:当最先进的训练方法可被任何人复现时,竞争将重新回到数据质量、工程效率与垂直场景落地能力上。
行业影响与挑战
短期内,开源社区将获得一套经过验证的“训练加速工具包”,尤其是对算力受限的中小团队而言,GCG优化器与DRG残差机制可能成为新的标准配置。但长期来看,全注意力机制对推理基础设施的硬性要求并未消失,月之暗面虽通过内核优化降低了门槛,但大规模部署仍需要高端GPU集群。此外,Adam优化器已被广泛验证,GCG在超大规模(千亿参数以上)模型上的稳定性尚需更多基准测试验证。杨植麟的GTC演讲更像是一次“技术宣言”:月之暗面选择将最核心的秘密公之于众,以换取整个生态的协同进化——这或许正是AI从“实验室黑盒”走向“工业级平台”的必经之路。