阶跃发布 Step 5 Preview:600B 稀疏 MoE 仅激活 27B,将开源旗舰的性价比边界再推进一步

AI资讯13小时前发布 全启星小编
133 0

阶跃发布 Step 5 Preview:600B 稀疏 MoE 仅激活 27B,将开源旗舰的性价比边界再推进一步

引言

2025年4月,阶跃星辰(Stepfun)正式发布新一代开源旗舰模型 **Step 5 Preview**,凭借“600B 总参数、稀疏 MoE 仅激活 27B”的技术突破,在大模型开源社区投下了一枚重磅炸弹。这一架构设计意味着模型在保持接近千亿级容量上限的同时,推理阶段的实际计算量仅相当于27B密集模型,将开源大模型的性价比推至新高度。

技术解析:极致稀疏化背后的工程智慧

Step 5 Preview 采用 **稀疏混合专家(Sparse MoE)** 架构,总参数量高达600B,但通过专家路由与负载均衡策略,每次前向推理仅激活约 27B 参数(激活率约 4.5%)。这一比例远低于业界常见的 30%-50% 激活率,体现出阶跃在专家分配、门控网络和训练稳定性上的深厚积累。

具体而言,模型可能采用 **Top-k 路由 + 辅助损失** 的组合方式,在保证专家负载均衡的同时,极大压缩了无效计算。对比竞品:同等总参数量的密集模型需 600B FLOPs/次推理,而 Step 5 仅需约 27B FLOPs,推理成本降低超过 20 倍。这使得模型能够运行在消费级硬件(如单张 RTX 4090 或 A100)上,真正打通了“旗舰性能、平民部署”的路径。

意义与影响:开源生态的“降维打击”

Step 5 Preview 的开源策略具有双重价值。**第一,技术层面**:它验证了“超高稀疏度 + 训练优化”的可行性,为后续更大规模模型(如 1T+ 参数)的稀疏化提供了工程范本。**第二,生态层面**:600B 级别模型的开源,使中小团队和个人开发者能够享受近乎千亿参数模型的认知能力,而成本仅为商用闭源模型的几十分之一。这直接挤压了追求堆参数的传统闭源巨头的生存空间,倒逼行业从“参数军备竞赛”转向“效率竞赛”。

值得注意的是,阶跃同时开源了适配特定硬件的量化版本和推理框架,进一步降低了部署门槛。可以预见,Step 5 系列将催生一批基于稀疏 MoE 的垂直应用,如长文档分析、复杂代码生成和多轮对话系统,推动 AI 能力从“实验室展示”走向“全天候生产”。

总结

Step 5 Preview 是开源大模型发展史上的一个里程碑。它用 600B 总参数储备了知识容量,用 27B 激活参数兑现了成本友好,用开源策略打破了技术垄断。当“旗舰性能”与“极致性价比”不再二选一,大模型的普惠化进程将迈入全新阶段。下一步,行业需关注其在长上下文、多模态扩展等方面的表现,但仅凭当前的架构突破,Step 5 已为开源社区树立了新的性价比标杆。

相关文章