腾讯混元将经典临界批大小理论引入大模型强化学习,PPO生成吞吐量最高达2.29倍,GRPO节省29%训练时间

AI资讯16小时前发布 全启星小编
189 0

腾讯混元将经典临界批大小理论引入大模型强化学习,显著提升训练效率

近日,腾讯混元团队公布了一项在大模型强化学习领域的创新成果:将深度学习优化中经典的**临界批大小(Critical Batch Size)理论** 系统性地引入大规模强化学习训练流程,并针对主流算法PPO与GRPO进行了针对性优化。实验表明,该方法使PPO的生成吞吐量最高提升至原来的**2.29倍**,同时GRPO算法的训练时间节省了**29%**。

经典理论的新应用:从监督学习到强化学习

临界批大小理论最早源于监督学习优化研究,核心思想是指出在给定模型、数据和硬件条件下,存在一个“最优”的批大小——小于该值时训练吞吐量受计算效率瓶颈限制,大于该值时模型的泛化性能会显著下降。然而,在大模型强化学习场景中,策略模型与奖励模型的交互带来了更复杂的动态:生成阶段(rollout)与训练阶段(update)的批大小耦合、经验数据的非平稳分布,使得传统理论难以直接套用。腾讯混元团队通过重新推导强化学习中的梯度方差与批大小的关系,并结合MegaScale等大规模训练框架的实践经验,成功将临界批大小理论适配至PPO与GRPO两种主流算法中。

吞吐量与训练时间的双重突破

在PPO算法中,团队发现生成阶段(即策略模型输出回复的过程)的批大小是吞吐量的主要瓶颈。通过采用临界批大小作为上限,并设计自适应缓存机制,PPO的生成吞吐量从原有基线提升最多2.29倍——这意味着在相同硬件资源下,单位时间内可产出的训练样本量翻倍以上。对于更依赖组间对比信号的GRPO算法,团队则通过调整经验回放窗口的批大小分配策略,避免了不必要的梯度重计算,最终实现了29%的训练时间缩减,且不牺牲模型收敛效果。

行业意义与未来方向

这一成果表明,经典优化理论在大模型时代依然具有极强的指导价值。以往大模型的强化学习训练往往依赖经验调参,例如简单地增大批大小以提升吞吐,却忽视了由此带来的方差膨胀与学习稳定性问题。腾讯混元的工作不仅提供了一个可复用的理论框架,也揭示了跨算法(PPO与GRPO)的普适优化路径。后续,该团队计划进一步将临界批大小理论扩展到多模态大模型与在线学习的场景中,并开源相关的训练配置与校准工具,助力行业在成本和效率之间找到更精确的平衡点。

相关文章