摘要:腾讯混元团队发布论文《When Do Larger Batches Help Scale LLM Reinforcement Learning?》,将经典临界批大小理论重推至在线大模型强化学习场景。研究覆盖GRPO与PPO两类主流算法,发现批大小存在“甜蜜区间”:学习率重调后,B、2B、4B在累计样本维度表现近似不变,但扩至16B时样本效率损失反超吞吐收益。固定硬件下,扩大批次使生成吞吐最高提升2.29倍,最佳GRPO配置达到相同验证目标的时间缩短29%。

大模型强化学习正驶向更大的GPU集群和更厚的训练数据,训练效率已从配角升格为头等大事。腾讯混元团队(Tencent Hunyuan RL Team)于2026年8月底将论文《When Do Larger Batches Help Scale LLM Reinforcement Learning?》提交至arXiv(编号2608.29296,cs.LG),并于9月22日由腾讯混元官网发布研究介绍,机器之心同日发表深度解读。
论文的出发点是经典的临界批大小(critical batch size)理论。2017年Facebook用大批量将ResNet-50在ImageNet上的训练压缩到1小时;2018年OpenAI基于大Batch训练提出经验模型;2022年OpenAI又在策略优化中观察到批大小不变性。这些结论在传统监督学习和早期RL场景中成立,但放到在线大模型强化学习中,情况发生了变化:模型需要自己生成训练数据,rollout生成与训练本身以不同节奏缩放,经典理论不能直接照搬。
腾讯混元团队正是将这一经典理论重新推演到在线LLM强化学习场景,覆盖GRPO与PPO两类主流算法。
研究的结论相当务实。批大小不是越大越好,也不是一成不变,而是存在一个可以调教清楚的甜蜜区间。
具体而言,在学习率配套重调的“有界批次范围”内,批次大小B、2B、4B在累计样本维度上几乎不变,说明扩大批次并不会稀释“每条响应”该学到的东西。然而,一旦扩大到16B,样本效率的损失开始超过吞吐收益,整体收益由正转负。
这一结论的关键前提是“重新调整学习率”。研究者观察到,批大小扩大后,只要在可行范围内对学习率做相应重调,模型在每个样本上的学习效果就可以得到保障。离开这一前提,简单粗暴地增大批大小并不会带来效率提升。
落到硬件账单上,收益同样醒目。在固定硬件配置下,把批大小往上扩,生成阶段的吞吐量最高提升2.29倍;而测量到的最佳GRPO配置,在不增加GPU的情况下,达到相同验证目标的时间缩短了29%。
论文进一步给出一个简洁的决策规则:更大批次只有在吞吐增益超过样本代价时,才能真正缩短time-to-target。机器之心的解读将相关决策拆成“Batch Size Tuning”与“Batch Size Scaling”两类问题,讨论的正是从一万张卡扩展到十万张卡时,批大小应该怎么调。
该研究是腾讯混元RL Team系列工作的一部分。腾讯混元官网同页还列出了Hyra-1.0研究智能体等团队成果,当前混元主推Hy3(295B/21B MoE)等模型。在本文作者看来,这项研究更大的价值不在给出一个万能最优批大小,而在于把规模化RL训练中的模糊经验,变成基于吞吐与样本效率的工程判断——面对万卡乃至十万卡集群时,这项权衡能力的意义会愈发明显。