单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线
事件
小米公开了其大模型MiMo-V2.6的“规模化强化学习”技术路线,并披露了后训练阶段的真实开销:完成一次强化学习后训练的成本约为260万美元,训练过程中每个优化步骤消耗约37亿Token。这一数字将大模型RL后训练的算力与数据消耗量级摆到了台面上。
从机制上看,规模化强化学习意味着在预训练之后,用海量采样与奖励信号反复迭代模型行为,每一步都要生成并评估大量轨迹,因此Token消耗远高于常规监督微调。37亿Token/步的规模,说明其训练管线在并行采样、奖励模型推理与策略更新上都做了工程化放大,260万美元的单次成本也主要来自这些推理与训练算力。
对行业而言,这组数据揭示了一个趋势:后训练正从“小步调优”变成重资产投入,RL的算力账单开始与预训练同一量级。对做模型研发的团队,这意味着需要重新评估RL的投入产出比与工程效率;对关注AI算力与成本的人,小米的披露提供了一个可参考的基准。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:InfoQ 中文*