✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线

事件

小米公开了其大模型MiMo-V2.6的“规模化强化学习”技术路线,并披露了后训练阶段的真实开销:完成一次强化学习后训练的成本约为260万美元,训练过程中每个优化步骤消耗约37亿Token。这一数字将大模型RL后训练的算力与数据消耗量级摆到了台面上。

从机制上看,规模化强化学习意味着在预训练之后,用海量采样与奖励信号反复迭代模型行为,每一步都要生成并评估大量轨迹,因此Token消耗远高于常规监督微调。37亿Token/步的规模,说明其训练管线在并行采样、奖励模型推理与策略更新上都做了工程化放大,260万美元的单次成本也主要来自这些推理与训练算力。

对行业而言,这组数据揭示了一个趋势:后训练正从“小步调优”变成重资产投入,RL的算力账单开始与预训练同一量级。对做模型研发的团队,这意味着需要重新评估RL的投入产出比与工程效率;对关注AI算力与成本的人,小米的披露提供了一个可参考的基准。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:InfoQ 中文*

📎 原始来源:InfoQ 中文
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容