当前位置:首页 >  科技 >  IT业界 >  正文

一次强化学习后训练花掉260万美元,小米连训练细节一起公开

 2026-10-11 12:30  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

10月8日,小米MiMo团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,把一套大规模智能体强化学习训练的全过程摊在纸面上。报告同时放出两个模型:MiMo-V2.6-Pro和MiMo-V2.6-Flash,两者都采用稀疏混合专家架构,面向代码智能体、工具调用这类需要多步推理的任务。

两个模型的体量差得不小。Pro的总参数量为1.02万亿,每次推理激活其中420亿;Flash的总参数量为3100亿,激活150亿。这个配比是稀疏混合专家架构的常规做法,模型做得很大,但每次只让一小部分参数参与计算,用来压住推理开销。报告的重点不在模型本身,而在训练方法,也就是怎么用强化学习把智能体的能力往上推。

训练被拆成三块:轨迹采样、评判和训练。每个强化学习步骤先采样1568个提示词,每条提示词同时生成16条轨迹,算下来一步就能产出约2.5万条智能体轨迹。这些轨迹合计27亿到37亿个Token,平均每条序列11万到15万Token,训练上下文最长到100万Token。这种量级意味着每走一步,都要有配套的算力和环境撑着。

任务构成也公布得很细。正式强化学习批次里,代码与竞赛编程任务占68%,是绝对的大头;通用工具使用和视觉设计分别占12%和13%;上下文遵循占3%,网络安全占4%。训练用GRPO算法,配合异步的部分轨迹生成。看得出权重压在代码上,这也和小米把智能体能力往编程场景引的方向一致,视觉设计和工具使用则各留了一块。

最直观的数字是钱。报告披露,MiMo-V2.6-Pro这一轮强化学习后训练的成本约260万美元,Flash约90万美元。这个价格放在前沿模型训练里不算夸张,但它衡量的是单个模型的一次后训练;报告想传递的信息是,规模化的智能体强化学习已经贵到需要认真算账,想靠堆算力把能力推上去,成本曲线会很陡。

把训练配方和成本一起公开,在当前并不常见。国内厂商更习惯只报结果分数,很少把每一步花多少Token、跑多少条轨迹写清楚。这份报告的价值在于可复现的参考:如果团队要自己做智能体强化学习,它能提供一组起点数字。同时它也划出了门槛——单次后训练两百万美元级别,加上环境和评测的开销,不是小团队随手能复制的规模。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

热门排行

信息推荐