小米把新模型的强化学习训练过程挂到网上开直播了。
点开那个页面,能看到的东西不少。花了多少钱,跑到第几步,奖励曲线有没有往上走,全都实时更新。连哪个节点的显卡出了故障,页面上也记着。被直播的是两款模型,MiMo-V2.6 的 Flash 和 Pro。
先说最扎眼的一栏,账单。从 Pro 开始训练算起 36 小时,两款模型花掉超过 108 万美元。平均下来,每小时 3 万美元。换个更直观的说法,一眨眼就是 10 美刀。一分钟 4000 多块人民币,就这么出去了。
训练烧钱这件事,大家心里都有数。把账单摊开给人看,却没几家公司干过。

然后是分数。Pro 的 dynsam/avg@n 从第 1 步的约 0.565 升到 0.614。Flash 从约 0.514 升到 0.603。最新一次公开的 DeepSWE v1.1 离线评测里,Pro 拿到 62.24。Flash 是 60.77。做参照的话,DeepSeek-Flash v1.1 在同一评测里是 74.2%。
Flash 起点低,追得却快。Pro 目前只保持小幅领先,它训练完一个 Step 更慢,最新的评分还没补上。两款模型都才跑了一天多一点。时间还短。
小米上一款开源模型 MiMo-v2.5 是 4 月发的,中间半年没什么动静。这次负责人罗福莉出来解释,说这半年只研究了一件事。强化学习到底能扩展到多远。
传统预训练那套扩展很好理解。数据堆得越多,参数越大,算力给得越足,模型就越强。前沿团队现在在问另一个问题,强化学习能不能也照这个来。
要回答,先得想清楚三件事。每一轮让模型生成多少条轨迹,模型要面对多少种真实任务环境,判断这些轨迹好不好又要投入多少计算。小米给的答案是三个维度一起扩。
把训练本身的计算规模做大
这一层最直观。
MiMo-V2.6 每个训练 Step 大约处理 20 亿 Token。配置是 1568 个提示词,每个提示词配 16 条轨迹。同一道题,不让模型答一次就收工。它要试多条不同的解题和行动路线,再从这些尝试里取强化学习的信号。1568 乘 16,一轮下来就可能产生超过 2.5 万条轨迹。
对智能体任务来说,一条轨迹不只是问答。模型可能要经历几十轮思考。调用工具,接收环境反馈,再决定下一步动作。所以一个 Step 最终的 Token 数,能到几十亿。
整个系统用的是完全异步,Fully Async。以前可以把训练想象成一条整齐的流水线。样本先全部生成完,再统一评分,然后训练,接着进下一轮。大规模智能体强化学习等不了这个节奏。在 MiMo 的系统里,不同任务同时处在不同阶段。有的还在环境里跑,有的已经完成等着判分,有的正在算奖励,新任务也还在往系统里进。生成,执行,评分,训练不再排队。它们凑成了一条持续运转的异步流水线。
让模型见到更多样的环境
再往外一层,是训练环境和执行框架,原文写的是 Environments and Harnesses。
MiMo-V2.6 做的是 Multi-task Agentic RL。代码,通用任务,视觉,对话,这些不同类型的任务可以混到同一次强化学习训练里,还能跑在不同的执行框架下。
一个编程智能体的框架,可能允许模型开终端,改代码,跑测试。读完报错,它还能接着改。换成视觉智能体,面对的工具,环境反馈,成功条件又是另一套。
所以这里要扩的不只是题目数量。模型能进入多少种环境,能用多少种工具,能解多少类问题。这些都算在这一层里。直播页面上专门有一栏 Batch Composition。它讲的是每个训练 Step 里,模型在从什么样的任务和环境里拿经验。
给打分这件事本身加算力
最容易漏掉的是最后一层。给评分环节加算力,也就是 Grader Compute。
强化学习要靠奖励。可复杂智能体任务的奖励,不像做数学选择题那样好拿。代码任务还能跑测试用例,100 个测试过了多少,反馈相对客观。
换成更开放的智能体任务,只判断最后成功还是失败就不够用了。负责判断模型做得好不好的评分者,开始吃掉越来越多的计算资源。
这背后还有一层问题,信用分配。
设想一个智能体为了完成任务,连着做了 40 步。搜资料,打开网页读信息,写代码跑测试,发现报错回头改。最后它把事办成了。如果系统最后只丢给模型一句成功,奖励等于 1。信号太粗。
模型并不清楚这 40 步里,哪几个动作真的帮上了忙。哪几步其实白做,它也不知道。它也看不出哪一次修改扭转了整个局面。有些动作没坏事,但本身选得并不好。
MiMo 这次特别提到了 Agentic In-group Credit Assignment。具体算法还没公布。结合同一个提示词生成 16 条轨迹的做法,大致意图能看出来。就是拿同一组里的多条轨迹和结果,换一个比最终成败更细的学习信号。
三个方向合起来是一件事
扩计算量,让模型产生更多经验。扩环境和执行框架,让经验更多样。更多的评分算力,负责从这些经验里把信号提准。
对平时用AI工具的人来说,这个页面给的东西不太一样。训练过程本身摆在明面上,而不只是训练完的结论。
罗福莉转发的那条帖子里,有人给出更直白的翻译。三件事,背后都是算力。
回到那个直播页面,奖励曲线还在往上走,账单也还在涨。Pro 下一个 Step 的分数什么时候补上,去页面刷一眼就知道。
