小米MiMo | 都在押注递归自我改进(RSI)?V2.6开源RL全链路,国产基座的门槛之战

小米MiMo V2.6开源RL全链路配方,权重、七千任务环境与训练框架一并开放。但奖励模型未放行、自我迭代未实现,复现门槛将裁决递归自我改进的叙事。

图片

小米将强化学习时代模型生产的核心要素打包开放,但奖励打分器权重并未同行,闭环自我迭代也未实现。配方开源之后,真正的门槛才浮上水面。

今天9月22日凌晨,小米发布并开源MiMo-V2.6系列,包括全模态旗舰MiMo-V2.6-Pro、高效推理模型MiMo-V2.6-Flash,以及基于MiMo RL轨迹蒸馏的MiMo-V2.6-Distill-Qwen-9B,同步开放七千余个RL任务环境、端到端训练框架与可组合Harness,均以MIT协议授权。

MIT协议意味着商业使用、二次修改与分发均无强制开源义务,对私有化厂商友好。需要划清边界的是,开放的是任务环境、奖励逻辑与训练代码,奖励打分器本身的权重并未随同发布。

这是国内厂商首次将Agentic RL生产的核心要素打包开放,但尚不构成奖励模型的完整释放。同样,官方将本次实验定位为迈向递归自我改进的关键一步,模型不能自主生成下一代模型,闭环自我迭代并未实现。本文讨论的门槛,正是通往该目标的第一道。

46.3
AA综合智能指数
开源权重模型最高
30
RL训练完成步数
累计75万条轨迹
6
Pro与Flash各自
训练全程用时
7k+
高质量RL任务环境
四大类同步开放

能力坐标,客观定位

图片

MiMo-V2.6-Pro在Artificial Analysis综合智能指数中取得46.3分,超过Kimi K3与GLM-5.3,为该榜单当前得分最高的开源权重模型;官方同时承认,与Claude Fable 5.1、GPT-6 Astra的53分仍有明确差距。

差距的明示,比名次的争夺更接近研究机构的规范。

技术要点,五个少被讨论的细节


Grader算力与组内相对奖励
图片

训练采用全异步架构,单次更新1568个样本,支持百万级上下文,单步训练吞吐约3.4至3.7B token;奖励信号不采用绝对打分,而是在同一批样本内部做组内对比,为长程任务提供更细粒度的信号。

这标志着算力支出结构中,验证算力成为与训练、推理并列的第三类支出。


MoE Router冻结与奖励防线
图片

随着训练规模扩大,团队冻结Router以抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测、异常检测与验证器交叉校验的Reward Hacking防线

RL信号稀疏且分布偏斜,MoE模型易被奖励牵着反复调用少数专家,能力结构随之畸化,这套取舍是对失败模式的工程性回应,对同架构团队有直接参考价值。


三十步的效率证据
图片

Pro与Flash的RL训练各历时不足6天,成本约262万与85万美元,各完成30步、累计约75万条轨迹,任务平均通过率分别提升25%与12%,样本外长程工程基准DeepSWE v1.1分别提升约17分与14分。

图片
图片

能力增量主要兑现于RL阶段且步数极少,说明本代模型的性能增长主要来自环境与奖励的规模,而非参数规模扩张。发布前公开的实时训练面板将奖励曲线、轨迹数与成本累加全程开放,使外部验证成为可能,

把训练过程摊开来,或许是比协议授权更激进的一种透明化。


原生全模态与任务谱系
图片

V2.6-Pro与Flash均为原生全模态基座,1.02T稀疏MoE,单次推理激活约42B参数,RL训练直接混合文本、代码、视觉与网络安全任务,而非文本模型后补多模态。

七千余个任务环境覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类,其中网络安全方向的MiMo Cyber Bench是国产模型少有的公开Agent安全评测集。


UltraSpeed的边界
图片

最高20倍输出加速仅Pro版本支持,且该模式自V2.5起即采用FP4量化加DFlash投机解码加定制推理引擎的协同路径,加速以质量可控为前提,存在资源供给与输出稳定性的权衡,并非无代价提速。

图片

能力温差,榜单优势与现实约束

Artificial Analysis属于第三方综合榜单,但仍是静态基准评测,不等同真实生产环境中的长程Agent表现,多轮工具调用与真实任务还缺少大规模独立复现。

图片

蒸馏版Distill-Qwen-9B虽在11项评测中全面超过SFT基线,例如MiMo Cyber Bench从31.3提升至47.0,Terminal Bench 2.1从37.1提升至52.8,但与Pro的原生能力存在代差,定位是私有化场景的轻量二次迭代起点,而非旗舰平替。

此外,本次RL收益集中于Agent、工具调用与长程执行类任务,传统对话与简单摘要类任务的增益有限,能力提升存在明确的分布偏向,按场景评估,比按总分评估更接近真实价值。

图片

产业映射,配方开源与复现门槛并存

过往国产开源多止步于权重与推理代码,本次释放的是Agentic RL的完整可复现配方,任务库、Harness、训练框架与训练过程指标。

私有化部署者由此首次可以在自有算力上延续模型的训练过程,而非仅做推理调用。但配方不等于低成本复现,Pro完整30步训练的账面成本即约262万美元,Grader算力门槛客观存在,中小机构更现实的路径是基于蒸馏版做小规模迭代。

国产算力集群的影响分两层。

推理层,权重开放后国产芯片可直接承载私有化部署。

训练层,Agent RL集群不再是传统预训练大集群,需要高并发环境交互、专用评估算力与沙箱资源,架构从纯算力密集转向算力、沙箱、评估算力的混合形态,这对服务器与调度软件提出新的适配要求,恰好是工程优化权重高于堆卡权重的环节。

定价层面,API沿用V2.5未作调整,官方给出的锚点为同等智能水平下价格为海外模型的1/20至1/60。

图片

这是基于榜单加权任务成本的官方对标口径,真实业务开销受输出量与Agent多轮调用次数影响显著,纸面单价不等于实际支出,需按任务形态折算。

另需指出,开源的任务环境库本身存在分布局限,任务大多是人工构造的标准化任务,与互联网原生的真实复杂任务之间仍有差距。

结语

把视野放宽,近期国内几条技术路线的指向是一致的,模型开始反作用于孕育它的系统,只是落点各异。

阶跃Step 5 Preview聚焦Kernel与硬件层自优化,智谱Infra Agent面向推理运维系统调优,MiMo V2.6则开放Agent RL训练全栈配方

MiMo V2.6属于后者,

它把入场券应有的形状第一次完整地画了出来,尽管这张门票的价格,目前还只有少数玩家付得起。

后续值得跟踪的变量有四个。

  • 开放任务环境的社区再生产速度;

  • 蒸馏链路在端侧硬件的实际落地质量;

  • 外部研究者能否基于开源框架复现RL阶段的能力增益,大规模RL的可复现性一直是行业痛点;

  • 在七千余个任务集上继续迭代时,模型是否会出现针对任务集的过拟合,在分布外真实任务上能力跳水。


递归自我改进的叙事是否成立,将由第三与第四个变量来裁决。

- END -


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信