2026 年 9 月 22 日,小米把 MiMo-V2.6 系列挂上了 Hugging Face:Pro 与 Flash 两个原生全模态模型,权重开放下载,技术报告、训练数据集、RL 训练代码一并放了出来。按小米官方口径(经 AI工具集转述),Pro 在 AA 综合智能指数上拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max,成为综合智能指数上最强的开源模型。但这次发布真正值得拆的,不是那个名次,而是名次背后一套很「重」的训练打法:大约 6 天的 Live RL,大约 75 万条轨迹。开源模型堆参数、卷上下文的故事听了很多年,用环境和真实任务当训练场、把执行能力直接练出来的路线,这次是第一次在综合指数上跑出名次。这篇文章把发布事实、战绩差距、RL 打法、能力边界和开放内容一次拆完,最后给几点冷思考。
先说战绩:开源第一,但天花板还在
把数字摊开看。AA 综合智能指数(官方口径)上,MiMo-V2.6 Pro 拿到 46 分,超过了 Kimi K3 和 Qwen3.8 Max——前者是月之暗面那台 2.8 万亿参数的旗舰开源模型(见Kimi K3 开源全记录),后者是阿里的主力旗舰(见Qwen3.8 Max 发布解读)。开源阵营排位的头部,一夜之间换了主人。
同一份口径也把上限写清楚了:MiMo-V2.6 Pro 仍落后于闭源的 Claude Fable 5.1(见Fable 5.1 与 Mythos 5.1 发布解读)与 GPT-6 Astra(见GPT-6 Astra 发布解读)。开源第一不等于全场第一,这是这次发布里少见的坦率——小米没有回避与闭源旗舰的差距,而是把「最强开源」这个更精确的头衔放在了台面上。
对使用者来说,这条信息比名次本身更有决策价值。如果你的任务天花板足够高、预算充足,闭源旗舰仍然是上限;如果你的约束是成本、数据合规或者需要自部署,MiMo-V2.6 才进入候选清单。两条线并行,不冲突。
还有一层背景值得记下:开源模型在综合智能指数上的排位,过去一年一直在「逼近」与「站稳」之间反复。发布日冲进前排的项目不少,能在一个版本周期后还留在榜上的才是少数。MiMo-V2.6 的 46 分是官方口径下的名次,它能不能让开源第一这个位置「站稳」,下半场要看独立评测与社区实测,这也是下文要展开的冷思考之一。
6 天 Live RL:一场把环境当训练场的实验
传统后训练的路径大多是静态数据集上做监督微调,再用人类偏好做强化学习。MiMo-V2.6 走的是另一条路:以可验证的复杂任务为奖励来源,做大规模 Agentic RL。官方口径给了三个关键数字:约 6 天的 Live RL,约 75 万条轨迹,训练上下文 1M token。在此之上,单步更新推到 2.7 至 3.7B token 的规模,配合大 Batch 与全异步架构。
「Live RL」的关键在 Live 两个字。模型在真实任务环境里跑,轨迹是环境反馈出来的,不是人预先标注好的。75 万条轨迹意味着奖励信号来自 75 万次「任务做完没有、做得对不对」的实际判定,而不是 75 万条人类偏好打分。这两者的差别是本质性的:偏好打分教会模型「像不像好答案」,可验证任务教会模型「答案能不能真的跑通」。
这类方法的代价是工程复杂度陡增。环境要能大规模并行,任务完成与否要有机器可判的判定标准,训练系统要扛得住模型的各种投机取巧。单步更新 2.7 至 3.7B token、全异步架构这些指标,本质上都是在回答同一个问题:怎么让 RL 系统在真实环境的高延迟、高失败率下还能保持吞吐。同步架构里一个环境卡住,整批更新就得等;全异步让快慢环境各跑各的,GPU 不空转,6 天的时间窗口才压得出来。MiMo-V2.6 把这些细节当成发布亮点来讲,说明小米自己也清楚:这套打法的关键不在模型架构,在训练系统。
Reward Hacking:四道防线
只要奖励来自可验证任务,模型就会去找奖励的漏洞——任务没做完但骗过验证器、钻判定规则的空子、复用高分轨迹的表面模式,这是 Agentic RL 最经典的翻车点,业界叫 Reward Hacking。MiMo-V2.6 的方案是四层组合:奖励设计本身收紧,从源头减少可钻的空子;对抗评测持续主动找漏洞;异常检测盯住训练指标突变;验证器交叉校验,避免单一判定标准被模型针对性攻破。官方没有公布每一层的具体实现细节,但四层叠起来的思路是清楚的:不指望任何单一防线绝对可靠,靠冗余和交叉把投机样本的比例压下去。
冻结 MoE Router:一个容易被忽略的细节
MoE 架构下做 RL 有个隐性问题:Router 决定每个 token 激活哪些专家,RL 的持续更新会让路由行为漂移,专家负载失衡,训练后期容易崩掉。MiMo-V2.6 直接把 MoE Router 冻结,抑制专家负载漂移。这是典型的「用一个约束换整体稳定」的取舍——路由的灵活性让位于训练的可控性。
配套设计还有两处值得记下:一是用 Group 内相对比较给长程任务提供细粒度奖励,避免长链任务「只有整题成败一个信号」导致的奖励稀疏;二是统一轨迹表示、控制面与数据面解耦,让不同环境、不同任务类型的轨迹能在同一套系统里流转。整套东西指向同一个目标:让 6 天的 RL 跑得完、跑得稳,而不是中途崩掉重来。
能力面:从写代码到控机械臂
官方宣传的能力清单跨度非常大:软件工程方向,在 DeepSWE v1.1 上样本外成绩有明显提升;能生成 3D 游戏场景;能做 Blender 建模;能对机械臂做闭环控制;Computer Use 方向可以操作电脑完成桌面任务;科研方向包括材料筛选的干实验和 Lean 4 形式化证明;内容创作则覆盖前端页面、PPT、SVG、视频与音乐。
这份清单要按官方宣传口径看待,独立复现和第三方评测还没跟上,别当成实测结论。但它透露的信号是一致的:MiMo-V2.6 的能力设计是围绕「行动」组织的——操作软件、控制设备、跑通科研流程,而不只是问答与写作。这和它用 Agentic RL 训练的方法互为印证:拿可执行任务当奖励练出来的模型,练的就是执行。全模态输入加上可验证任务训练,构成了从「看懂世界」到「在世界里做事」的完整能力链路。
开放了什么:不止权重
这次开源的颗粒度,超出了「放个权重」的常规规格,一共五样东西:
第一,权重与模型卡。Hugging Face 上有完整的 MiMo-V2.6 集合,Pro 与 Flash 都在。
第二,技术报告。PDF 放在 MiMo-V2.6-Pro-RL 仓库,训练配方在第 7 节,想复现的人可以直接按节查。
第三,训练数据集。XiaomiMiMo/MiMo-V2.6-RL-oss,开放下载。
第四,RL 训练代码,即 XiaomiMiMo/verl。这里有一个必须说清楚的定位:它是 fork 自 verl-project/verl 的分支——上游就是 HybridFlow,字节跳动系开源、拥有 23650 星的知名 RL 后训练框架。小米的 fork 基于 verl 0.9.0.dev,增加了五套 RL 环境复现代码:Code 领域做软件工程,验证器是可执行测试;Cyber 领域做漏洞复现,规则检查;General 领域做知识工作,Rubric 评审;Visual 领域做网页开发,视觉评分;Music 领域做符号音乐作曲,规则检查。每个领域都有对应的启动脚本。fork 仓 2026 年 9 月 21 日创建,截至 9 月 27 日快照 465 星、49 个 fork,许可 Apache-2.0(以仓库 LICENSE 文件为最终口径)。它不是小米原创的 RL 框架,是在成熟框架上加环境层,这个定位不能写混。
第五,配套工具。同日创建的还有 uni-agent(长程 Agent 训练框架,Apache-2.0)和 mimoagent(「100 行解决 GitHub issue」的极简 Agent,MIT),三个仓库同天创建,构成一个训练基建全家桶。
这个组合拳的含义是可复现性:拿到权重的人可以下载数据集、按技术报告第 7 节的配方、用开源的 RL 代码把训练流程跑一遍。开源社区能不能真的复现,是接下来比任何跑分都更有信息量的事件。想横向理解这套 RL 工具链在生态里的位置,可以参考本站对主流 Agentic RL 框架的对比。
价格与上手:三条路线
性价比方面,文章口径称同智能水平下价格约为海外模型的 1/20 至 1/60,且 API 价格维持不变。这个数字来自文章转述而非官方定价页,做预算前请以小米开放平台实际报价核实,这里只标注口径不下结论。
上手路线有三条。其一,MiMo Desktop 客户端,支持 macOS 与 Windows,登录订阅或自配 API Key,模型列表里切换 Pro 与 Flash,另有 UltraSpeed 超高速模式。其二,MiMo 开放平台 API:建应用拿 Key,按文档传模型名、消息、工具与多模态输入;做 Agent 任务时可以接环境日志、测试通过率、截图或验证器反馈,形成执行、检查、修正的闭环;建议先小流量灰度,验证价格、延迟与成功率再放量。其三,本地权重:从 HF 集合下载,硬件门槛以模型卡为准——官方没有公布参数量,具体显存需求不要自己估。完整的接入步骤与避坑清单,见本站的 MiMo-V2.6 接入 SOP。
冷思考:三个待验证的问题
第一,参数量未公布。本地部署的显存账没法算,硬件门槛只能等模型卡补齐。对一个标榜开源的模型,这是明显的短板——开源的意义一半在可控可审计,参数量捂着,社区的自部署评估就做不完整。
第二,生态还没经过时间检验。verl fork 9 月 21 日才创建,465 星说明有关注,但说明不了复现质量。GitHub compare 显示 fork 分支 ahead_by 为 0、behind_by 为 16,上游仍在活跃推进,分叉细节外界无从核实,所以也不要期待在这个 fork 上看到小米独家的大改。五套环境的复现代码能不能在别人手里跑出同样的曲线,目前没有第三方答案。
第三,跑分是官方口径。AA 指数 46 分、超越 Kimi K3 与 Qwen3.8 Max,全部来自小米官方经由 AI工具集的转述,独立评测尚未跟上。开源第一的头衔含金量有几分,要看社区实测跑出来的数字,这也是所有「发布日第一」共同的宿命。
另外提醒一句:小米 6 月发布的 MiMo-Code 是终端编码助手,与本次的 MiMo-V2.6 是两条产品线,搜索资料时别混淆。
回到开头的问题:6 天 RL 换 46 分,这笔账划算吗。MiMo-V2.6 的发布逻辑可以概括成一句话——用 6 天的 Live RL 和 75 万条轨迹证明,开源模型在 Agentic 能力上第一次摸到了闭源的门槛。46 分追不上 Fable 5.1 和 GPT-6 Astra,但差距第一次被压缩到「看起来可以用方法弥补」的程度,而方法本身是公开的:权重、数据、代码、配方都在 Hugging Face 和 GitHub 上。接下来轮到社区验证。开源第一是不是实至名归,答案不在发布页,在复现仓的提交记录里。
参考来源
- MiMo-V2.6 发布条目(AI工具集转述小米官方,2026-09-22):https://ai-bot.cn/xiaomi-mimo-v2-6/
- MiMo-V2.6 Hugging Face 权重集合:https://huggingface.co/collections/XiaomiMiMo/mimo-v26
- XiaomiMiMo/verl 仓库(GitHub API 2026-09-27 快照,465 星):https://github.com/XiaomiMiMo/verl
- verl-project/verl 上游仓库(HybridFlow):https://github.com/verl-project/verl
- XiaomiMiMo/uni-agent 仓库:https://github.com/XiaomiMiMo/uni-agent
- XiaomiMiMo/mimoagent 仓库:https://github.com/XiaomiMiMo/mimoagent
- 口径说明:训练与跑分数据为小米官方口径(经 AI工具集转述);价格比为文章口径;参数量未公布,本文未作推测。