前沿热点
前沿热点

6 天 RL 换 46 分:小米 MiMo-V2.6 登顶开源

小米 2026-09-22 发布并开源 MiMo-V2.6 系列(Pro 与 Flash 两个原生全模态模型,小米官方口径经 AI工具集转述):约 6 天 Live RL、约 75 万条轨迹,Pro 在 AA 综合智能指数达 46 分,超越 Kimi K3 与 Qwen3.8 Max 成最强开源模型,但仍落后闭源 Claude Fable 5.1 与 GPT-6 Astra。训练核心为可验证奖励的大规模 Agentic RL:冻结 MoE Router、Group 内相对比较、多防线压制 Reward Hacking;训练上下文 1M、单步更新 2.7-3.7B token(官方口径)。权重、技术报告 PDF、RL 代码与训练数据集 MiMo-V2.6-RL-oss 全部开放;价格约为海外模型 1/20-1/60 系文章口径,参数量未公布。

发布于 2026年9月27日9 分钟阅读
<!-- mimo-v2-6-hotspot | hotspot | 6 天 RL 换 46 分:小米 MiMo-V2.6 登顶开源 -->

2026 年 9 月 22 日,小米把 MiMo-V2.6 系列挂上了 Hugging Face:Pro 与 Flash 两个原生全模态模型,权重开放下载,技术报告、训练数据集、RL 训练代码一并放了出来。按小米官方口径(经 AI工具集转述),Pro 在 AA 综合智能指数上拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max,成为综合智能指数上最强的开源模型。但这次发布真正值得拆的,不是那个名次,而是名次背后一套很「重」的训练打法:大约 6 天的 Live RL,大约 75 万条轨迹。开源模型堆参数、卷上下文的故事听了很多年,用环境和真实任务当训练场、把执行能力直接练出来的路线,这次是第一次在综合指数上跑出名次。这篇文章把发布事实、战绩差距、RL 打法、能力边界和开放内容一次拆完,最后给几点冷思考。

先说战绩:开源第一,但天花板还在

把数字摊开看。AA 综合智能指数(官方口径)上,MiMo-V2.6 Pro 拿到 46 分,超过了 Kimi K3 和 Qwen3.8 Max——前者是月之暗面那台 2.8 万亿参数的旗舰开源模型(见Kimi K3 开源全记录),后者是阿里的主力旗舰(见Qwen3.8 Max 发布解读)。开源阵营排位的头部,一夜之间换了主人。

同一份口径也把上限写清楚了:MiMo-V2.6 Pro 仍落后于闭源的 Claude Fable 5.1(见Fable 5.1 与 Mythos 5.1 发布解读)与 GPT-6 Astra(见GPT-6 Astra 发布解读)。开源第一不等于全场第一,这是这次发布里少见的坦率——小米没有回避与闭源旗舰的差距,而是把「最强开源」这个更精确的头衔放在了台面上。

对使用者来说,这条信息比名次本身更有决策价值。如果你的任务天花板足够高、预算充足,闭源旗舰仍然是上限;如果你的约束是成本、数据合规或者需要自部署,MiMo-V2.6 才进入候选清单。两条线并行,不冲突。

还有一层背景值得记下:开源模型在综合智能指数上的排位,过去一年一直在「逼近」与「站稳」之间反复。发布日冲进前排的项目不少,能在一个版本周期后还留在榜上的才是少数。MiMo-V2.6 的 46 分是官方口径下的名次,它能不能让开源第一这个位置「站稳」,下半场要看独立评测与社区实测,这也是下文要展开的冷思考之一。

6 天 Live RL:一场把环境当训练场的实验

传统后训练的路径大多是静态数据集上做监督微调,再用人类偏好做强化学习。MiMo-V2.6 走的是另一条路:以可验证的复杂任务为奖励来源,做大规模 Agentic RL。官方口径给了三个关键数字:约 6 天的 Live RL,约 75 万条轨迹,训练上下文 1M token。在此之上,单步更新推到 2.7 至 3.7B token 的规模,配合大 Batch 与全异步架构。

「Live RL」的关键在 Live 两个字。模型在真实任务环境里跑,轨迹是环境反馈出来的,不是人预先标注好的。75 万条轨迹意味着奖励信号来自 75 万次「任务做完没有、做得对不对」的实际判定,而不是 75 万条人类偏好打分。这两者的差别是本质性的:偏好打分教会模型「像不像好答案」,可验证任务教会模型「答案能不能真的跑通」。

这类方法的代价是工程复杂度陡增。环境要能大规模并行,任务完成与否要有机器可判的判定标准,训练系统要扛得住模型的各种投机取巧。单步更新 2.7 至 3.7B token、全异步架构这些指标,本质上都是在回答同一个问题:怎么让 RL 系统在真实环境的高延迟、高失败率下还能保持吞吐。同步架构里一个环境卡住,整批更新就得等;全异步让快慢环境各跑各的,GPU 不空转,6 天的时间窗口才压得出来。MiMo-V2.6 把这些细节当成发布亮点来讲,说明小米自己也清楚:这套打法的关键不在模型架构,在训练系统。

Reward Hacking:四道防线

只要奖励来自可验证任务,模型就会去找奖励的漏洞——任务没做完但骗过验证器、钻判定规则的空子、复用高分轨迹的表面模式,这是 Agentic RL 最经典的翻车点,业界叫 Reward Hacking。MiMo-V2.6 的方案是四层组合:奖励设计本身收紧,从源头减少可钻的空子;对抗评测持续主动找漏洞;异常检测盯住训练指标突变;验证器交叉校验,避免单一判定标准被模型针对性攻破。官方没有公布每一层的具体实现细节,但四层叠起来的思路是清楚的:不指望任何单一防线绝对可靠,靠冗余和交叉把投机样本的比例压下去。

冻结 MoE Router:一个容易被忽略的细节

MoE 架构下做 RL 有个隐性问题:Router 决定每个 token 激活哪些专家,RL 的持续更新会让路由行为漂移,专家负载失衡,训练后期容易崩掉。MiMo-V2.6 直接把 MoE Router 冻结,抑制专家负载漂移。这是典型的「用一个约束换整体稳定」的取舍——路由的灵活性让位于训练的可控性。

配套设计还有两处值得记下:一是用 Group 内相对比较给长程任务提供细粒度奖励,避免长链任务「只有整题成败一个信号」导致的奖励稀疏;二是统一轨迹表示、控制面与数据面解耦,让不同环境、不同任务类型的轨迹能在同一套系统里流转。整套东西指向同一个目标:让 6 天的 RL 跑得完、跑得稳,而不是中途崩掉重来。

能力面:从写代码到控机械臂

官方宣传的能力清单跨度非常大:软件工程方向,在 DeepSWE v1.1 上样本外成绩有明显提升;能生成 3D 游戏场景;能做 Blender 建模;能对机械臂做闭环控制;Computer Use 方向可以操作电脑完成桌面任务;科研方向包括材料筛选的干实验和 Lean 4 形式化证明;内容创作则覆盖前端页面、PPT、SVG、视频与音乐。

这份清单要按官方宣传口径看待,独立复现和第三方评测还没跟上,别当成实测结论。但它透露的信号是一致的:MiMo-V2.6 的能力设计是围绕「行动」组织的——操作软件、控制设备、跑通科研流程,而不只是问答与写作。这和它用 Agentic RL 训练的方法互为印证:拿可执行任务当奖励练出来的模型,练的就是执行。全模态输入加上可验证任务训练,构成了从「看懂世界」到「在世界里做事」的完整能力链路。

开放了什么:不止权重

这次开源的颗粒度,超出了「放个权重」的常规规格,一共五样东西:

第一,权重与模型卡。Hugging Face 上有完整的 MiMo-V2.6 集合,Pro 与 Flash 都在。

第二,技术报告。PDF 放在 MiMo-V2.6-Pro-RL 仓库,训练配方在第 7 节,想复现的人可以直接按节查。

第三,训练数据集。XiaomiMiMo/MiMo-V2.6-RL-oss,开放下载。

第四,RL 训练代码,即 XiaomiMiMo/verl。这里有一个必须说清楚的定位:它是 fork 自 verl-project/verl 的分支——上游就是 HybridFlow,字节跳动系开源、拥有 23650 星的知名 RL 后训练框架。小米的 fork 基于 verl 0.9.0.dev,增加了五套 RL 环境复现代码:Code 领域做软件工程,验证器是可执行测试;Cyber 领域做漏洞复现,规则检查;General 领域做知识工作,Rubric 评审;Visual 领域做网页开发,视觉评分;Music 领域做符号音乐作曲,规则检查。每个领域都有对应的启动脚本。fork 仓 2026 年 9 月 21 日创建,截至 9 月 27 日快照 465 星、49 个 fork,许可 Apache-2.0(以仓库 LICENSE 文件为最终口径)。它不是小米原创的 RL 框架,是在成熟框架上加环境层,这个定位不能写混。

第五,配套工具。同日创建的还有 uni-agent(长程 Agent 训练框架,Apache-2.0)和 mimoagent(「100 行解决 GitHub issue」的极简 Agent,MIT),三个仓库同天创建,构成一个训练基建全家桶。

这个组合拳的含义是可复现性:拿到权重的人可以下载数据集、按技术报告第 7 节的配方、用开源的 RL 代码把训练流程跑一遍。开源社区能不能真的复现,是接下来比任何跑分都更有信息量的事件。想横向理解这套 RL 工具链在生态里的位置,可以参考本站对主流 Agentic RL 框架的对比。

价格与上手:三条路线

性价比方面,文章口径称同智能水平下价格约为海外模型的 1/20 至 1/60,且 API 价格维持不变。这个数字来自文章转述而非官方定价页,做预算前请以小米开放平台实际报价核实,这里只标注口径不下结论。

上手路线有三条。其一,MiMo Desktop 客户端,支持 macOS 与 Windows,登录订阅或自配 API Key,模型列表里切换 Pro 与 Flash,另有 UltraSpeed 超高速模式。其二,MiMo 开放平台 API:建应用拿 Key,按文档传模型名、消息、工具与多模态输入;做 Agent 任务时可以接环境日志、测试通过率、截图或验证器反馈,形成执行、检查、修正的闭环;建议先小流量灰度,验证价格、延迟与成功率再放量。其三,本地权重:从 HF 集合下载,硬件门槛以模型卡为准——官方没有公布参数量,具体显存需求不要自己估。完整的接入步骤与避坑清单,见本站的 MiMo-V2.6 接入 SOP。

冷思考:三个待验证的问题

第一,参数量未公布。本地部署的显存账没法算,硬件门槛只能等模型卡补齐。对一个标榜开源的模型,这是明显的短板——开源的意义一半在可控可审计,参数量捂着,社区的自部署评估就做不完整。

第二,生态还没经过时间检验。verl fork 9 月 21 日才创建,465 星说明有关注,但说明不了复现质量。GitHub compare 显示 fork 分支 ahead_by 为 0、behind_by 为 16,上游仍在活跃推进,分叉细节外界无从核实,所以也不要期待在这个 fork 上看到小米独家的大改。五套环境的复现代码能不能在别人手里跑出同样的曲线,目前没有第三方答案。

第三,跑分是官方口径。AA 指数 46 分、超越 Kimi K3 与 Qwen3.8 Max,全部来自小米官方经由 AI工具集的转述,独立评测尚未跟上。开源第一的头衔含金量有几分,要看社区实测跑出来的数字,这也是所有「发布日第一」共同的宿命。

另外提醒一句:小米 6 月发布的 MiMo-Code 是终端编码助手,与本次的 MiMo-V2.6 是两条产品线,搜索资料时别混淆。

回到开头的问题:6 天 RL 换 46 分,这笔账划算吗。MiMo-V2.6 的发布逻辑可以概括成一句话——用 6 天的 Live RL 和 75 万条轨迹证明,开源模型在 Agentic 能力上第一次摸到了闭源的门槛。46 分追不上 Fable 5.1 和 GPT-6 Astra,但差距第一次被压缩到「看起来可以用方法弥补」的程度,而方法本身是公开的:权重、数据、代码、配方都在 Hugging Face 和 GitHub 上。接下来轮到社区验证。开源第一是不是实至名归,答案不在发布页,在复现仓的提交记录里。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-27

相关文章

前沿热点

Qwen3.8-Omni-Flash:从理解到交付的全模态分水岭

据 ai-bot.cn 2026-09-18 收录,阿里千问发布新一代原生全模态模型 Qwen3.8-Omni-Flash:文本/图像/音频/视频输入加 1M 长上下文,主打"从理解到交付"的 Agent 能力,端到端跑通会议纪要、短剧翻译、电影解说等工作流。与 Gemini 3.8 Flash 的对比如实呈现胜三败三:AliMeeting DER 3.4 对 72.6 与 WildClawBench-MM 71.0 对 58.9 大幅胜出,OmniVideoBench、LVOmniBench、FLEURS WER 三项仍落后;API 音频输入降价超 98%、音视频降超 93%,音频成本门槛被打到地板。配套开源 Qwen-MM-Plugins,模型加工具链协同演进。

2026年9月19日7 分钟阅读
前沿热点

「牛来」真身揭晓:智谱开源 GLM-5.3-Flash,追平 Claude Opus 4.8 只花四十分之一价钱

匿名模型 Ox-Alpha 8 月 20 日空降 OpenRouter,首日调用量登顶并终结 DeepSeek 56 天霸榜;8 月 26 日晚智谱官宣揭晓:它就是开源的 GLM-5.3-Flash(320B-A18B)。GLM-5 系列首个原生多模态模型(视频/图像/文本/文件输入),稀疏+线性注意力混合架构让注意力计算量降 3 倍、KV 缓存缩小 4.4 倍;Artificial Analysis 综合智能指数 57 分追平 Claude Opus 4.8,定价(输入 0.8/输出 2.8 元每百万 token)约为其四十分之一,全部流量跑在 10 万张国产算力卡上,权重以 MIT 协议开放。一个转折要记住:缓存命中 0.23 元反而高于 DeepSeek V4-Flash 闲时的 0.05 元,缓存命中率超九成的编程 Agent 先算账再换。

2026年8月27日6 分钟阅读