实战 SOP
实战 SOP

MiMo-V2.6接入实操:三条路线从桌面端到RL训练

把 MiMo-V2.6 接进工作流的三条路线实操 SOP,按门槛递进:①MiMo Desktop 客户端(下载安装、登录订阅或自配 API Key、模型列表切 MiMo-V2.6-Pro/Flash、UltraSpeed 超高速场景、截图反馈迭代);②MiMo 开放平台 API(建应用取 Key、传模型名/消息/工具与多模态输入、Agent 任务接环境日志/测试通过率/截图/验证器反馈形成执行-检查-修正闭环、先小流量灰度验证价格延迟成功率);③本地权重(HF 集合 collections/XiaomiMiMo/mimo-v26 下载,参数量未公布、硬件门槛以模型卡为准;进阶复现 RL 训练走 XiaomiMiMo/verl 的五套环境脚本)。附常见坑速查表与上线前自查清单;API 定价以开放平台文档为准。

发布于 2026年9月27日10 分钟阅读
<!-- mimo-v2-6-integration-sop | sop | MiMo-V2.6接入实操:三条路线从桌面端到RL训练 -->

小米在 2026 年 9 月 22 日发布并开源了全模态模型系列 MiMo-V2.6,包含 Pro 与 Flash 两个原生全模态模型,参数量未公布。按官方口径(经 AI 工具集转述),Pro 在 AA 综合智能指数上拿到 46 分,超过 Kimi K3 与 Qwen3.8 Max,成为当前最强的开源模型;与闭源的 Claude Fable 5.1 和 GPT-6 Astra 相比仍有差距,但已进入可用区间。能力域覆盖软件工程(DeepSWE v1.1 样本外明显提升)、3D 游戏场景生成、Blender 建模、机械臂闭环控制、Computer Use、科研(材料筛选干实验与 Lean 4 形式化证明),以及前端、PPT、SVG、视频、音乐等内容创作。

这份成绩单背后是大规模 Agentic RL:约 6 天 Live RL、约 75 万条轨迹、训练上下文 1M、单步更新推到 2.7 至 3.7B token、大 Batch 配全异步架构。稳定性上同样下了功夫:冻结 MoE Router 抑制专家负载漂移,用组内相对比较给长程任务细粒度奖励,再以奖励设计、对抗评测、异常检测、验证器交叉校验四件套压制 Reward Hacking。

对大多数读者来说,这些是背景板,真正的问题是:怎么把它接进自己的工作流。这篇 SOP 把接入路径拆成三条路线,按门槛递进,你可以直接对号入座。发布背景与训练细节的全景复盘,见站内的发布热点篇,本文只谈动手。动手前还要记住一条产品线边界:MiMo-Code 是小米此前发布的终端编码助手,属于另一个产品(专文在此),别和 MiMo-V2.6 混为一谈。

选型决策:三条路线对号入座

路线适合谁门槛成本结构可控性
MiMo Desktop 客户端个人用户、轻量日常任务最低,下载安装即用订阅或自配 Key低,界面内配置
开放平台 API开发者、要接进产品的团队中,需要写代码按 token 计费,以开放平台文档为准中,参数与工具自选
本地权重有算力的团队、想复现 RL 的研究者最高显卡与运维成本最高,权重在手

选型口诀很简单:只想要一个好用的 AI 助手,走路线一;要把模型能力嵌进自家产品或 Agent 系统,走路线二;要求数据不出门、要微调、要复现训练配方,走路线三。三条路线不互斥,很多团队会一和二并行,三作为兜底方案。

路线一:MiMo Desktop,十分钟上手的最低门槛

这是官方给出的最短路径,客户端覆盖 macOS 与 Windows 两大平台,整个流程可以拆成五步:

  1. 下载安装。从官方渠道下载对应系统的客户端,常规方式安装,没有特殊依赖。
  2. 账号接入。两种方式二选一:直接登录账号走订阅,这是个人用户最省事的路;或者已有开放平台 API Key 的话,在设置里自配 Key,适合已有企业账号的团队。
  3. 切换模型。在模型列表里切 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash。经验法则是:复杂推理、软件工程、长程 Agent 任务交给 Pro;高频轻量任务、草稿与润色交给 Flash。两个模型都留在列表里按需切换,成本与质量可以兼顾。
  4. 打开 UltraSpeed 超高速模式。适合对响应速度敏感的场景,比如边聊边改的脑暴、快速迭代前端页面。它用部分生成精细度换更短的等待时间,赶进度时非常顺手。
  5. 自然语言派活加截图反馈迭代。任务用大白话描述清楚,遇到界面类或视觉类任务直接贴截图,让模型看着图改。这是全模态模型相对纯文本模型最明显的体验差异:你不需要把界面翻译成文字,一张截图就是最精确的需求描述。

桌面端适合的典型场景清单:日常问答与写作润色、前端页面生成与迭代、PPT 与 SVG 素材产出、看图改稿、Blender 建模辅助。举一个典型的迭代回合:你说出这个登录页要做成深色系,模型生成第一版;你截图圈出按钮间距不对,模型看着截图改第二版;你再截一次图确认效果,三轮搞定。整个过程零代码,也不需要写任何提示词模板,会打字描述加截图就能用。

如果你的需求都在这个清单里,路线一就够了,后面两节可以跳过。但如果有两类诉求之一,就该往下走:一是要把模型能力嵌进自己的产品或系统,二是要批量自动化处理任务。这两类需求,API 才是对的工具。

路线二:开放平台 API,把模型接进生产

这条路线是开发者的主战场,核心动作是建应用、拿 Key、调接口、上灰度,四步走完。

第一步,建应用拿 Key。到 MiMo 开放平台注册并创建应用,拿到 API Key。密钥管理走老规矩:不进代码仓库、不进日志、按环境隔离、定期轮换,泄露立即吊销。

第二步,按文档组装请求。请求体至少包含模型名与消息数组;需要工具调用就带上工具定义,多模态输入按文档要求的格式传图片等内容。字段名与格式细节以开放平台文档为准,这里只给一个纯示意骨架:

json
{
  "model": "mimo-v2.6-pro 或 flash,以文档为准",
  "messages": [
    { "role": "user", "content": "文本内容,或含图片的多模态内容" }
  ],
  "tools": "需要工具调用时按文档定义"
}

第三步,如果接的是 Agent 任务,闭环设计比模型选择更重要。MiMo-V2.6 的训练方式决定了它天然适合执行、检查、修正的循环,你要做的就是把检查环节的信号喂回去:

反馈信号用在什么任务怎么喂
环境日志命令执行、部署类任务失败日志原文回传,别只回传报错摘要
测试通过率软件工程类任务跑完测试把通过与失败的用例一起回传
截图前端、界面、设计类任务渲染结果截图回传,让模型对照需求自查
验证器反馈有明确验收标准的任务把验证器输出结构化后回传

闭环设计有三个要点:一是检查信号要客观,能用测试和验证器就不要依赖人眼;二是修正轮次要设上限,防止死循环烧钱;三是每轮完整轨迹要落库,它既是你排查问题的依据,也是日后做评测集的原料。评测体系怎么搭,站内的 Agent 评测 SOP 有完整方法。

这套执行、检查、修正的循环,正是 MiMo-V2.6 训练时跑过的东西:它就是在约 75 万条这样的轨迹里被强化出来的,所以把同构的信号喂回去,相当于让模型回到自己最熟悉的任务形态上,发挥通常会更稳。反过来说,如果你的任务没有任何客观检查信号,只有主观感受,那 Agent 闭环的收益会打折扣,先用纯对话方式把任务跑顺再说。

第四步,灰度验证。不要直接上生产。先拿小流量验证三件事:价格是否符合预期(API 定价以开放平台文档为准)、延迟是否在业务容忍范围内、成功率是否达标。三项都稳了再逐步放量。性价比方面,文章口径是同智能水平价格约为海外模型的二十分之一到六十分之一,且 API 价格维持不变,但具体到你的账单,还是以实际计量为准。

路线三:本地权重与 RL 复现

权重在 Hugging Face 的 XiaomiMiMo 集合(collections/XiaomiMiMo/mimo-v26)下开放下载。这里必须强调纪律:参数量官方未公布,硬件门槛与显存要求以模型卡为准,本篇不编数字。动手前先去模型卡把显存需求、量化版本、许可证看清楚,再评估自己的算力。想横向比较各部署方案,可以参考站内的本地部署对比篇。

进阶路线:如果你想复现训练配方,小米在 GitHub 上开源了 XiaomiMiMo/verl。先明确它的性质:这是一个 fork,基于字节跳动系开源的 verl(即 HybridFlow,原仓 23650 星)的 0.9.0.dev 版本,在其上增加了五套 Agentic RL 环境的复现代码,并非小米原创框架:

领域任务族验证器启动脚本
Code软件工程可执行测试scripts/code/train.sh
Cyber漏洞复现规则检查scripts/arvo/arvo.sh
General知识工作Rubric 评审scripts/general/general.sh
Visual网页开发视觉评分scripts/design/webdev.sh
Music符号音乐作曲规则检查scripts/design/music.sh

配套资源一览:训练数据集在 HF 的 MiMo-V2.6-RL-oss 开放下载;训练模型为 MiMo-V2.6-Distill-Qwen-9B;官方提供 Docker 镜像;技术报告 PDF 放在 HF 的 MiMo-V2.6-Pro-RL 仓,训练配方在第 7 节。

仓库使用细节上,每个启动脚本都会读取同目录下对应 env.example 里的变量,启动前先按示例把环境变量配好。Code、Cyber、General、Visual 四套环境通过 third_party 目录下的两个子模块驱动:mimoagent 负责外壳、工具、执行环境与评分器,它是 mini-swe-agent 的 fork,采用 MIT 许可;uni-agent 负责模型网关与轨迹采集,采用 Apache-2.0 许可。两个子模块互不依赖,胶水代码在 recipes 目录里,Music 一套都不用;子模块用 git submodule 命令初始化。许可证为 Apache-2.0,以仓库 LICENSE 文件为最终口径。想看这套仓库的完整拆解,见站内的 verl 资源篇。

复现 RL 的门槛提示:这套东西是给有分布式训练经验的团队准备的,多机多卡、环境镜像、验证器搭建一个都少不了。没有 GPU 集群又想学 RL 工程化,先把数据集和技术报告第 7 节读透,比硬上训练划算。想系统性比较各 RL 框架,看站内的框架横评篇;只想做通用微调不碰 RL,走通用微调 SOP 更合适。

最后补一句本地化路线的适用边界:如果你的动机只是「数据不出门」,先算一笔账,本地部署的显卡采购、电力、运维与人力成本,很多时候高于直接调 API 加私有化协议的钱;只有数据敏感度高到协议兜不住、或者你要基于开源权重做自己的训练,本地才是正解。

常见坑速查表

坑典型现象解法
产品混淆把 MiMo-Code 当成 MiMo-V2.6 的使用入口前者是终端编码助手,后者是全模态模型系列,认准发布线
模型选错简单任务也用 Pro,账单超预算高频轻任务切 Flash,Pro 留给硬任务
密钥泄露Key 硬编码进仓库或打进日志环境变量加密钥管理服务,泄露立即吊销轮换
灰度缺失直接全量上生产,延迟与费用双爆小流量验证价格、延迟、成功率三件套再放量
Agent 死循环修正轮次无上限,token 消耗失控设最大轮次与预算熔断线
忽视许可证以为开源等于随便商用以模型卡与仓库 LICENSE 原文为最终口径

上线前自查清单

  • 模型版本确定:Pro 还是 Flash,切换策略写进文档
  • API Key 管理到位:不入库、按环境隔离、可轮换
  • 请求参数以开放平台文档为准,没有凭记忆硬编码的字段
  • Agent 闭环有客观检查信号,修正轮次有上限
  • 灰度完成:价格、延迟、成功率三项小流量验证通过
  • 多模态输入格式按文档校验,截图回传链路跑通
  • 本地部署的话,显存需求以模型卡为准且留有余量
  • 许可证合规确认:以模型卡与 LICENSE 原文为准
  • 轨迹与日志落库,可回溯可评测

常见问题

Q1: MiMo-V2.6 的参数量是多少,我的显卡跑得动吗?

A1: 官方未公布参数量,任何具体数字都不可信。硬件门槛与显存要求以 Hugging Face 模型卡为准,动手前先查模型卡,必要时选量化版本降低需求。

Q2: Pro 和 Flash 怎么选,日常全上 Pro 行不行?

A2: 行但没必要。Pro 的收益集中在复杂推理、软件工程和长程 Agent 任务上,高频轻量任务用 Flash 在速度与成本上都更划算。建议两个模型都留在列表里按需切换。

Q3: API 怎么收费,和海外模型比贵吗?

A3: 具体定价以开放平台文档为准。文章口径称同智能水平价格约为海外模型的二十分之一到六十分之一,且 API 价格维持不变,实际费用以你的调用量与账单为准。

Q4: 想复现它的 RL 训练,需要什么条件?

A4: 需要 GPU 集群与分布式训练经验。小米开源的 XiaomiMiMo/verl 提供五套环境的复现脚本,配套训练数据集、Docker 镜像与技术报告第 7 节的训练配方,缺一环都会卡住。

Q5: 它和 MiMo-Code 是什么关系?

A5: 没有直接关系。MiMo-Code 是小米此前发布的终端编码助手,MiMo-V2.6 是全模态模型系列,产品线不同,接入路径也不同,选型时不要混为一谈。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-27

常见问题

MiMo-V2.6 的参数量是多少,我的显卡跑得动吗?
官方未公布参数量,任何具体数字都不可信。硬件门槛与显存要求以 Hugging Face 模型卡为准,动手前先查模型卡,必要时选量化版本降低需求。
Pro 和 Flash 怎么选,日常全上 Pro 行不行?
行但没必要。Pro 的收益集中在复杂推理、软件工程和长程 Agent 任务上,高频轻量任务用 Flash 在速度与成本上都更划算。建议两个模型都留在列表里按需切换。
API 怎么收费,和海外模型比贵吗?
具体定价以开放平台文档为准。文章口径称同智能水平价格约为海外模型的二十分之一到六十分之一,且 API 价格维持不变,实际费用以你的调用量与账单为准。
想复现它的 RL 训练,需要什么条件?
需要 GPU 集群与分布式训练经验。小米开源的 XiaomiMiMo/verl 提供五套环境的复现脚本,配套训练数据集、Docker 镜像与技术报告第 7 节的训练配方,缺一环都会卡住。
它和 MiMo-Code 是什么关系?
没有直接关系。MiMo-Code 是小米此前发布的终端编码助手,MiMo-V2.6 是全模态模型系列,产品线不同,接入路径也不同,选型时不要混为一谈。

相关文章

实战 SOP

LLaDA-Image 本地部署 SOP:五步跑通 6B 生图模型

把蚂蚁开源 6B 生图模型 LLaDA-Image 跑起来的五步 SOP:①环境准备(依赖与国内镜像加速下载);②四档权重怎么选(Base 50 步 / Turbo 4 步 × BF16 / FP8,国内走 ModelScope);③跑通第一张图(Base 与 Turbo 最小可用命令);④进阶(参考图编辑、文字渲染、ComfyUI 接入、显存不足时的降级策略);⑤生产化(批量队列、并发容量规划、成本监控、结果入库与故障降级)。含 6 条踩坑与 10 项上线自检清单,命令逐字取自官方 README;仓库 license 为 null,商用前须确权。

2026年9月9日11 分钟阅读
实战 SOP

一行改模型名省一半钱:GPT-6 Sol/Luna 迁移 SOP

把 GPT-5.6 存量调用迁到 GPT-6 Sol/Luna 的实操 SOP:OpenAI 兼容访问下改模型名(gpt-6-sol / gpt-6-luna)大概率就能跑通,但只换名字拿不到迁移价值的另一半——须重构缓存结构(稳定前缀前置、显式断点包住不变区)才能吃满 90% 缓存折扣,并按单轮难度分配推理强度(简单步骤 low、关键步骤 high),依托中途调档不破坏缓存的官方口径实现「能省则省、该花才花」。含回归对比压测步骤、Free/Go 账号只能用 Luna 的可用性红线、以及 Luna/Sol 按任务难度划界的决策方法。步骤中的请求字段与 effort 取值以官方文档为最终口径。

2026年9月27日10 分钟阅读