9 月 21 日晚,小米把 MiMo-V2.6 系列整套放上了 Hugging Face 和 ModelScope,许可证是 MIT,下载不需要申请。第二天国内外媒体跟进,最抓眼球的是 Artificial Analysis 智能指数上的那个数字:46.32,开源权重模型里的第一。
但真正让这件事值得单独写一篇的,不是分数,是小米顺手把训练过程也公开了——六天强化学习,账单、吞吐、重启记录实时挂在看板上,连”某位专家压力太大导致显存爆了”这种话都没删。
先看清楚发了什么
MiMo-V2.6 不是单模型,是一个三件套,全部原生全模态(文本、图片、视频、音频进,文本出):
- MiMo-V2.6-Pro:旗舰。1.02 万亿总参数、每 token 激活 42B,384 个路由专家里每次点亮 8 个,70 层混合滑动窗口与全局注意力,另有独立视觉塔和音频编码器,上下文 1,048,576 token。
- MiMo-V2.6-Flash:轻量版。3090 亿总参数、激活 15B,主打高并发场景。
- MiMo-V2.6-Pro-UltraSpeed:同一个模型的加速服务版本,官方口径是同等质量下输出速度快约 20 倍,价格约为 10 倍。
权重挂在 Hugging Face 的 XiaomiMiMo 组织下,Pro-RL 与 Flash-RL 都标着 MIT,可商用、可微调、可再分发。小米还顺手放了一个 MiMo-V2.6-Distill-Qwen-9B,是在 Qwen3.5-9B 上用自家数据蒸出来的 9.4B 小模型,摆明了是给单卡用户留的口子。托管渠道包括小米 AI Studio、MiMo Code、MiMo Desktop、MiMo API 平台和 OpenRouter。
这一步放在国产模型的时间线上看并不意外。9 月 12 日 DeepSeek V4.1 Flash 把长任务的单位成本往下压,9 月 20 日 Qwen3.8-Omni-Flash 把音视频输入价格打到原来的几十分之一,9 月 22 日 阶跃星辰 Step 5 Preview 开放——国产阵营最近一个月的主线就是一句话:把能力做上去的同时,把每块钱买到多少智能做上去。小米这次补的是最缺的一块:开源权重里真正能进第一梯队的旗舰。
跑分:开源第一,但别急着喊”追平闭源”
Artificial Analysis 智能指数 v4.3 上,Pro 拿 46.32,压过智谱 GLM-5.3 的 45 和月之暗面 Kimi K3 的 44,是开源权重里的头名。同一天发布的 Grok 4.7 官方口径是 46,两者基本站在同一格台阶上。
真正扎心的是价签:Pro 每百万输入 token 0.435 美元、输出 0.87 美元,Grok 4.7 是 2 美元和 6 美元。也就是说第三方榜单上差不多的分数,价格差了大约四到六倍。Artificial Analysis 自己算过一笔账,跑完它那套完整评测花 206.66 美元,单题成本约 0.13 美元——这个数字大概比分数更会让采购的人坐直。
再看厂商自己的对比表,就得泼点冷水了。在 DeepSWE v1.1 这个软件工程基准上,Pro 报 71.9,而 DeepSeek V4.1 Flash 是 74.2、Claude Opus 5 是 74.0、GPT-6 Astra 是 74.0——开源第一,但仍然没有翻过闭源那道墙。GDPval 2.1 上 Pro 拿 1673,也低于 Claude Fable 5.1 的 1735 和 Opus 5 的 1708。小米”在多数 agent 基准上与 Opus 5、GPT-5.6 Sol 相当”的说法,严格讲只在自己的部分表格里成立。
还有两个容易忽略的空白:小米没有公布任何自托管的硬件配置要求,1.02 万亿参数的稀疏 MoE 想自己跑起来,机房里得先有对应的家当;UltraSpeed 那个”快 20 倍”也没有第三方实测数据,目前只有独立测速显示 Pro 走官方 API 约 130 输出 token / 秒。
最值钱的其实是那份训练日志
这次发布里最有分量的一件事,是小米把生成这批模型的强化学习训练直接直播了六天。看板实时挂着步数、花费、token 消耗和故障通告,跑完的账是这样的:
- Pro:9 月 15 日 10:32 开跑,30 步,花费 2,620,670 美元,每步约 3.43B token,合计约 75B;
- Flash:9 月 15 日 15:16 开跑,30 步,花费 854,044 美元,每步约 3.7B token,合计约 81.4B;
- 两条跑道各约 75 万条轨迹,合计账单接近 347 万美元。
更少见的是它没把难看的记录删掉。看板上留着的原文大意包括:Pro 因为专家负载不均导致 GPU 显存溢出,在第 17 步重启,并调整了训练并行策略;训练集群和评分器之间出现网络问题,重启并从后续 Pro 训练中移除了 cyber 数据集,因为 rollout 日志里出现了不良模式;还有一条节点显存问题导致的重启。Flash 那边更实在——某个数据集的基础设施错误约三小时没被检测出来,最后从第 15 步重跑。
把这几行日志和”开源权重”放在一起看,意思就清楚了:小米真正的卖点不是给了你一个万亿参数模型,而是把 agent 强化学习这套又贵又容易翻车的基础设施,连同它的失败方式一起交了出来。奖励变化也能对上——Flash 在训练任务上相对通过率约 +25%,DeepSWE v1.1 从 48.8 升到 65.68;Pro 约 +12%,DeepSWE v1.1 从 58.4 升到 72.57。
这对个人开发者的直接价值有限,但对想自建 RL 流程的团队是实打实的教材。对比之下也能看出量级:业内常被引用的 DeepSeek-R1 强化学习阶段花费约 29.4 万美元、MiniMax-M1 约 53.5 万美元,小米这次两条跑道加起来 347 万美元,是真正的”工业级开销”被摆上了台面。这条线索和 9 月 15 日智谱把六成融资投向完全自训练闭环说的是同一件事:竞争正在从”谁模型大”转向”谁能把自我改进的流水线跑通、并且算得清账”。
老达点评
第一,公开失败日志比公开权重更有信息量。 现在的开源发布大多给三样东西:权重、技术报告、跑分表。技术报告里写的都是收敛曲线,没人写自己第 17 步因为专家负载不均炸了显存。小米把 OOM、集群间网络问题、三小时没发现的脏数据都留着,等于免费给同行发了一份”RL 训练会死在哪”的清单。这种透明度短期内不涨分,长期能建立起别人替代不了的信任。
第二,开源权重和能自托管是两件事。 1.02 万亿参数加 1M 上下文,MIT 协议确实是真开放,但没给硬件指引意味着绝大多数人只能在自家 API 或 OpenRouter 上调用。所以对普通开发者,实际可比较的是 0.435/0.87 这个价签,而不是”可以本地部署”的想象。别被许可证的开放度迷惑,要看你能不能真的把它跑在你的机器上。
第三,1M 上下文加全模态,最先跑通的场景未必是编程。 长上下文加音视频输入这个组合,最先产生价值的往往是文档密集的长尾活儿——长会记录音转写加摘要、监控视频里找特定事件、几十份合同的一次性对比。想试的话建议按这个顺序:先拿一个”必须看完两份小时级材料才能回答”的真实问题去测;再要一份两小时视频的时间戳定位,看它能不能指到具体位置;最后才上编程 agent 场景。编程基准上它毕竟还差闭源一线。
想看这批模型在国产阵营里的位置,可以参考 AI 编程工具专题里对编程模型的横向整理;如果你更关心怎么把这类模型接进自己的自动化流水线,AI 智能体与自动化专题里的思路更对口。价格与成本这条线,前面几篇腾讯混元 Hy4 开源、Cognition SWE-2 的成本账可以连着一起看。