收藏、记忆、苹果核上线了看看 →
LuoLuoLuoLuo Wiki

小米 MiMo-V2.6 发布:万亿参数全模态开源,价格不涨,还多了个快 20 倍的 UltraSpeed

2026-09-22 发布并开源。Pro 1.02T 总参 / 42B 激活、Flash 309B / 15B,都是 1M 上下文、128K 输出,权重 MIT 协议;Pro 每百万 token 输入 ¥3、输出 ¥6,与 V2.5 同价;09-27 放出修复工具调用重复的 MOPD 版权重。本站洛洛 AI 能选 MiMo V2.6 Pro

核对于 2026-09-29

按 2026-09-29 的状态整理。规格、架构和评测来自 Hugging Face 模型卡与技术报告,价格、限流和上下架来自小米 MiMo 开放平台的模型页、价格页和更新日志,强化学习成本和 Artificial Analysis 分数来自官方发布博客,09-27 的补丁来自官方技术博客和 MOPD 模型卡。页末附全部来源。

hihi!洛洛来了!

洛洛认真看小米的模型,起因很朴素:本站 9 月 24 日把它加进了洛洛 AI 的模型列表,每问只要 1 核。自家菜单上多了一道菜,洛洛总得知道它是什么做的吧。

结果一翻,发现这道菜连菜谱带账单一起公开了:权重、技术报告、训练环境、强化学习代码全开源,连强化学习花了多少钱都写出来了,Pro 大约 262 万美元。洛洛看到这个数字的第一反应是:原来训练模型的账单是可以摊开给大家看的吗?

更离谱的是,发布才五天,小米又自己写了一篇博客,承认模型有个毛病,顺便把修这个毛病花了多少钱也写上了。下面的数字全是官方口径,洛洛只在旁边写了点读后感。

洛洛碎碎念

小米博客里形容这个毛病的原话是:模型不停发出相同的工具调用,「看起来很忙,其实没有进展」。

洛洛读到这句的时候有被冒犯到。这不就是洛洛期末周的样子吗,桌面上开了八个文档,一个字都没写。

一句话总结

赶时间的话,看完这一段就够了。

小米在 2026-09-22 发布并开源 MiMo-V2.6 系列:旗舰 MiMo-V2.6-Pro(1.02T 总参 / 42B 激活)和性价比款 MiMo-V2.6-Flash(309B / 15B),两个都是原生全模态(文本、图片、视频、音频输入,文本输出),1M 上下文、最大输出 128K,权重用 MIT 协议。另有一个只在自家 API 和 MiMo Desktop 提供的 MiMo-V2.6-Pro-UltraSpeed,官方说输出最高快 20 倍,价格是 Pro 的 10 倍。Pro 和 Flash 的 API 价格与 V2.5 相同,Pro 是输入 ¥3、输出 ¥6 每百万 token。官方称 Pro 在 Artificial Analysis 智能指数 v4.3 上拿到 46.32,是发布时最强的开源模型。这一代的重点是把强化学习做大,技术报告、训练环境和强化学习代码一起开源。发布后发现的「工具调用重复」问题,09-25 起在 API 上修掉,09-27 放出对应的 MOPD 版权重。

时间线

日期事件
2026-03-18mimo-v2-pro 发布:1T 总参 / 42B 激活,1M 上下文
2026-04-23V2.5 系列发布:mimo-v2.5-pro(1T / 42B)和原生全模态的 mimo-v2.5
2026-09-22MiMo-V2.6 系列发布:Pro、Flash、Pro-UltraSpeed 三款上线开放平台;Pro-RL、Flash-RL 权重和技术报告上 Hugging Face,同时开源 9B 蒸馏小模型 MiMo-V2.6-Distill-Qwen-9B;MiMo Desktop 结束内测、发布正式版
2026-09-24本站洛洛 AI 加入 MiMo V2.6 Pro(经 ZenMux 调用,每问 1 核)
2026-09-25 06:00API 上的 mimo-v2.6-pro、mimo-v2.6-flash 换成修复工具调用重复的新版本,模型名不变(北京时间,据 09-27 技术博客)
2026-09-27官方发技术博客复盘工具调用重复,开源 MiMo-V2.6-Pro-MOPD、MiMo-V2.6-Flash-MOPD 权重,并给所有 MiMo Desktop 用户重置当前周期剩余额度
2026-10-21 10:00mimo-v2.5-pro、mimo-v2.5 计划正式下线(北京时间,价格页公告)

关键数字

这张表来自 Hugging Face 模型卡、技术报告和开放平台模型页。洛洛看得最认真的是「预训练数据」那一行,后面单独说。

项目MiMo-V2.6-ProMiMo-V2.6-Flash
总参数 / 激活参数1.02T / 42B309B / 15B(技术报告写 310B)
层数(总 / 滑动窗口 / 全局注意力)70 / 60 / 1048 / 39 / 9
隐层维度61444096
路由专家(总数 / 每 token 激活)384 / 8256 / 8
滑动窗口大小128128
上下文 / 最大输出1M / 128K tokens1M / 128K tokens
输入 / 输出模态文本、图片、视频、音频 / 文本文本、图片、视频、音频 / 文本
预训练数据30T tokens(纯文本 27T + 全模态 3T)48T tokens(纯文本 26T + 全模态 22T)
视觉 / 音频编码器681M MiMo-ViT;308M 音频 tokenizer + 127M 音频 patch 编码器同 Pro
投机解码5 层 MTP 草稿模块,一次预测后面 7 个 token同 Pro
强化学习花费(官方博客)约 $2.62M约 $0.85M
权重许可MITMIT
API 限流100 RPM / 10M TPM100 RPM / 10M TPM

UltraSpeed 在模型列表里同样是 1M 上下文、128K 最大输出,限流写的是「定制服务,请联系我们」,也就是说 API 要找小米开通,不是注册就能直接调。

洛洛盯着预训练那一行看了好久:小的 Flash 反而读了更多数据,而且多出来的主要是全模态数据(22T 对 3T)。技术报告只给了数字,没解释为什么这么分,洛洛也不敢瞎猜。

另外,上一代在官方模型列表里,只有 mimo-v2.5 标了「全模态理解」,mimo-v2.5-pro 没标。这一代 Pro 和 Flash 都是全模态,旗舰终于也能看视频、听音频了。

架构

这一节洛洛只敢照搬报告,再在旁边写一句自己的土办法理解。

  • 混合注意力:大部分层用只看附近 128 个 token 的滑动窗口注意力,隔几层插一层看全文的全局注意力。Pro 的 70 层里 60 层是滑动窗口、10 层是全局。第一层是全局注意力加稠密前馈网络,其余层都是不带共享专家的稀疏 MoE。洛洛的理解是:像考试时大部分时间只盯着眼前这道题,隔一阵翻回去看一眼题目要求,省力又不跑偏
  • 全模态编码器:图片和视频走 681M 参数的 MiMo-ViT(28 层,24 层滑动窗口加 4 层全局);音频先经 308M 参数的音频 tokenizer(用 2000 万小时音频训练),再由 127M 的 patch 编码器把 25Hz 压到 6.25Hz,最后和文字排进同一个序列
  • 投机解码:5 层的 MTP 草稿模块(DFlash 式),一次前向猜后面 7 个 token,再交给主干并行验证
  • 预训练和中训练:预训练从 32K 上下文开始,中途扩到 256K;中训练先在 256K 上花掉大部分算力,最后一段扩到 1M。中训练把隐藏层权重的优化器从 AdamW 换成 Muon 的变体 Muown,同时做了 MXFP4 量化感知训练

强化学习是这一代的主角。 报告标题就叫《Scaling Reinforcement Learning Towards Self-Improvement》,小米自己的说法是「You Only RL Once」:

  • 一次跑完所有领域:编程、通用 agent、视觉、网络安全的任务混在同一次强化学习里,多种 agent 框架(harness)也混在同一批,而不是每个领域单独训一遍
  • 批次很大:每步 1,568 个题目、每题 16 条轨迹,每步几十亿 token(博客写 35 亿到 37 亿,技术报告写 27 亿到 37 亿),上下文最长 1M
  • 便宜且快:两个模型各跑 30 步、约 75 万条轨迹,都不到 6 天。Pro 约 262 万美元,Flash 约 85 万美元(技术报告四舍五入写成 $2.6M 和 $0.9M)
  • 边训边涨:留出的 DeepSWE v1.1 上,Pro 从 58.4 涨到 72.57,Flash 从 48.8 涨到 65.68(博客口径)
  • 打分也加算力:光看测试过没过,分不出「过了但写得烂」和「过了且写得好」。小米让评分 agent 在同一组答案里互相比较,把更好的解法往前排,顺带鼓励更短的路径、更少的 token
  • 稳住训练:冻结 MoE 路由器防止训练漂移,并从奖励设计、对抗评估、异常检测、多个验证器交叉检查几层防奖励作弊

强化学习之后还有一步 MOPD2(多前缀、多教师的在线策略蒸馏):把不同领域的教师模型合进一个学生模型,专门补长程游戏开发、科研、具身智能这类「很难写出可靠评分器」的领域。

开源的不只是权重:技术报告里还放出了强化学习环境(编程、网络安全、知识工作、网页开发四类,共约 7000 个带验证器的训练任务)、一套端到端强化学习框架,以及 9B 的蒸馏小模型 MiMo-V2.6-Distill-Qwen-9B(在 Qwen3.5-9B 上用 MiMo 生成的 774 亿 token 数据做 SFT,MIT 协议),给研究者当起点。

评测

以下摘自 Hugging Face 模型卡(与技术报告 Table 3 一致),全部是小米自测。对比模型按原表:Claude Opus 5、GPT-5.6 Sol、Claude Fable 5,每行最高分加粗,「-」表示原表没有这项。

基准V2.6 ProV2.6 FlashV2.5 ProClaude Opus 5GPT-5.6 SolClaude Fable 5
DeepSWE v1.171.967.919.074.073.070.0
ProgramBench26.526.012.537.025.033.0
AutomationBench v1.0.653.152.316.050.345.846.2
Toolathlon-Verified76.973.649.180.674.977.9
GDPval-AA 2.1(Elo)1673-1107170815881595
Agents' Last Exam31.627.613.231.630.825.7
Terminal Bench 4.034.928.81.549.039.942.4
Terminal Bench 2.189.987.665.289.188.884.3
OSWorld-Verified82.080.8-83.483.086.0
JobBench62.061.225.065.745.457.4
CyberGym94.095.140.0---
ExploitBench47.925.316.670.078.578.0
SEC Bench Pro66.347.517.7-79.1-
MiMo Visual Coding(自家基准)72.371.5-70.073.469.1

怎么读这张表:

  • 比上一代涨得吓人:DeepSWE 从 V2.5 Pro 的 19.0 到 71.9,Terminal Bench 4.0 从 1.5 到 34.9。洛洛第一眼以为 V2.5 那列是印错了
  • 日常 agent 活已经贴着闭源旗舰:AutomationBench、Terminal Bench 2.1、Agents' Last Exam 与 Opus 5 持平或略高
  • 越难的越明显落后:Terminal Bench 4.0(34.9 对 Opus 5 的 49.0)、ProgramBench、漏洞利用类(ExploitBench 47.9 对 70 到 78.5)差距都很大
  • Flash 很能打:编程和通用 agent 类大多只比 Pro 低 1 到 4 分(Terminal Bench 4.0 差 6 分),价格却只有 Pro 的三分之一;差距大的是漏洞利用类,ExploitBench 只有 25.3
  • 对比对象是上一代闭源:表里没有 Claude Fable 5.1 和 GPT-6 Astra。官方博客附录倒是加了这两家,还加了 DeepSeek V4.1 Flash,按那张表,DeepSeek V4.1 Flash 在 DeepSWE(74.2)和 Terminal Bench 2.1(90.6)上都比 V2.6 Pro 高一点

几个口径上的提醒:

  • 对比模型凡是能调推理强度的,都按最高档(max)测
  • CyberGym 是小米修正过有缺陷的评测环境后跑的,和别家公布的 CyberGym 分数不一定能直接比
  • MiMo Code Bench、MiMo Cyber Bench、MiMo Visual Coding 是自家内部基准,外面没法复现
  • 博客附录里别家模型的分数和各家自己公布的不完全一致。比如 GPT-6 Astra 的 Terminal-Bench 4.0,博客写 59.6,本站 GPT-6 Astra 时讯 按 OpenAI 发布页转引的是 57.7;DeepSeek V4.1 Flash 的 Terminal Bench 4.0,博客写 26.8,DeepSeek 技术报告写 31.2。拿来对比时,以各家自己的官方数字为准

Artificial Analysis:官方博客称 Pro 在 Artificial Analysis 智能指数 v4.3(2026 年 9 月)上得 46.32,超过 Kimi K3 和 Qwen3.8 Max,是开源模型里的最高分;在「智能对每题成本」的散点图上也落在帕累托前沿。注意这是 v4.3 版指数,别处引用的如果是其他版本的分数,不能直接放在一起比。本站抓取 Artificial Analysis 页面没有成功,这个分数按小米博客的口径照抄。

发布后的补丁:MOPD 版

发布之后,小米发现最影响体验的问题是工具调用重复:在 MiMo Desktop、MiMo Code、OpenCode 这类 agent 场景里,模型有时会一遍遍发出相同或高度相似的工具调用,时间和上下文都耗掉了,任务却没往前推。

  • 有多常见:官方的测量口径是「同一轮里参数完全相同的调用」,这只是下限(不算跨轮重复、参数略有不同的近似重复,也不算在脚本里间接调工具的情况)。按这个口径,修复前 Pro 在 OpenCode 里是 0.54%,Flash 是 1.02%,其他框架在 0.05% 到 0.27% 之间
  • 哪来的:强化学习里本来有一条惩罚,一轮超过 32 次工具调用就判零分。可门槛太松,32 次以下的「狂调」不受罚,训练中被一点点放大
  • 笨办法太贵:把门槛降到 8 次重训,要重跑约 20 步混合强化学习,估算 231 万美元,而且在内部复现集上重复率只从 13.45% 降到 3.83%,治不干净
  • 最后怎么修的:先用内部收集的重复样本训一个专治这个毛病的单轮教师(12 步、约 7000 条样本),再通过 MOPD 蒸馏进主模型。整轮花了约 9 万美元,是笨办法的 4%。官方说修完后各框架、各上下文长度下的重复率都大幅下降,其他基准表现保持稳定,但 MOPD 模型卡没有另给一张新分数表
  • 你要做什么:用 API 的不用改,09-25 06:00 起 mimo-v2.6-pro、mimo-v2.6-flash 背后已经是新版本;自己部署的,换成 09-27 放出的 MiMo-V2.6-Pro-MOPD 或 MiMo-V2.6-Flash-MOPD 权重

洛洛碎碎念

洛洛最佩服的是那句「整轮花了约 9 万美元,是笨办法的 4%」。

修 bug 顺手把账单也公开,还给用户重置了额度道歉。洛洛上次交作业迟到,只会给老师发一个「对不起」的表情包,差距之大,洛洛反省之。

API 与价格

终于到了洛洛百分之百看得懂的部分:多少钱。

官方价格(人民币 / 每百万 token,实时推理,价格页标注更新于 2026-09-22):

模型输入(命中缓存)输入(未命中缓存)输出
mimo-v2.6-pro¥0.025¥3¥6
mimo-v2.6-flash¥0.02¥1¥2
mimo-v2.6-pro-ultraspeed¥0.25¥30¥60

海外美元价(每百万 token):Pro 为 $0.0036 / $0.435 / $0.87,Flash 为 $0.0028 / $0.14 / $0.28,UltraSpeed 为 $0.036 / $4.35 / $8.7,顺序同上表。

几个要注意的点:

  • 和 V2.5 同价:价格页里 v2.6-pro 和 v2.5-pro、v2.6-flash 和 v2.5 分别写在同一行。V2.5 两个模型计划 2026-10-21 10:00 下线,还在用的得迁移
  • UltraSpeed 贵 10 倍:三项单价都正好是 Pro 的 10 倍,官方说质量不变、输出最高快 20 倍,适合实时交互。API 是定制服务要联系小米开通,MiMo Desktop 里也上线了这个模式
  • 批量推理半价:Batch API 下 Pro 是 ¥0.0125 / ¥1.5 / ¥3,Flash 是 ¥0.01 / ¥0.5 / ¥1;UltraSpeed 不支持批量推理
  • 缓存写入限时免费;联网搜索另算,国内 ¥16 / 1000 次,海外 $5 / 1000 次,不含在 token 价里
  • 接入:兼容 OpenAI 和 Anthropic 两种协议,OpenAI 协议的地址是 https://api.xiaomimimo.com/v1;也可以买包月包年的 Token Plan,或在 OpenRouter、AI Studio、MiMo Code、MiMo Desktop 里用

放在一起看:本站写过的 DeepSeek-V4.1-Flash 高峰价是输入 ¥2、输出 ¥8(闲时减半)。MiMo-V2.6-Flash 是 ¥1 / ¥2,Pro 是 ¥3 / ¥6,都在同一个便宜档位里。

价格和限额随时会调整,以官方价格页为准。

对你意味着什么

洛洛按人群分了一下,你对着自己那条看就行。

  • 本站用户:洛洛 AI 的模型选择里,「国产」那组有 MiMo V2.6 Pro,经 ZenMux 调用,每问 1 核,和 Gemini 3.8 Flash、DeepSeek V4 Pro 同属「轻快」档。本站给它设的是推理强度 low、单次回答最多 2048 token;它在 ZenMux 上不支持强制调用工具,所以打开「联网」时是在提示词里要求它先搜。洛洛 AI 目前只能发文字,全模态这项在站内用不上。苹果核截至 2026-09-29 还在试运行,只显示不真扣,计划 10 月 13 日起正式扣,规则见 苹果核规则。另外,本站是 09-24 接入的,当时实测的是修复前的版本;ZenMux 那边是否已切到 09-25 的新版,洛洛从外面没法确认
  • 调 API 的开发者:价格没变,模型名从 v2.5 换成 v2.6 就行,记得赶在 10-21 V2.5 下线前迁完。做 agent 的,之前遇到过「工具调了又调」的情况,可以重新测一遍,09-25 之后已经是新版本了
  • 想自己部署的:权重是 MIT,改、商用、蒸馏都行。但 Pro 是 1.02T,官方给的 SGLang 示例要两个节点;Flash 309B 门槛低一截。只想研究强化学习的,那个 9B 蒸馏模型加开源环境是更现实的起点
  • 需要处理音视频的:Pro 和 Flash 都能直接吃图片、视频、音频,不用再外挂一个语音识别或看图模型。洛洛做小红书视频时最想要的就是这个,把一段素材丢进去让它直接出分镜笔记
  • 对速度敏感的:UltraSpeed 快是快,但单价是 Pro 的 10 倍,而且 API 要单独开通。先想清楚你的场景是真的卡在速度上,还是卡在别的地方

局限

  • 全是厂商自测:对比对象主要是上一代闭源模型,而且在 Terminal Bench 4.0、ProgramBench、漏洞利用这类更难的任务上仍然明显落后
  • 自家基准多:三个 MiMo 自家基准外部没法复现,CyberGym 又是修正过环境后跑的,这几项的分数参考价值要打折扣
  • 工具调用重复:已经修了,但官方的测量口径只是下限,跨轮重复和近似重复都没算进去。长任务上请自己盯一下
  • 数字口径不统一:Flash 参数模型卡写 309B、技术报告写 310B;强化学习成本博客写 $2.62M / $0.85M、报告写 $2.6M / $0.9M;MiMo Cyber Bench 上 Pro 的分数,模型卡写 80.2、博客附录写 81.7
  • 部署门槛高:Pro 的 1.02T 参数不是个人电脑能跑的,UltraSpeed 也不对所有人开放

洛洛写完这篇最大的感受是:这次真正让人记住的不是哪个分数,而是小米把训练花了多少钱、踩了什么坑、补丁又花了多少钱,一笔一笔都写了出来。模型会被超过,但这种把账摊开讲的做法,洛洛希望多一点。

数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯。洛洛先去把期末周那八个文档关掉几个。

参考来源

官方:

本站:

  • 苹果核规则(每问扣几核、试运行与正式扣费时间):/docs/faq/apple-core
  • 本站接入 MiMo V2.6 Pro 的日期(2026-09-24)、推理强度和单次输出上限来自站点配置与维护记录,没有可公开引用的页面

On this page