MiMo-V2.6-Pro 已经正式发布、权重公开,而且以目前的基准成绩来看,价格低得出人意料。但它还不是可以全面替代顶级模型的通用方案。Xiaomi 于 2026 年 9 月 21 日发布了这款开放权重模型;它最适合 Agent 自动化和成本敏感型 API 项目,而本地部署与长时间运行的稳定性,仍然需要谨慎验证。
MiMo-V2.6-Pro 评测:先看结论
| 如果你的需求是…… | 建议 | 原因 |
|---|---|---|
| 低成本 Agent API 实验 | 可以试试 MiMo-V2.6-Pro | Artificial Analysis 列出的价格为每 1M 个输入 token $0.435、每 1M 个输出 token $0.87,Intelligence Index 得分为 46。 |
| 开放权重和多模态输入 | 值得列入候选 | Xiaomi 和独立模型页面均介绍了文本、图像、音频/语音和视频输入能力,并支持 1M token 上下文窗口。 |
| 简单的本地安装 | 不建议从它开始 | OpenLM 的服务示例使用了 16 路张量并行、专家并行,以及用于 SGLang 的双节点配置。 |
| 最复杂的终端或安全任务 | 先用自己的工作负载测试 | 已公布的结果显示,MiMo 在部分 Agent 测试中领先,但在 Terminal Bench 4.0 和 ExploitBench 中落后。 |
| 目前就要运行长时间自主 Agent | 在监控下进行试点 | 早期用户反馈过卡住、输出冗长和动作延迟等问题,而目前公开证据距离发布也只有几个小时。 |
独立的 Artificial Analysis 模型页面显示,该模型得分为 46,输出速度约为每秒 129.7 个 token,并估算每个 Intelligence Index 任务的成本为 $0.13。这些数字适合用来横向比较,但不代表你的提示词或实际供应商一定能达到同样结果。
Xiaomi 在 2026 年 9 月 21 日发布了什么
Xiaomi 的官方 MiMo-V2.6 公告介绍的是一个模型家族,而不是单一检查点。MiMo-V2.6-Pro 是旗舰型号;MiMo-V2.6-Flash 是更小、更强调效率的兄弟型号;此次发布还包含一个基于 Qwen 的 9B 蒸馏模型,用于强化学习研究。
Pro 检查点采用开放权重的稀疏混合专家架构。公开规格显示,它拥有约 1.02 万亿总参数,其中 420 亿参数处于激活状态。官方标称上下文长度为 1 million tokens,并称该模型原生支持文本、图像、视频和音频。
Artificial Analysis 将 Pro 的许可证列为 MIT,并表示其权重可用于自托管。但这并不意味着所有托管 API 或服务配置都完全相同:供应商限制、实现细节和运维成本,仍然需要单独评估。
这次发布的训练方式同样值得关注。Xiaomi 表示,一套混合强化学习流程覆盖了代码、通用 Agent、视觉任务和网络安全。OpenLM 的技术总结记录了 Xiaomi 宣称的训练细节:每步包含 1,568 个提示词、每个提示词执行 16 次 rollout,同时配合分组评分和强化学习后的蒸馏。
MiMo-V2.6-Pro 真正擅长什么
相比纯学术型编程题,MiMo-V2.6-Pro 在 Agent 类任务中的表现更有看点。在 OpenLM 转述的评测表中,Pro 在 AutomationBench 上得分 53.1,高于 Claude Opus 5 的 50.3 和 GPT-5.6 Sol 的 45.8。在 Terminal Bench 2.1 中,它的得分为 89.9,也略高于表中 Claude Opus 5 的 89.1 和 GPT-5.6 Sol 的 88.8。
不过,它并不是在所有测试中都占优。Pro 在 DeepSWE v1.1 上得分 71.9,低于 Claude Opus 5 的 74.0 和 GPT-5.6 Sol 的 73.0。在 MiMo VisualCoding 中,它拿到 72.3,落后于 GPT-5.6 Sol 的 73.4,但高于 Claude Opus 5 的 70.0。
这些结果支持一个更具体的结论:可以把 MiMo-V2.6-Pro 作为工具调用、工作流自动化、视觉编程和成本敏感型软件 Agent 的候选模型。但如果公开的 ProgramBench 得分是 26.5,而 Claude Opus 5 为 37.0,就不能把它描述成所有编程任务上的最佳选择。
Artificial Analysis 还提供了一些比单项基准更贴近实际的信息。其页面显示,该模型输出速度为每秒 129.7 个 token,首 token 延迟为 2.17 秒,并支持 1M token 上下文窗口。Model Picker 的快照则记录了每秒 134 个 token 和 20.8 秒端到端耗时,但同时注明该快照没有记录索引版本。这些数字应被视为特定时间点的测量结果,而不是永久不变的规格。
哪些取舍会改变最终判断
最大的性能风险在于表现不够均衡。在 OpenLM 的表格中,MiMo-V2.6-Pro 在 Terminal Bench 4.0 上得分 34.9,低于 Claude Opus 5 的 49.0、GPT-5.6 Sol 的 39.9 和 Claude Fable 5 的 42.4。在 ExploitBench 上,Pro 得分 47.9,也明显落后于 Claude Opus 5 的 70.0 和 GPT-5.6 Sol 的 78.5。
网络安全测试尤其容易被过度解读。Pro 在 CyberGym 上得分 94.0,但在 ExploitBench 上的分数低得多。单个安全测试套件中的高分,并不能证明模型具备广泛的攻击性安全能力。
早期社区反馈也暴露出了一些基准表无法体现的运维问题。由于模型发布才过去几个小时,最初的 X 讨论规模并不大。一位用户 @nilansaha 写道:
“我唯一不满的是,它有点太啰嗦,而且执行动作要等挺久。”
另一位用户 @benjitusk 表示,“mimo-v2.6-pro 卡了整整 5 分钟。”这些只是个别早期反馈,并不能代表经过测量的失败率;但如果你的 Agent 必须在无人监督下及时行动,它们仍然值得重视。
还有一位用户 @luislucatero21 分享了 Pelican SVG 测试结果:在其环境中,MiMo-V2.6-Pro 花费 $0.05,用时 6 分钟 9 秒;Grok 4.7 则花费 $1.20,用时 14 分钟。这是一个有参考价值的成本和耗时案例,但并非受控基准测试。
价格与部署:先用 API,再考虑本地部署
| MiMo-V2.6-Pro API 项目 | 列出价格 |
|---|---|
| 命中缓存的输入 | 每 1M tokens $0.0036 |
| 未命中缓存的输入 | 每 1M tokens $0.435 |
| 输出 | 每 1M tokens $0.87 |
| Artificial Analysis 任务估算 | 每个任务 $0.13 |
这些 token 价格来自 Brocker 的发布分析中的技术价格对比;Artificial Analysis 也列出了约 $0.435/$0.87 的标准价格,以及 99% 的缓存折扣。实际账单还会受到缓存策略、推理 token 计费方式和具体供应商的影响。
本地部署则是另一回事。OpenLM 的部署说明展示了一个 SGLang 示例,其中包含 --tp 16、--dp 2、--ep 16、双节点配置,以及最多 128 个运行中请求。vLLM 示例使用了 8 路张量并行,并将 GPU 显存利用率设为 95%。这些命令证明自托管确实可行,但距离普通消费者能够轻松完成的部署还有很大差距。
对大多数团队来说,更合理的顺序是先进行 API 试点,再决定基础设施。先测量任务成功率、工具调用延迟、输出长度、重试次数和总 token 成本,然后再考虑是否值得为一款拥有 1.02T 参数的稀疏模型采购硬件。
现在适合哪些人使用 MiMo-V2.6-Pro
如果你的工作负载需要开放权重、多模态输入、超长上下文或较低的输出价格,可以先用 MiMo-V2.6-Pro 做 API 试点。对于自动化程度较高的应用,它尤其有吸引力,因为这类应用更应该用工作流是否完成来评价模型,而不是只看孤立的编程题表现。
只有在你已经具备分布式 GPU 推理服务能力,并且确实需要掌控模型权重或部署方式时,才建议考虑自托管。MIT 许可证和公开检查点确实降低了门槛,但并不能消除公开部署方案中体现出的显存、网络、服务化和可观测性工作。
如果任务主要集中在最复杂的终端环境、攻击性安全测试,或要求无人值守执行且无法接受 5 分钟卡顿,那么应当选择其他模型,或者至少保留备用方案。MiMo-V2.6-Pro 尚未解决的核心取舍很明确:它的 token 经济性很有吸引力,但要让这些价格优势稳定转化为可靠产出,实际运维成本可能远高于 API 账单本身。
MiMo-V2.6-Pro 常见问题
MiMo-V2.6-Pro 是正式发布的吗?
是的。Xiaomi 的 MiMo 账号和官方 MiMo 文档于 2026 年 9 月 21 日宣布了 Pro 和 Flash,并提供开放权重及配套研究材料。
MiMo-V2.6-Pro 是开源模型吗?
它以开放权重模型的形式发布,Artificial Analysis 将其许可证列为 MIT。用于商业部署前,仍应核对具体检查点和供应商条款。
MiMo-V2.6-Pro 的上下文窗口有多长?
公开规格为最高 1 million tokens。实际可用的上下文长度取决于服务端点、提示词结构,以及模型在你的任务上处理长上下文的实际质量。
MiMo-V2.6-Pro 适合编程吗?
在多项 Agent 编程和自动化评测中,它的表现很强,包括公开表格中的 DeepSWE v1.1 得分 71.9 和 AutomationBench 得分 53.1。但在 ProgramBench 和 Terminal Bench 4.0 上,它不如部分闭源竞争模型。
MiMo-V2.6-Pro API 多少钱?
公开的标准价格为:每 1M 个未命中缓存的输入 token $0.435,每 1M 个输出 token $0.87;命中缓存的输入价格为每 1M 个 token $0.0036。正式上线前,请确认供应商当前的计费标准。
应该选 Pro 还是 Flash?
在公开对比中,Pro 是能力更强的选择。Flash 被定位为更注重效率的兄弟型号,并且在 Brocker 的价格表中成本更低。但与其只根据型号名称判断哪个更适合生产环境,不如在自己的工作负载上测试延迟和任务成功率。