AIREITER
XiaomiText Chat

MiMo V2.6 Flash

Xiaomi MiMo V2.6 Flash 将 1,048,576 token 上下文与多模态能力和超低延迟相结合。309B MoE 架构,拥有 15B 激活参数,成本仅为 Pro 的约 1/3。

输入AIReiter $0.14 每 100 万 Tokens输出AIReiter $0.28 每 100 万 Tokens
使用 API 运行

输入

输出

Example
Generated in
42.7 seconds
输入 Token
134
输出 Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

模型详情

在 Playground、API 请求和内部工作流中使用相同的模型 key。

模型 ID
mimo-v2.6-flash
供应商
Xiaomi
协议
OpenAI Chat Completions
上下文窗口
1,048,576 Token
最大输出
131,072 Token
输入 Token
14 credits / 1M Token
输出 Token
28 credits / 1M Token
缓存读取
-
缓存写入
-

具备完整 1M 上下文窗口的高吞吐量 MoE

MiMo-V2.6-Flash 是 Xiaomi 针对速度优化的 MoE 模型,在保留完整 1,048,576 token 上下文窗口的同时,提供即时响应时间和卓越的吞吐量。

15B 激活参数的高效能

拥有 3090 亿总参数,每个 token 激活 150 亿参数,Flash 专为海量并发和亚秒级首字延迟打造。

完整的 1,048,576 Token 记忆容量

记忆力毫不妥协:可将整套文档站点、海量交易日志或庞大代码库直接输入高速推理流水线。

与 Pro 相同的输入支持

输入文本、图像、视频和音频。输出文本。

本页费率

输入每百万 token $0.14,输出每百万 token $0.28,约占 Pro 的三分之一。页面顶部的数字即为计费费率。

专为高并发生产流水线打造

专为将吞吐量、延迟和运营成本视为制胜关键的场景而设计。

子智能体群与任务扇出

并行工作智能体、迭代搜索循环、自动化数据对账及自主任务分流流水线的理想引擎。

线速代码审查与代码检查

以极快线速扫描 Pull Request,验证语法和风格规范,提供行内优化建议,并生成单元测试。

规模化文档解析与 JSON 提取

以极低延迟将成千上万份非结构化发票、PDF、报告和多模态采集数据解析为结构清晰且经过验证的 JSON Schema。

低延迟实时对话交互体验

为客户服务、教育辅导和实时 Copilot 提供敏捷、无卡顿的极速响应对话体验。

混合集群设计:80/20 生产环境蓝图

生产工程团队如何结合使用 Flash 与 Pro,在每分基础设施投入中实现最大化智能收益。
01

80% 的工作负载分配至 Flash

将 80% 的日常对话量、数据分类、摘要和初稿生成路由至 Flash,以实现最大吞吐量和最低账单成本。

02

即时无缝升级至 Pro

当遇到需要跨代码仓库架构推理或复杂数学验证的极端情况时,可将该 Prompt 无缝升级至 MiMo V2.6 Pro。

03

支持高达 131,072 个输出 Token

与限制生成长度的典型轻量级模型不同,当需要生成大型合成数据或长篇报告时,Flash 最多可输出 128K token。

04

统一费率,无阶梯暴涨加价

在整个 1M 上下文跨度内保持一致的 token 定价,不会随着 Prompt 体积增长而出现惩罚性阶梯加价或突发成本激增。

两步实现即插即用式部署

数秒内即可通过标准兼容 OpenAI 的库部署 MiMo V2.6 Flash。

01

配置标准 OpenAI 客户端

将 base URL 设置为 https://aireiter.com/api/v1 并提供您的 AIReiter API key。兼容所有主流编排框架。

02

执行高速补全请求

POST https://aireiter.com/api/v1/chat/completions Authorization: Bearer $AIREITER_API_KEY Content-Type: application/json { "model": "mimo-v2.6-flash", "messages": [ {"role": "user", "content": "Extract all line items and tax totals from this invoice into structured JSON."} ], "temperature": 0.1 }

03

跨 Worker 扩展

高并发限制与极速的 token 输出速度,使 Flash 成为多租户后台 Worker 和批处理任务的理想之选。

MiMo V2.6 Flash 技术常见问题

架构细节、性能指标和部署技巧。

/ 01

Flash 的上下文窗口比 Pro 更小吗?

不是。MiMo V2.6 Flash 和 Pro 完全共享相同的 1,048,576-token 上下文窗口和 128K 最大生成限制。

/ 02

是什么让 Flash 明显更快且更便宜?

Flash 每个 token 仅激活约 150 亿参数(总计 309B MoE),而 Pro 则激活 420 亿参数,从而将计算延迟降低了 60% 以上。

/ 03

Flash 是否支持图像和音频等多模态输入?

是的。Flash 原生支持文本、图像文件、视频帧序列和音频输入,功能完全对齐。

/ 04

在 API 调用中我应该发送哪个模型标识符?

在 Chat Completions 请求的 model 字段中指定 mimo-v2.6-flash。

/ 05

什么时候应该将请求升级到 MiMo V2.6 Pro?

当任务需要深度多文件架构重构、复杂数学证明或详尽的跨领域验证等极度依赖深度推理的场景时,建议升级至 Pro。