具备完整 1M 上下文窗口的高吞吐量 MoE
MiMo-V2.6-Flash 是 Xiaomi 针对速度优化的 MoE 模型,在保留完整 1,048,576 token 上下文窗口的同时,提供即时响应时间和卓越的吞吐量。
15B 激活参数的高效能
拥有 3090 亿总参数,每个 token 激活 150 亿参数,Flash 专为海量并发和亚秒级首字延迟打造。
完整的 1,048,576 Token 记忆容量
记忆力毫不妥协:可将整套文档站点、海量交易日志或庞大代码库直接输入高速推理流水线。
与 Pro 相同的输入支持
输入文本、图像、视频和音频。输出文本。
本页费率
输入每百万 token $0.14,输出每百万 token $0.28,约占 Pro 的三分之一。页面顶部的数字即为计费费率。
专为高并发生产流水线打造
专为将吞吐量、延迟和运营成本视为制胜关键的场景而设计。
子智能体群与任务扇出
并行工作智能体、迭代搜索循环、自动化数据对账及自主任务分流流水线的理想引擎。
线速代码审查与代码检查
以极快线速扫描 Pull Request,验证语法和风格规范,提供行内优化建议,并生成单元测试。
规模化文档解析与 JSON 提取
以极低延迟将成千上万份非结构化发票、PDF、报告和多模态采集数据解析为结构清晰且经过验证的 JSON Schema。
低延迟实时对话交互体验
为客户服务、教育辅导和实时 Copilot 提供敏捷、无卡顿的极速响应对话体验。
混合集群设计:80/20 生产环境蓝图
80% 的工作负载分配至 Flash
将 80% 的日常对话量、数据分类、摘要和初稿生成路由至 Flash,以实现最大吞吐量和最低账单成本。
即时无缝升级至 Pro
当遇到需要跨代码仓库架构推理或复杂数学验证的极端情况时,可将该 Prompt 无缝升级至 MiMo V2.6 Pro。
支持高达 131,072 个输出 Token
与限制生成长度的典型轻量级模型不同,当需要生成大型合成数据或长篇报告时,Flash 最多可输出 128K token。
统一费率,无阶梯暴涨加价
在整个 1M 上下文跨度内保持一致的 token 定价,不会随着 Prompt 体积增长而出现惩罚性阶梯加价或突发成本激增。
两步实现即插即用式部署
数秒内即可通过标准兼容 OpenAI 的库部署 MiMo V2.6 Flash。
配置标准 OpenAI 客户端
将 base URL 设置为 https://aireiter.com/api/v1 并提供您的 AIReiter API key。兼容所有主流编排框架。
执行高速补全请求
POST https://aireiter.com/api/v1/chat/completions Authorization: Bearer $AIREITER_API_KEY Content-Type: application/json { "model": "mimo-v2.6-flash", "messages": [ {"role": "user", "content": "Extract all line items and tax totals from this invoice into structured JSON."} ], "temperature": 0.1 }
跨 Worker 扩展
高并发限制与极速的 token 输出速度,使 Flash 成为多租户后台 Worker 和批处理任务的理想之选。
MiMo V2.6 Flash 技术常见问题
架构细节、性能指标和部署技巧。
/ 01Flash 的上下文窗口比 Pro 更小吗?
不是。MiMo V2.6 Flash 和 Pro 完全共享相同的 1,048,576-token 上下文窗口和 128K 最大生成限制。
/ 02是什么让 Flash 明显更快且更便宜?
Flash 每个 token 仅激活约 150 亿参数(总计 309B MoE),而 Pro 则激活 420 亿参数,从而将计算延迟降低了 60% 以上。
/ 03Flash 是否支持图像和音频等多模态输入?
是的。Flash 原生支持文本、图像文件、视频帧序列和音频输入,功能完全对齐。
/ 04在 API 调用中我应该发送哪个模型标识符?
在 Chat Completions 请求的 model 字段中指定 mimo-v2.6-flash。
/ 05什么时候应该将请求升级到 MiMo V2.6 Pro?
当任务需要深度多文件架构重构、复杂数学证明或详尽的跨领域验证等极度依赖深度推理的场景时,建议升级至 Pro。