AIREITER
MinimaxText Chat

MiniMax M3

使用 MiniMax M3 进行长上下文文档审阅、agent 记忆检查、知识工作流和生产环境文本自动化。

输入官方 $1.20 每 100 万 TokensAIReiter $0.36 每 100 万 Tokens输出官方 $4.80 每 100 万 TokensAIReiter $1.44 每 100 万 Tokens缓存读取官方 $0.24 每 100 万 TokensAIReiter $0.072 每 100 万 Tokens
使用 API 运行

输入

输出

Example
Generated in
42.7 seconds
输入 Token
134
输出 Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

模型详情

在 Playground、API 请求和内部工作流中使用相同的模型 key。

模型 ID
minimax-m3
供应商
Minimax
协议
Anthropic Messages
上下文窗口
1,000,000 Token
最大输出
131,072 Token
输入 Token
36 credits / 1M Token
输出 Token
144 credits / 1M Token
缓存读取
7.2 credits / 1M Token
缓存写入
-

面向文档和 agent 记忆的长上下文方案

当某个工作流需要在一次请求中保留更多证据时,MiniMax M3 很有用:例如政策集合、研究资料包、会议记录历史或较长的 agent 记忆。

MiniMax M3 API cover

你应该选择 MiniMax M3 吗?

将其定位为适合文档密集型团队和需要连续性的 agent 工作流的实用长上下文模型。

在以下情况下选择它

你需要长文档审阅、记忆检查、知识库归纳,或者在升级到旗舰模型之前先使用更便宜的长上下文方案。

在以下情况下使用其他模型

任务只是一个简短的聊天回合、简单抽取,或者是需要更专业编码模型的高风险代码推理。

公共 API 协议

使用模型 "minimax-m3" 调用 POST https://aireiter.com/api/v1/messages。通过同一个兼容 Messages 的端点支持流式输出。

Token 和缓存使用

计费基于输入、缓存读取和输出使用量。对于长提示词,cache-read 字段很重要,因为复用上下文会显著影响成本。

MiniMax M3 生产工作负载

最适合长输入且连续性和总结质量都很重要的场景。
01

文档包

审阅政策、报告、转录稿和研究笔记,同时保持跨文档引用可见。

02

agent 记忆

检查长历史、工具调用和状态更新,解释 agent 为什么做出某个决定。

03

知识工作流

将较长的内部资料转化为摘要、简报、需求和行动清单。

04

注重成本的长上下文

在使用更高成本的旗舰方案之前,先评估一个实用的长上下文模型是否已经足够。

MiniMax M3 如何融入你的模型栈

不要把每个请求都路由到最新模型。先选择仍能满足质量标准的最便宜模型,然后把更深层的模型留给失败请求或高风险任务。

适合快速批处理

小型快速任务使用 Doubao 或 DeepSeek V4 Flash;MiniMax M3 适合上下文密集型输入。

适合更深层推理

当推理深度比上下文大小更重要时,使用 GLM 5.2 或 DeepSeek V4 Pro。

适合长上下文

当工作负载混合了文档、代码和 agent 跟踪记录时,将 MiniMax M3 与 Kimi K2.7 Code 进行对比。

用于生产部署

跟踪重复长前缀上的缓存读取用量;长上下文工作流在这里可以变得更具成本效益。

MiniMax M3 API 常见问题

开发者在将文本模型从 playground 测试迁移到生产 API 流量之前通常会查看的问题。

/ 01

我应该为 MiniMax M3 发送哪个模型 ID?

在 API 请求体中使用 "minimax-m3"。内部 DB key 仅供 AIReiter 路由使用。

/ 02

MiniMax M3 应该使用哪个端点?

公开 API 调用请使用 POST https://aireiter.com/api/v1/messages。保持 x-api-key / Authorization 认证与 AIReiter API key 配置一致。

/ 03

MiniMax M3 支持流式传输吗?

支持。发送 stream=true,并读取 server-sent events 直到消息完成。在排查认证或模型 ID 问题时,先测试非流式模式。

/ 04

如何确认 MiniMax M3 的 token 和缓存计费?

查看 API 返回的 usage 对象。输入、输出和 cache-read token 字段是结算依据;仅仅重复提示词并不能证明命中缓存。

/ 05

我是否应该始终为 MiniMax M3 设置 max_tokens?

根据预期的摘要长度设置 max_tokens。长输入并不总是需要很大的输出,但审查任务需要足够空间来容纳发现和证据。