Prime Inference 已经上线:它兼容 OpenAI API,面向持续运行的 Agent 流量而非停留在产品预告阶段。不过,定价信息并不算透明。Prime Intellect 的发布文章详细介绍了推理服务架构,但完整的逐模型价目表目前在实时价格目录中反而比在常规官方定价页更容易找到。
服务已上线,价格信息却分散在多处
Prime Intellect 于 2026 年 10 月 2 日正式发布 Prime Inference。产品同时提供适合需求波动场景的 Serverless 端点,以及面向持续负载的预留容量;公开 API 与底层模型集群相互解耦,因此即使容量迁移或发生故障,客户端端点也无需变更。
这不是等待名单产品。Prime Intellect 表示,其首个公开部署 GLM-5.3 已于 9 月 22 日在 OpenRouter 上线;直接接入的客户则可以将兼容 OpenAI 的 SDK 指向 https://api.pinference.ai/api/v1。
定价方面需要注意:官方发布页承诺提供统一计费和团队级用量追踪,但没有公布完整费率表。因此,在确认预算前,应通过已登录的控制台或模型端点核对当前模型价格。公开目录适合作为价格快照,而非具有合同效力的报价。
Prime Inference 当前价格一览
Prime Inference 按模型和实际用量收费,输入与输出 Token 分别计费。输出 Token 的单价可能是输入的数倍,因此,对于会生成大量文本的编程 Agent 或推理工作负载,仅看输入价格低并不能代表总成本低。
以下价格快照记录于 2026 年 10 月 3 日,来源为 endpoints.run 的 Prime Intellect 目录,当时列出了 64 个端点。购买前仍应在 Prime Intellect 处核实每项费率。
| 模型 ID | 输入 / 100 万 Token | 输出 / 100 万 Token | 列示上下文长度 | 适用场景 |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | 分类与简单信息提取 |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | 低成本、长上下文通用任务 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | 更快的 Agent 与工具调用工作流 |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | 编程与工具使用 |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | 长上下文推理与视觉任务 |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | 旗舰 GLM Agent 工作负载 |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | 高阶推理任务 |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | 高端长上下文任务 |
另一份目录 Compute Prices 在同一天显示了 111 个模型,其中 Llama 3.2 1B 的输入价格最低为每 100 万 Token $0.027。两份目录的数量不一致,正说明不应将任何一方视为固定库存,而应查询实时 API:不同目录可能纳入了不同命名空间、网关模型,或更新时间不同。
三个更贴近实际的成本案例
Token 成本可按以下公式估算:
(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)
| 月度工作负载 | 模型与 Token 用量 | 预估 Token 费用 |
|---|---|---|
| 轻量客服机器人 | Qwen3.7 Flash;5000 万输入 + 1000 万输出 | $2.80 |
| 编程 Agent | Qwen3 Coder Next;1 亿输入 + 4000 万输出 | $90.00 |
| 输出密集型旗舰 Agent | GLM-5.3;2 亿输入 + 1 亿输出 | $720.00 |
以上计算仅涵盖目录列出的 Token 费用,不包括预留容量合同、沙箱执行、训练、评测或 GPU 租赁。Prime Intellect 将这些作为独立服务销售,因此端到端的 Agent 成本不只包含推理 Token。
支持长上下文,也不等于每个请求都会消耗 100 万 Token。计费依据是实际处理的 Token 数量。不过,如果 Agent 反复重传一段 140K Token 的历史记录,输入费用仍会迅速累积;除非通过前缀缓存或应用侧上下文管理,减少重复计算。
接入 API,只需改一个端点
Prime Inference 提供兼容 OpenAI 的端点。对于已有 OpenAI SDK 集成的应用,通常只需替换 base URL、API key 和模型标识符。Prime Intellect 在发布文章中给出的 base URL 是 https://api.pinference.ai/api/v1。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
对应的 cURL 请求如下:
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime Intellect 还提供 CLI 使用方式:安装 prime 工具,通过 prime login 完成认证,再运行 prime inference chat。部署前应获取当前模型列表并复制准确的模型 ID;不同目录使用的前缀可能不一致。
这套架构对 Agent 工作负载意味着什么
当提示词很长、会话频繁回访、工具调用必须稳定有效时,Prime Inference 的差异化才最明显。Prime Intellect 表示,一个典型的内部 Agent 回合会在 140K Token 的提示词基础上增加约 6K Token,因此缓存保留和路由策略的重要性并不亚于纯粹的生成速度。
官方发布报告给出了 GLM-5.3 在 GB200 NVL72 硬件上部署时的几项具体测试数据:
- 在 Prime Intellect 的测试中,拆分预填充与解码 Worker 后,p90 Token 间延迟降低了近 40%。
- 在每位用户端到端目标为每秒 100 Token 时,测试中的 1:4 预填充/解码拓扑,每个预填充组可服务 66 个会话,并达到每位用户每秒 101 Token。
- 将每块 GPU 的预填充预算从 8K Token 降至 4K Token 后,中位排队等待时间从 550 ms 降至 110 ms,中位首 Token 时间缩短约 20%。
- 在相同内存预算下,NVFP4 压缩将每个解码器的缓存容量从 109 万提升至 163 万 Token,增幅约 50%。
- 在另一项 TP8 对比中,块主序缓存布局将传输描述符数量减少约 10 倍,并将平均传输时间从 146 ms 缩短至 78 ms。
这些数据依赖具体工作负载和配置,不能视为通用的延迟承诺。它们的实际价值在于,Prime Intellect 明确公开了其优化的瓶颈:回访会话的缓存复用、准入延迟、预填充与解码之间的干扰,以及缓存传输开销。
工具调用需要单独测试。Prime Intellect 发现,部分场景下未声明的工具会被静默丢弃,或参数类型不正确;因此其 GLM 服务链路加入了受约束解码和 Schema 测试。该公司称工具调用错误率接近于零,但在切换生产流量之前,买方仍应重放自己的嵌套 Schema、可空参数、流式调用和异常请求。
选 Serverless 还是预留容量,关键看流量形态
对大多数团队而言,Serverless 是更合理的起点,因为它能将不确定的需求转化为按 Token 计费。只有当持续并发、可预测延迟或定制部署的重要性超过避免闲置容量时,预留容量才会更有吸引力。
| 工作负载 | 更适合的起步方案 | 原因 |
|---|---|---|
| 原型或间歇性聊天机器人 | Serverless | 无需为闲置 GPU 预留资源 |
| 突发式评测任务 | 目前选 Serverless | 更低价格的批处理和异步推理仍列在路线图中,并非当前发布功能 |
| 稳定、高并发的 Agent 服务 | 索取预留容量报价 | 容量规划的重要性可能高于名义 Token 单价 |
| 微调模型或 LoRA 模型 | 先确认可用性 | 发布文章将一键部署微调模型的专属实例描述为路线图工作 |
| 严格的合同 SLA 或区域要求 | 与销售团队确认 | 公开发布材料未说明通用合同、区域矩阵或标准预留价格 |
不要想当然地认为“预留”一定更便宜。应将报价中的容量成本,与具有代表性并发下实测的 Serverless 开销进行比较,并计入闲置时段和峰值冗余。
Prime Intellect 尚未清晰公开的信息
Prime Inference 对基础设施的披露相当详细,但在公开且可索引的材料中,仍有若干采购关键点不够明确:
- 完整的官方逐模型费率表;
- 每个模型的缓存输入和推理 Token 计费规则;
- 公开的速率与并发限制;
- 逐区域的数据处理地图;
- 推理请求的标准数据保留条款;
- 通用的正式 SLA 及补救措施;
- 预留容量的最低期限和价格;
- 目录中的哪些条目由 Prime 直接托管,哪些属于路由网关模型。
未公开不代表不支持,而是意味着不应从 OpenAI 兼容性中自行推断这些信息。应通过控制台、文档、模型端点、合同或销售回复逐项确认。
Prime Inference 常见问题
Prime Inference 是否已经正式可用?
是。Prime Intellect 于 2026 年 10 月 2 日宣布公开发布,并公布了 API base URL、CLI 命令,以及 Serverless 和预留容量两种产品形态。
Prime Inference 有免费套餐吗?
公开发布文章没有说明 Prime Inference 提供免费额度。Prime Intellect 的训练产品栈中另有免费或零价格选项,但不应将其视为推理免费套餐。
Prime Inference 兼容 OpenAI SDK 吗?
兼容。将 OpenAI 兼容的 base URL 设置为 https://api.pinference.ai/api/v1,提供 Prime API key,并使用当前可用的模型 ID 即可。
Prime Inference 支持工具调用吗?
GLM-5.3 服务链路支持工具调用,Prime Intellect 还介绍了针对参数 Schema 的语法约束与回归测试。但不同模型的能力存在差异,仍应按模型逐一确认支持情况。
目前有多少模型可用?
公开目录在 2026 年 10 月 3 日分别显示了 64 和 111 个条目。由于两个数量并不一致,账户实际可用的模型清单应以 Prime 的实时模型端点或控制台为准。
Prime Inference 比租 GPU 更便宜吗?
对于流量波动的场景,Serverless 通常更容易证明其经济性;而在高且稳定的利用率下,租用或预留 GPU 可能更划算。答案取决于实测 Token 用量、并发量、延迟目标和闲置容量,而非仅仅比较 Token 单价。
五分钟完成上线与否判断
对于需要开放模型访问、长上下文 Agent 推理服务,或希望将 Prime Intellect 训练栈衔接到生产环境的团队,Prime Inference 值得测试。但仅凭公开价目表,还不足以直接完成采购决策。
- 查询实时模型列表,记录准确的输入、输出、缓存和推理费率。
- 重放一段有代表性的长对话,测量首 Token 延迟、生成速度和总计费 Token 数。
- 在流式与非流式模式下运行应用实际使用的工具 Schema。
- 如果工作负载敏感,索取数据保留、区域、速率限制、SLA 和预留容量条款。
- 先观察正常流量和峰值流量,再将实测的 Serverless 支出与预留容量报价比较。
最终取舍很明确:Prime Inference 提供了可信的推理工程能力和低摩擦的 API 接入,但价格与合同条款仍需要在发布页之外再核实一步。