Prime Inference 已經上線,不是預告中的未來產品。它提供相容 OpenAI 的 API,定位也很明確:承接持續運作的 agent 流量,而不只是偶發請求。不過,定價資訊目前不算透明;Prime Intellect 的發布文章詳細說明了推論架構,但完整的逐模型價目表,反而較容易從即時價格目錄找到,而非傳統的官方定價頁面。
Prime Inference 已上線,但價格資訊分散
Prime Intellect 在 2026 年 10 月 2 日正式推出 Prime Inference。產品提供可因應需求波動的 Serverless 端點,也有適合持續性工作負載的保留容量。公開 API 與底層模型機群彼此分離,因此即使容量遷移或個別節點失效,客戶端端點也不必改動。
這是可直接投入使用的正式發布,不是候補名單服務。Prime Intellect 表示,首個公開部署的 GLM-5.3 已於 9 月 22 日在 OpenRouter 上線;直接使用 API 的客戶,則可將相容 OpenAI 的 SDK 指向 https://api.pinference.ai/api/v1。
定價上的限制也很直接:官方發布頁承諾提供整合計費與團隊層級的用量追蹤,但沒有公開完整費率表。因此,在確定預算前,仍應從已驗證身分的控制台或 models endpoint 查詢當前模型價格。公開目錄可作為快照參考,並非具約束力的報價。
Prime Inference 目前怎麼計費
Prime Inference 採依模型、依用量計費,輸入與輸出 token 分開收費。輸出 token 的價格可能是輸入的數倍,因此,對會產生長篇回覆的程式 agent 或推理工作負載而言,光看低廉的輸入單價很容易誤判成本。
以下快照記錄於 2026 年 10 月 3 日,來源為 endpoints.run 的 Prime Intellect 目錄,當時列出 64 個端點。實際購買前,請向 Prime Intellect 確認各項費率。
| 模型 ID | 輸入/100 萬 token | 輸出/100 萬 token | 列示上下文 | 適合用途 |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | 分類與簡易擷取 |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | 低成本、長上下文的一般工作 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | 速度優先的 agent 與工具工作流程 |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | 程式開發與工具使用 |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | 長上下文推理與視覺任務 |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | 旗艦級 GLM agent 工作負載 |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | 較高階的推理工作 |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | 高階長上下文任務 |
另一個目錄 Compute Prices 在同一天顯示 111 個模型,且列出 Llama 3.2 1B 的最低精確輸入價格為每百萬 token $0.027。兩個目錄的模型數量不一致,正說明不應把任一目錄視為固定庫存,而應直接查詢即時 API:目錄可能納入不同命名空間、gateway 模型,或在不同時間更新。
三種常見工作負載的成本試算
token 成本可用以下公式估算:
(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)
| 每月工作負載 | 模型與 token 用量 | 預估 token 費用 |
|---|---|---|
| 輕量客服機器人 | Qwen3.7 Flash;5,000 萬輸入 + 1,000 萬輸出 | $2.80 |
| 程式開發 agent | Qwen3 Coder Next;1 億輸入 + 4,000 萬輸出 | $90.00 |
| 輸出量高的旗艦 agent | GLM-5.3;2 億輸入 + 1 億輸出 | $720.00 |
上述試算只涵蓋列出的 token 費用,不包含保留容量合約、sandbox 執行、訓練、評測或 GPU 租用。Prime Intellect 將這些項目視為獨立服務,因此完整的 agent 帳單可能不只包含推論 token。
支援長上下文,也不代表每次請求都會處理 100 萬 token;計費仍以實際處理的 token 為準。不過,如果 agent 不斷重送一段 140K token 的對話歷史,輸入成本很快就會累積。除非透過 prefix caching 或應用程式端的上下文管理減少重複處理,否則這筆支出不可忽視。
API 串接只要換一個端點
Prime Inference 提供相容 OpenAI 的端點,因此既有的 OpenAI SDK 整合通常只需替換 base URL、API key 與模型識別碼。Prime Intellect 在發布文章中提供的 base URL 是 https://api.pinference.ai/api/v1。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
對應的 cURL 請求如下:
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime Intellect 也提供 CLI 操作方式:安裝 prime 工具後,使用 prime login 驗證身分,再執行 prime inference chat。正式部署前,請先取得當前模型清單並複製精確的模型 ID;不同目錄採用的前綴並不一致。
這套架構對 agent 工作負載有何差異
當 prompt 很長、工作階段會反覆回來,且工具呼叫必須維持有效時,Prime Inference 的設計差異最明顯。Prime Intellect 表示,典型的內部 agent 每回合約會在 140K token 的 prompt 上新增 6K token,因此,快取保留與路由策略的重要性不亞於原始解碼速度。
官方發布報告提供了多項 GLM-5.3 在 GB200 NVL72 硬體上部署時的具體測量數據:
- 在 Prime Intellect 的測試中,將 prefill 與 decode worker 分離後,p90 token 間延遲降低近 40%。
- 在每位使用者端對端每秒 100 token 的目標下,受測的 1:4 prefill/decode 拓撲中,每個 prefill 群組可服務 66 個工作階段,並達到每位使用者每秒 101 token。
- 將每張 GPU 的 prefill 預算從 8K token 降至 4K token,讓中位數排隊等待時間從 550 ms 降至 110 ms,中位數首 token 時間也降低約 20%。
- 在相同記憶體預算下,NVFP4 壓縮讓每個 decoder 的快取容量從 109 萬提升至 163 萬 token,增加約 50%。
- 在另一組 TP8 比較中,block-major 快取配置將傳輸描述符減少約 10 倍,平均傳輸時間則由 146 ms 降至 78 ms。
這些數字取決於特定工作負載與配置,並非通用的延遲保證。它們的實際價值在於,Prime Intellect 公開了自己優化的瓶頸:回訪工作階段的快取重用、請求准入延遲、prefill 與 decode 的相互干擾,以及快取傳輸的額外負擔。
工具使用則值得另外測試。Prime Intellect 發現,有些情況下未宣告的工具會被靜默捨棄,或引數出現錯誤型別,因此在 GLM 的服務路徑加入受約束解碼與 schema 測試。該公司表示工具呼叫錯誤率接近零,但採購方仍應在切換正式流量前,重播自己的巢狀 schema、可為 null 的引數、串流呼叫及格式錯誤請求。
Serverless 還是保留容量,取決於流量型態
對多數團隊來說,Serverless 是較合理的起點,因為它可將不確定的需求轉為 token 費用。當持續併發、可預測延遲或自訂部署的重要性高於避免閒置容量時,才該考慮保留容量。
| 工作負載 | 較適合的起始選項 | 原因 |
|---|---|---|
| 原型或間歇性聊天機器人 | Serverless | 不必為閒置 GPU 預留容量 |
| 突發式評測工作 | 目前選 Serverless | 較低價的批次與非同步推論仍列在路線圖中,並非目前發布功能 |
| 穩定、高併發的 agent 服務 | 索取保留容量報價 | 容量規畫的重要性可能高於名目 token 單價 |
| 微調或 LoRA 模型 | 先確認可用性 | 發布文章將微調模型的一鍵專屬部署列為路線圖項目 |
| 嚴格的合約 SLA 或區域要求 | 洽談業務 | 公開發布資料未提供通用合約、區域矩陣或標準保留容量價格 |
不要預設「保留」一定更便宜。應以具代表性併發下量測到的 Serverless 支出,對照報價中的容量成本,並將閒置時段及尖峰預留空間一併納入。
Prime Intellect 尚未清楚公開的採購資訊
Prime Inference 對基礎架構的揭露相當詳細,但從公開且已被索引的資料來看,以下幾項採購資訊仍不夠明確:
- 完整的官方逐模型費率表;
- 每個模型的快取輸入與推理 token 計費規則;
- 公開的速率與併發限制;
- 逐區域的資料處理地圖;
- 推論請求的標準資料保留條款;
- 通用的正式 SLA 與補償機制;
- 保留容量的最低合約條件與價格;
- 目錄中哪些項目由 Prime 直接託管,哪些是經由 gateway 路由的模型。
未公開不等於不支援。這表示相關項目應從控制台、文件、模型端點、合約或業務回覆中確認,而不是因為相容 OpenAI 就自行推論。
Prime Inference 常見問題
Prime Inference 已經正式可用了嗎?
是。Prime Intellect 在 2026 年 10 月 2 日宣布公開發布,並公開 API base URL、CLI 指令,以及 Serverless/保留容量的產品區分。
Prime Inference 有免費方案嗎?
公開發布文章未提及免費的 Prime Inference 額度。Prime Intellect 的訓練技術棧中另有免費或零價格選項,但不應將其視為推論服務的免費方案。
Prime Inference 相容 OpenAI SDK 嗎?
相容。將 OpenAI 相容的 base URL 設為 https://api.pinference.ai/api/v1、提供 Prime API key,並使用目前可用的模型 ID 即可。
Prime Inference 支援工具呼叫嗎?
GLM-5.3 的服務路徑支援工具呼叫,Prime Intellect 也說明了針對引數 schema 的語法約束與回歸測試。不過模型能力各有差異,仍應逐一確認各模型的支援情況。
目前有多少模型可用?
公開目錄在 2026 年 10 月 3 日分別顯示 64 與 111 個項目。由於數量不同,對特定帳戶而言,可從即時 Prime 模型端點或控制台取得的庫存才是可靠依據。
Prime Inference 比租 GPU 便宜嗎?
對流量起伏較大的服務,Serverless 通常更容易合理化成本;在高且穩定的使用率下,租用或保留 GPU 可能更經濟。答案取決於實測 token 用量、併發、延遲目標與閒置容量,而不只是 token 單價。
五分鐘完成 go/no-go 檢查
如果團隊需要開放模型存取、長上下文 agent 服務,或想將 Prime Intellect 的訓練技術棧一路接到正式環境,Prime Inference 值得測試。但只憑公開價目表就直接採購,時機仍未成熟。
- 查詢即時模型清單,記錄精確的輸入、輸出、快取與推理費率。
- 重播一段具代表性的長對話,測量首 token 延遲、生成速度與總計費 token 數。
- 在串流及非串流模式下,執行應用程式實際使用的工具 schema。
- 若工作負載具敏感性,應索取資料保留、區域、速率限制、SLA 與保留容量條款。
- 先觀察一般與尖峰流量,再將實測的 Serverless 支出與保留容量報價比較。
關鍵取捨很清楚:Prime Inference 提供可信的服務工程能力與低摩擦的 API,但價格與合約條件仍需要多做一步確認,無法只從發布頁面完成判斷。