AIREITER

Prime Inference 價格與 API 指南(2026)

最近更新: 2026-10-03 07:29:06

Prime Inference 已經上線,不是預告中的未來產品。它提供相容 OpenAI 的 API,定位也很明確:承接持續運作的 agent 流量,而不只是偶發請求。不過,定價資訊目前不算透明;Prime Intellect 的發布文章詳細說明了推論架構,但完整的逐模型價目表,反而較容易從即時價格目錄找到,而非傳統的官方定價頁面。

Prime Intellect 的 Prime Inference 發布頁面

Prime Inference 已上線,但價格資訊分散

Prime Intellect 在 2026 年 10 月 2 日正式推出 Prime Inference。產品提供可因應需求波動的 Serverless 端點,也有適合持續性工作負載的保留容量。公開 API 與底層模型機群彼此分離,因此即使容量遷移或個別節點失效,客戶端端點也不必改動。

這是可直接投入使用的正式發布,不是候補名單服務。Prime Intellect 表示,首個公開部署的 GLM-5.3 已於 9 月 22 日在 OpenRouter 上線;直接使用 API 的客戶,則可將相容 OpenAI 的 SDK 指向 https://api.pinference.ai/api/v1。

定價上的限制也很直接:官方發布頁承諾提供整合計費與團隊層級的用量追蹤,但沒有公開完整費率表。因此,在確定預算前,仍應從已驗證身分的控制台或 models endpoint 查詢當前模型價格。公開目錄可作為快照參考,並非具約束力的報價。

Prime Inference 目前怎麼計費

Prime Inference 採依模型、依用量計費,輸入與輸出 token 分開收費。輸出 token 的價格可能是輸入的數倍,因此,對會產生長篇回覆的程式 agent 或推理工作負載而言,光看低廉的輸入單價很容易誤判成本。

以下快照記錄於 2026 年 10 月 3 日,來源為 endpoints.run 的 Prime Intellect 目錄,當時列出 64 個端點。實際購買前,請向 Prime Intellect 確認各項費率。

模型 ID輸入/100 萬 token輸出/100 萬 token列示上下文適合用途
meta-llama/Llama-3.2-1B-Instruct$0.03$0.2060K分類與簡易擷取
qwen/qwen3.7-flash$0.03$0.131M低成本、長上下文的一般工作
z-ai/glm-5.3-flash$0.15$0.501M速度優先的 agent 與工具工作流程
qwen/qwen3-coder-next$0.30$1.50262K程式開發與工具使用
deepseek/deepseek-v4.1-flash$0.30$1.201M長上下文推理與視覺任務
z-ai/glm-5.3$1.40$4.401M旗艦級 GLM agent 工作負載
deepseek/deepseek-v4-pro$1.91$3.831M較高階的推理工作
moonshotai/kimi-k3$3.45$17.251M高階長上下文任務

另一個目錄 Compute Prices 在同一天顯示 111 個模型,且列出 Llama 3.2 1B 的最低精確輸入價格為每百萬 token $0.027。兩個目錄的模型數量不一致,正說明不應把任一目錄視為固定庫存,而應直接查詢即時 API:目錄可能納入不同命名空間、gateway 模型,或在不同時間更新。

三種常見工作負載的成本試算

token 成本可用以下公式估算:

(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)

每月工作負載模型與 token 用量預估 token 費用
輕量客服機器人Qwen3.7 Flash;5,000 萬輸入 + 1,000 萬輸出$2.80
程式開發 agentQwen3 Coder Next;1 億輸入 + 4,000 萬輸出$90.00
輸出量高的旗艦 agentGLM-5.3;2 億輸入 + 1 億輸出$720.00

上述試算只涵蓋列出的 token 費用,不包含保留容量合約、sandbox 執行、訓練、評測或 GPU 租用。Prime Intellect 將這些項目視為獨立服務,因此完整的 agent 帳單可能不只包含推論 token。

支援長上下文,也不代表每次請求都會處理 100 萬 token;計費仍以實際處理的 token 為準。不過,如果 agent 不斷重送一段 140K token 的對話歷史,輸入成本很快就會累積。除非透過 prefix caching 或應用程式端的上下文管理減少重複處理,否則這筆支出不可忽視。

API 串接只要換一個端點

Prime Inference 提供相容 OpenAI 的端點,因此既有的 OpenAI SDK 整合通常只需替換 base URL、API key 與模型識別碼。Prime Intellect 在發布文章中提供的 base URL 是 https://api.pinference.ai/api/v1。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_PRIME_API_KEY",
    base_url="https://api.pinference.ai/api/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "user", "content": "Write a haiku about KV caches."}
    ],
    stream=False,
)

print(response.choices[0].message.content)

對應的 cURL 請求如下:

curl https://api.pinference.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $PRIME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a haiku about KV caches."}
    ]
  }'

Prime Intellect 也提供 CLI 操作方式:安裝 prime 工具後,使用 prime login 驗證身分,再執行 prime inference chat。正式部署前,請先取得當前模型清單並複製精確的模型 ID;不同目錄採用的前綴並不一致。

這套架構對 agent 工作負載有何差異

當 prompt 很長、工作階段會反覆回來,且工具呼叫必須維持有效時,Prime Inference 的設計差異最明顯。Prime Intellect 表示,典型的內部 agent 每回合約會在 140K token 的 prompt 上新增 6K token,因此,快取保留與路由策略的重要性不亞於原始解碼速度。

官方發布報告提供了多項 GLM-5.3 在 GB200 NVL72 硬體上部署時的具體測量數據:

  • 在 Prime Intellect 的測試中,將 prefill 與 decode worker 分離後,p90 token 間延遲降低近 40%。
  • 在每位使用者端對端每秒 100 token 的目標下,受測的 1:4 prefill/decode 拓撲中,每個 prefill 群組可服務 66 個工作階段,並達到每位使用者每秒 101 token。
  • 將每張 GPU 的 prefill 預算從 8K token 降至 4K token,讓中位數排隊等待時間從 550 ms 降至 110 ms,中位數首 token 時間也降低約 20%。
  • 在相同記憶體預算下,NVFP4 壓縮讓每個 decoder 的快取容量從 109 萬提升至 163 萬 token,增加約 50%。
  • 在另一組 TP8 比較中,block-major 快取配置將傳輸描述符減少約 10 倍,平均傳輸時間則由 146 ms 降至 78 ms。

這些數字取決於特定工作負載與配置,並非通用的延遲保證。它們的實際價值在於,Prime Intellect 公開了自己優化的瓶頸:回訪工作階段的快取重用、請求准入延遲、prefill 與 decode 的相互干擾,以及快取傳輸的額外負擔。

工具使用則值得另外測試。Prime Intellect 發現,有些情況下未宣告的工具會被靜默捨棄,或引數出現錯誤型別,因此在 GLM 的服務路徑加入受約束解碼與 schema 測試。該公司表示工具呼叫錯誤率接近零,但採購方仍應在切換正式流量前,重播自己的巢狀 schema、可為 null 的引數、串流呼叫及格式錯誤請求。

Serverless 還是保留容量,取決於流量型態

對多數團隊來說,Serverless 是較合理的起點,因為它可將不確定的需求轉為 token 費用。當持續併發、可預測延遲或自訂部署的重要性高於避免閒置容量時,才該考慮保留容量。

工作負載較適合的起始選項原因
原型或間歇性聊天機器人Serverless不必為閒置 GPU 預留容量
突發式評測工作目前選 Serverless較低價的批次與非同步推論仍列在路線圖中,並非目前發布功能
穩定、高併發的 agent 服務索取保留容量報價容量規畫的重要性可能高於名目 token 單價
微調或 LoRA 模型先確認可用性發布文章將微調模型的一鍵專屬部署列為路線圖項目
嚴格的合約 SLA 或區域要求洽談業務公開發布資料未提供通用合約、區域矩陣或標準保留容量價格

不要預設「保留」一定更便宜。應以具代表性併發下量測到的 Serverless 支出,對照報價中的容量成本,並將閒置時段及尖峰預留空間一併納入。

Prime Intellect 尚未清楚公開的採購資訊

Prime Inference 對基礎架構的揭露相當詳細,但從公開且已被索引的資料來看,以下幾項採購資訊仍不夠明確:

  • 完整的官方逐模型費率表;
  • 每個模型的快取輸入與推理 token 計費規則;
  • 公開的速率與併發限制;
  • 逐區域的資料處理地圖;
  • 推論請求的標準資料保留條款;
  • 通用的正式 SLA 與補償機制;
  • 保留容量的最低合約條件與價格;
  • 目錄中哪些項目由 Prime 直接託管,哪些是經由 gateway 路由的模型。

未公開不等於不支援。這表示相關項目應從控制台、文件、模型端點、合約或業務回覆中確認,而不是因為相容 OpenAI 就自行推論。

Prime Inference 常見問題

Prime Inference 已經正式可用了嗎?

是。Prime Intellect 在 2026 年 10 月 2 日宣布公開發布,並公開 API base URL、CLI 指令,以及 Serverless/保留容量的產品區分。

Prime Inference 有免費方案嗎?

公開發布文章未提及免費的 Prime Inference 額度。Prime Intellect 的訓練技術棧中另有免費或零價格選項,但不應將其視為推論服務的免費方案。

Prime Inference 相容 OpenAI SDK 嗎?

相容。將 OpenAI 相容的 base URL 設為 https://api.pinference.ai/api/v1、提供 Prime API key,並使用目前可用的模型 ID 即可。

Prime Inference 支援工具呼叫嗎?

GLM-5.3 的服務路徑支援工具呼叫,Prime Intellect 也說明了針對引數 schema 的語法約束與回歸測試。不過模型能力各有差異,仍應逐一確認各模型的支援情況。

目前有多少模型可用?

公開目錄在 2026 年 10 月 3 日分別顯示 64 與 111 個項目。由於數量不同,對特定帳戶而言,可從即時 Prime 模型端點或控制台取得的庫存才是可靠依據。

Prime Inference 比租 GPU 便宜嗎?

對流量起伏較大的服務,Serverless 通常更容易合理化成本;在高且穩定的使用率下,租用或保留 GPU 可能更經濟。答案取決於實測 token 用量、併發、延遲目標與閒置容量,而不只是 token 單價。

五分鐘完成 go/no-go 檢查

如果團隊需要開放模型存取、長上下文 agent 服務,或想將 Prime Intellect 的訓練技術棧一路接到正式環境,Prime Inference 值得測試。但只憑公開價目表就直接採購,時機仍未成熟。

  1. 查詢即時模型清單,記錄精確的輸入、輸出、快取與推理費率。
  2. 重播一段具代表性的長對話,測量首 token 延遲、生成速度與總計費 token 數。
  3. 在串流及非串流模式下,執行應用程式實際使用的工具 schema。
  4. 若工作負載具敏感性,應索取資料保留、區域、速率限制、SLA 與保留容量條款。
  5. 先觀察一般與尖峰流量,再將實測的 Serverless 支出與保留容量報價比較。

關鍵取捨很清楚:Prime Inference 提供可信的服務工程能力與低摩擦的 API,但價格與合約條件仍需要多做一步確認,無法只從發布頁面完成判斷。