Prime Inferenceはすでに提供が始まっている。OpenAI互換で、単なる「今後登場予定」の製品ではなく、継続的にトラフィックが流れるエージェント用途を想定した推論基盤だ。ただし料金の見通しは少し複雑である。Prime Intellectのローンチ記事はサービング基盤を詳しく説明している一方、モデル別の完全な料金表は一般的な公式料金ページよりも、現時点では公開料金ディレクトリで見つけやすい。
正式提供は開始済み。料金情報は複数の場所に分かれている
Prime Intellectは2026年10月2日にPrime Inferenceを正式リリースした。需要が変動するワークロード向けのサーバーレスエンドポイントと、継続負荷向けのリザーブドキャパシティを用意する。パブリックAPIは背後のモデル群から切り離されており、容量の移動や障害が発生してもクライアント側のエンドポイントを変えずに済む設計だ。
これはウェイトリスト型の発表ではない。Prime Intellectによると、最初のパブリックデプロイであるGLM-5.3は9月22日にOpenRouterで公開済みで、直接利用するクライアントはOpenAI互換SDKの接続先をhttps://api.pinference.ai/api/v1に設定できる。
料金面の注意点は明快だ。公式ローンチページでは統合請求とチーム単位の利用状況追跡を案内しているものの、完全な料金表は公開していない。支出を確定させる前に、現在のモデル料金は認証済みダッシュボードまたはmodelsエンドポイントで確認する必要がある。公開ディレクトリは有用なスナップショットではあるが、契約上の見積もりではない。
Prime Inferenceの現行料金
Prime Inferenceの料金はモデルごとの従量課金で、入力トークンと出力トークンは別々に請求される。出力は入力の数倍の単価になることがあるため、長い回答を生成するコーディングエージェントや推論ワークロードでは、入力単価だけが安く見えても判断を誤りやすい。
以下は、endpoints.runのPrime Intellectカタログを2026年10月3日に記録した時点のスナップショットである。同カタログには64エンドポイントが掲載されていた。購入前に、各料金をPrime Intellect側で確認してほしい。
| モデルID | 入力/100万トークン | 出力/100万トークン | 掲載コンテキスト長 | 向く用途 |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | 分類、シンプルな抽出 |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | 低コストな長文脈の汎用処理 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | 高速なエージェント/ツールワークフロー |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | コーディング、ツール利用 |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | 長文脈推論、ビジョン |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | 最上位GLMを使うエージェントワークロード |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | 高度な推論 |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | 高品質な長文脈タスク |
別のディレクトリであるCompute Pricesは同日、111モデルを表示しており、Llama 3.2 1Bの入力100万トークン当たり最安値は正確に$0.027だった。カタログ件数が食い違う以上、どちらのディレクトリも固定された在庫一覧として扱うのではなく、ライブAPIを照会すべきだ。掲載内容には名前空間やゲートウェイ経由のモデルの違いがあり、更新タイミングも異なり得る。
現実的な3つの料金試算
トークン料金は次の式で見積もれる。
(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)
| 月間ワークロード | モデルとトークン量 | 推定トークン料金 |
|---|---|---|
| 軽量なサポートボット | Qwen3.7 Flash、入力50M+出力10M | $2.80 |
| コーディングエージェント | Qwen3 Coder Next、入力100M+出力40M | $90.00 |
| 出力比率の高い最上位エージェント | GLM-5.3、入力200M+出力100M | $720.00 |
この計算に含まれるのは掲載済みのトークン料金だけである。リザーブドキャパシティの契約、サンドボックス実行、トレーニング、評価、GPUレンタルは含まれない。Prime Intellectではこれらを別サービスとして販売しているため、エージェントをエンドツーエンドで運用する場合の請求額は、推論トークン料金だけでは済まない可能性がある。
長文脈対応だからといって、すべてのリクエストで100万トークンを消費するわけではない。課金対象は実際に処理されたトークン数だ。ただし、140Kトークンの履歴を毎回再送するエージェントは、プレフィックスキャッシュやアプリケーション側のコンテキスト管理で重複処理を減らさない限り、入力料金が急速に積み上がる。
API移行はエンドポイントの差し替えが中心
Prime InferenceはOpenAI互換エンドポイントを提供するため、既存のOpenAI SDK連携で必要になる変更は、通常、base URL、APIキー、モデル識別子のみだ。Prime Intellectのローンチ記事では、base URLとしてhttps://api.pinference.ai/api/v1が案内されている。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
cURLでは次のようにリクエストできる。
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime IntellectはCLIでの利用手順も案内している。primeツールをインストールし、prime loginで認証してからprime inference chatを実行する。本番投入前には現在のモデル一覧を取得し、正確なモデルIDをコピーして使いたい。ディレクトリごとに接頭辞が異なる場合があるためだ。
エージェント運用で効いてくるローンチ時のアーキテクチャ
Prime Inferenceの差別化が特に現れるのは、プロンプトが長く、セッションが繰り返し戻り、ツール呼び出しの正しさを維持しなければならない場面だ。Prime Intellectによれば、典型的な社内エージェントの1ターンでは140Kトークンのプロンプトに約6Kトークンが加わる。この条件では、生のデコード速度と同じくらいキャッシュ保持とルーティングが重要になる。
公式ローンチレポートでは、GB200 NVL72ハードウェア上で実行したGLM-5.3デプロイについて、以下の具体的な測定値を公表している。
- Prime Intellectのテストでは、prefillワーカーとdecodeワーカーを分離することで、p90のトークン間レイテンシが約40%低下した。
- ユーザー当たりエンドツーエンドで毎秒100トークンを目標にした場合、テストした1:4のprefill/decodeトポロジーは、prefillグループ当たり66セッションを、ユーザー当たり毎秒101トークンで処理した。
- GPU当たりのprefill予算を8Kトークンから4Kトークンへ下げると、中央値のキュー待ち時間は550 msから110 msに短縮され、最初のトークンが返るまでの中央値も約20%減少した。
- NVFP4圧縮により、同じメモリ予算でデコーダー当たりのキャッシュ容量は109万トークンから163万トークンへ、約50%増加した。
- 別のTP8比較では、block-majorキャッシュレイアウトにより転送ディスクリプタ数が約10分の1となり、平均転送時間は146 msから78 msへ短縮された。
これらはワークロードと構成に依存する数値であり、普遍的なレイテンシ保証ではない。実用上の価値は、Prime Intellectが最適化対象として何を捉えているかを示している点にある。再訪セッションでのキャッシュ再利用、受け入れ待ち、prefillとdecodeの干渉、そしてキャッシュ転送のオーバーヘッドだ。
ツール利用は別途テストしたい。Prime Intellectは、未宣言のツールが黙って破棄されるケースや、引数の型が不正になるケースを確認し、GLMのサービングパスに制約付きデコードとスキーマテストを追加したという。同社はツール呼び出しエラー率がほぼゼロだと報告しているが、本番トラフィックを切り替える前に、ネストしたスキーマ、nullableな引数、ストリーミング呼び出し、不正なリクエストを自社環境で再現して検証すべきである。
サーバーレスかリザーブドかは、トラフィックの形で決める
多くのチームでは、需要の不確実性をトークン課金へ置き換えられるサーバーレスが妥当な出発点になる。持続的な同時実行数、予測可能なレイテンシ、カスタムデプロイがアイドル容量を避けることより重要になると、リザーブドキャパシティが選択肢に入る。
| ワークロード | 最初に選ぶべき選択肢 | 理由 |
|---|---|---|
| プロトタイプまたは断続的なチャットボット | サーバーレス | アイドル状態のGPUを予約する必要がない |
| 突発的に走る評価ジョブ | 当面はサーバーレス | 低価格のバッチ/非同期推論は、現行のローンチ機能ではなくロードマップ上の項目として掲載されている |
| 安定して高い同時実行数のエージェントサービス | リザーブドの見積もり | 名目上のトークン単価よりキャパシティ計画が重要になり得る |
| ファインチューニング済みまたはLoRAモデル | まず提供可否を確認 | ファインチューニング済みモデルのワンクリック専用デプロイは、ローンチ記事ではロードマップ項目とされている |
| 厳格な契約SLAまたはリージョン要件 | 営業との確認 | 公開ローンチ資料には、共通の契約内容、リージョン一覧、標準リザーブド料金が示されていない |
「リザーブドなら自動的に安い」とは考えないほうがよい。アイドル時間とピーク時の余裕を含め、代表的な同時実行数におけるサーバーレスの実測支出と、提示されたキャパシティ料金を比較する必要がある。
Prime Intellectが公開情報で明確にしていない点
Prime Inferenceはインフラに関する開示が非常に詳しい一方、購入判断に関わるいくつかの事項は、公開されインデックスされた資料では依然として不明確だ。
- モデル別の完全な公式料金表
- 全モデルにおけるキャッシュ済み入力と推論トークンの課金ルール
- 公開されているレート制限と同時実行数制限
- リージョンごとの処理マップ
- 推論リクエストに関する標準のデータ保持条件
- 共通の正式SLAと救済措置
- リザーブドキャパシティの最低利用条件と料金
- カタログ上のどの項目がPrimeによる直接ホスティングで、どれがルーティングされたゲートウェイモデルなのか
不明だからといって、未対応という意味ではない。OpenAI互換という事実から推測するのではなく、ダッシュボード、ドキュメント、モデルエンドポイント、契約書、営業回答で確認すべき項目だという意味である。
Prime Inference FAQ
Prime Inferenceは正式に利用できますか?
はい。Prime Intellectは2026年10月2日にパブリックリリースを発表し、API base URL、CLIコマンド、サーバーレス/リザーブドの製品区分を公開した。
Prime Inferenceに無料枠はありますか?
公開ローンチ記事では、Prime Inference向けの無料クレジットは明記されていない。Prime Intellectのトレーニングスタックには無料またはゼロ価格の選択肢があるが、それを推論の無料枠と見なすべきではない。
Prime InferenceはOpenAI SDKに対応していますか?
はい。OpenAI互換base URLをhttps://api.pinference.ai/api/v1に設定し、Prime APIキーと現在利用可能なモデルIDを指定すればよい。
Prime Inferenceはツール呼び出しに対応していますか?
GLM-5.3のサービングパスはツール呼び出しに対応しており、Prime Intellectは引数スキーマ向けの文法強制と回帰テストについて説明している。ただしモデルによって機能は異なるため、対応状況はモデルごとに確認したい。
利用可能なモデル数はいくつですか?
公開ディレクトリでは、2026年10月3日時点で64件と111件のエントリーが表示されていた。件数に差があるため、アカウントで実際に利用できるモデルの一覧は、ライブのPrimeモデルエンドポイントまたはダッシュボードで確認するのが確実だ。
Prime InferenceはGPUレンタルより安いですか?
トラフィックが変動する場合はサーバーレスのほうが導入しやすいのが通常であり、高く安定した利用率なら、レンタルGPUやリザーブドGPUが経済的になることがある。答えはトークン単価だけでは決まらず、実測トークン数、同時実行数、レイテンシ目標、アイドル容量に左右される。
5分でできるGo/No-Goチェック
オープンモデルへのアクセス、長文脈エージェントのサービング、あるいはPrime Intellectのトレーニングスタックから本番環境へ進む経路を必要とするチームにとって、Prime Inferenceは試す価値がある。ただし、公開料金表だけを根拠にそのまま調達を進められる段階ではない。
- ライブのモデル一覧を照会し、正確な入力、出力、キャッシュ、推論の各料金を記録する。
- 代表的な長い会話を再生し、最初のトークンまでのレイテンシ、生成速度、請求対象となった総トークン数を測定する。
- アプリケーションで実際に使うツールスキーマを、ストリーミングと非ストリーミングの両方で実行する。
- ワークロードに機微性がある場合は、保持期間、リージョン、レート制限、SLA、リザーブドキャパシティの条件を確認する。
- 通常時とピーク時のトラフィックを観測してから、実測したサーバーレス支出とリザーブド見積もりを比較する。
判断の軸ははっきりしている。Prime Inferenceには信頼できるサービングエンジニアリングと導入しやすいAPIがある一方、料金と契約条件の確認には、ローンチページを見るだけでは済まないもう一段の作業が必要だ。