AIREITER

LLM APIはなぜ高い? 料金表ではなく、トークン量が原因です

最終更新日: 2026-10-01 01:53:17

Claude CodeをMaxプランで1か月使った場合の作業量をAPIの定価で計算したユーザーは、月額200ドルに対して7,470ドルという数字に行き着きました。異常なのはトークン単価ではありません。サブスクリプションが見えないところで設けていた上限が、従量課金ではなくなるからです。しかも、リポジトリを読みながら動くエージェントは、人間がチャット欄に入力するよりはるかに多くのトークンを何度も送信します。

開発者が報告している大きな差

ユーザーが投稿している比率は大きく、しかもよく似ています。r/ClaudeAIのスレッドでは、Claude Codeのセッションログをもとに、Maxの利用量を1か月あたり約7,470ドル相当のAPI定価と見積もっています。月額200ドルのサブスクリプションとの差は約37倍です。別の小規模なサブスクリプションとAPIの比較スレッドでは、同じ作業量を月5,000〜20,000ドルと見積もったユーザーもいました。

もちろん、いずれも監査済みの数字ではありません。ただし、トークンが最も膨らむパターンは共通しています。エージェントがリポジトリを何度も処理するケースです。

「会社ではClaude Code経由のEnterprise APIプランを使っていますが、大きなプロジェクトで普通にコーディングしているだけでも、1セッションあたり100〜200ドルのAPI料金は簡単に発生します」 — u/andywidjaja、r/ClaudeAI

有料プランとAPIキーは、そもそも別の商品

Anthropicは、この違いを明確に説明しています。2026年3月16日更新のヘルプセンター記事では、ClaudeのプランとClaude Consoleを「異なる目的のために設計された別々の商品」と位置付け、有料サブスクリプションには「Claude APIやConsoleへのアクセスは含まれない」と説明しています。OpenAIも同じ構造で、ChatGPTとAPIプラットフォームを別のシステムで請求しています。

比較するときは、何を販売しているサービスなのかを見るのが近道です。

有料チャットプランAPIキー
販売単位1人分の利用権トークン処理量
上限5時間単位のローリングウィンドウと週間制限バンドルされた割当量はなし。レート制限と支出上限は適用
利用方法Web、デスクトップ、モバイルアプリ自分のコード
料金体系月額固定トークン単位の従量課金
自社プロダクトへの組み込みその用途向けの商品ではないまさにそのためのもの

Claudeの料金ページによると、Proは月払いで月額20ドル、年払いでは月額17ドル(前払いで200ドル)です。Maxは月額100ドルからで、5時間のセッションごとにProの5倍または20倍の利用量が付与されます。ただし、これらのプランにメッセージ数の記載はありません。消費量は会話の長さ、モデル、機能によって変わるためです。つまり、比較しているのは「測定済みの量」と「測定されていない量」になります。

Free、Pro、Maxの各ティアを示すClaudeの料金ページ

同じページには、もう一つ重要な情報があります。Claude Enterpriseは1席あたり月額20ドルですが、利用量はAPI料金で別途請求されます。ヘビーユーザーは結局、従量課金のメーターに戻るわけです。

月額料金でAPIを使うと、どれだけのトークンになるのか

プラン料金をトークン数に置き換えると、差の大きさがはっきりします。以下は、Claudeのプラットフォーム料金ドキュメントとOpenAIのAPI料金ページに掲載された、100万トークン(MTok)あたりの公式料金です。2026年10月1日時点で確認しています。

ClaudeとOpenAIの各モデルにおける100万トークンあたりの入力・出力料金
モデル入力出力キャッシュ読み出しBatch(入力/出力)
Claude Fable 5.1$10$50$0.25$5 / $25
Claude Opus 5.5$4$20$0.20$2 / $10
Claude Sonnet 5.5$2$10$0.20$1 / $5
Claude Haiku 4.5$1$5$0.10$0.50 / $2.50
GPT-6 Astra$10$50$1.00$5 / $25
GPT-6.1 Sol$2$10$0.10$1 / $5
GPT-6 Luna$0.10$0.50$0.01$0.05 / $0.25
APIクレジット20ドルでモデルごとに購入できる出力トークン数

チャットに近い使い方で、数千語のコンテキストに対して数百語の回答を返す程度なら、Sonnet 5.5では20ドル分のクレジットで入力約1,000万トークン、または出力約200万トークンを処理できます。自分の料金は、APIレスポンスに含まれる次の4項目から計算できます。(新規入力 × 入力単価)+(キャッシュ入力 × キャッシュ読み出し単価)+(キャッシュ書き込み × 書き込み単価)+(出力 × 出力単価)。ここにBatch、長いコンテキスト、リージョンによる倍率が加わります。エンドポイントごとにこの4項目を1週間記録すれば、席単位の料金と比較できる月額の目安が出せます。

トークンはどこで増えているのか

予想外のトークン消費を生む原因は、料金表だけを見ていても分かりません。以下の4つのうち、最後の3つはLLM Cost Labによる料金表以外のコスト解説でも取り上げられています。

  1. ターンのたびに再送される会話履歴。リクエストベースのチャット連携では、クライアントが会話履歴を毎回送信します。つまり20ターン目には、1〜19ターン目の内容も一緒に送られます。各ターンで同じ程度のコンテキストが追加されると、入力量は会話の長さに対しておおむね二次関数的に増加します。そのため、同じ解説では20ターンのセッションを、独立した呼び出しとして予算化した0.063ドルに対し、0.163ドルと見積もっています。差は2.6倍です。
  2. 呼び出しのたびに積み上がるシステムプロンプト。2,000トークンのシステムプロンプトを100万回送れば、ユーザーが何も入力しなくても入力トークンは20億に達します。
  3. 見えない推論トークン。内部の思考過程を出力トークンとして課金するモデルでは、非表示のトークンが見えている回答の数倍に膨らむことがあります。返却された文字数だけを見ていると、請求額を過小評価します。
  4. ツール結果、リトライ、破棄した生成結果。モデルが生成したものには料金が発生します。JSONバリデーターに弾かれた回答も、競合させた結果として捨てた並列リクエストも例外ではありません。

安いトークンでも、量が多ければ請求額の大半を占めます。利用ダッシュボードを見たユーザーが混乱しやすいのはこの点です。7,470ドルのスレッドでは、あるコメント投稿者が、キャッシュ読み出しが合計の48%を占めていることに気付きました。料金表上では最も安いトークン種別です。

「API上ですでに最も安いトークン種別なのに、それでも定価ベースで支配的ということは、実際のワークロードの大半が毎ターン同じコンテキストを読み直しているということです」 — u/YoanEdwin、r/ClaudeAI

Opus 5.5で、リポジトリのコンテキスト150,000トークンと、毎ターン2,000トークンの出力を含むエージェント処理を計算すると、構造が見えてきます。

Opus 5.5、60ターンのセッション、各ターン150kコンテキスト+2k出力料金
毎ターンの新規入力、キャッシュヒットなし(150k @ $4)$0.60
新規入力の代わりに毎ターンキャッシュ読み出し(150k @ $0.20)$0.03
毎ターンの出力(2k @ $20)$0.04
セッション中に1時間キャッシュを書き込む(150k @ $8)$1.20
セッション合計、キャッシュなし$38.40
セッション合計、キャッシュあり$5.40

キャッシュを使ったセッションを1日2回、月22営業日続けると、約238ドルです。すでに月額200ドルのプランを超えています。同じ条件でキャッシュを使わなければ、月額は1,600ドルを超えます。単価は変わっていません。変わったのはトークン量です。

比較すべきは2段階ではなく3段階

多くの比較は「プランかAPIか」で終わります。しかし、もう一つの段階があります。プランの割当量を使い切った後に購入する、サブスクリプション内の追加利用クレジットです。

r/codexの報告によると、この段階は生のAPI料金より高くなることがあります。あるProユーザーは、購入したクレジットで約16Mトークンを消費し、その料金が約40ドルだったと記録しています。同じ量をAPIの定価で処理した場合は、約12ドルと見積もりました。

「クレジットの価格設定は、ほとんど搾取的と言っていい。APIなら2ドル程度なのに、ランディングページ1枚で50ドルは absurd です」 — u/AbjectBug5885、r/codex

これらはユーザーによる見積もりであり、すべてのケースに共通する料金ではありません。追加購入の価格はベンダーやプランによって異なります。上記のCodexのケースでは、追加購入の段階が、同じAPI利用量の定価に対しておよそ3倍でした。2週目もクレジットを買う前に、自分の利用量で比較しておく価値があります。

請求額を動かす5つの方法

以下の施策はいずれも公式料金に基づいているため、まずベンダーの料金ページと照合できます。

  1. 書き込み料金まで含めてプロンプトキャッシュを使う。Anthropicの料金ドキュメントによると、5分キャッシュの書き込みは通常の入力料金の1.25倍、1時間キャッシュは2倍です。読み出しは通常の0.1倍で、Opus 5.5では0.05倍、Fable 5.1では0.025倍です。5分キャッシュは1回読み出せば元が取れ、1時間キャッシュは2回で元が取れます。一度書き込んだだけで読まなければ、キャッシュしないより高くつきます。また、キャッシュを有効にするだけでなく、並べる順番も重要です。変わらない内容を先に、ユーザーごとに変わる部分を後ろに置かないと、プレフィックスが一致しません。ヒット率の確認方法はこちらのプロンプトキャッシュ解説で説明しています。
  2. 待てる処理はBatchに回す。両社とも非同期処理では定価から50%値引きされます。Opus 5.5は$2/$10、Sonnet 5.5は$1/$5です。ただし、対応状況にはばらつきがあります。LLM Cost Labによると、追跡している83モデルのうち、割引されたBatchティアを提供しているのは26モデルです。Batch前提で設計する前に、自分のモデルが対応しているか確認してください。仕組みはBatch APIの料金解説で紹介しています。
  3. タスクに合わせてモデルを使い分ける。分類、ルーティング、検索結果の判断に、最上位モデルが必要とは限りません。10トークンを出力するだけの処理でも、Haiku 4.5の$1/$5とFable 5.1の$10/$50では10倍の差があります。
  4. max_tokensだけでなく、出力内容そのものを絞る。上の表では、ほぼすべてのモデルで出力料金が入力料金の5倍です。前置きを禁止するスキーマを使えば、構造上のわずかなオーバーヘッドと引き換えに、不要な文章への課金を避けられます。max_tokensは書式を整える機能ではなく、安全上限として使う方が適しています。回答が途中で切れると、2回目の有料リクエストが必要になる可能性があるためです。
  5. 上乗せされる倍率を見落とさない。OpenAIの長文コンテキストティアでは短いコンテキストの入力料金が2倍になり、Fastモードでは標準料金がさらに2倍になります。Anthropicは米国リージョン固定の推論に1.1倍を適用します。また、料金ドキュメントによれば、Claude 4.7以降では新しいトークナイザーが使われ、同じ文章でもトークン数が約30%増えます。プロンプトは変わっていなくても、メーターの方が変わることがあります。

この一覧とは別に、構造面での選択肢もあります。ベンダーごとに請求関係を持つのではなく、プログラムからの通信を一つの従量課金エンドポイントに集約する方法です。AIReiterのClaude APIエンドポイントはそのためのものです。定価で、Sonnetクラスの入力40Mトークンと出力8Mトークンを1か月使うと、$80 + $80です。2つ目の席を追加するべきかどうかは、1分ほどで比較できます。

どちらを選ぶべきか

利用状況選ぶもの理由
チャット、調査、アプリ内でのたまのコーディング有料プランのみ支出に上限があり、アプリも含まれ、利用量がプラン上限を大きく下回る
1台のマシンで個人開発のエージェントコーディングまずプラン、超過分は従量課金キー大部分はプランで吸収し、週間リセットを待たずにキーで補える
他人が使うプロダクトを提供するAPIのみ席でカバーできるのは1人の人間だけで、ユーザーには別途処理量が必要
評価、バックフィル、分類などの定期的な一括処理Batchティア付きのAPI定価から50%安く、レイテンシーも問題にならない
ほとんど毎週、追加クレジットを購入している超過分をAPIキーと比較する報告例では、クレジット料金がAPI定価を上回っていた

FAQ

ChatGPTやClaudeの有料プランにAPIクレジットは含まれますか?

含まれません。Anthropicのヘルプセンターは、有料Claudeプランには「Claude APIやConsoleへのアクセスは含まれない」と明記しています。OpenAIもChatGPTとAPIプラットフォームを別々のシステムで請求しています。両方を使う場合は、2つの請求項目が発生します。

見えていない推論トークンにも料金はかかりますか?

思考や拡張推論を提供するモデルでは、かかります。これらのトークンはレスポンス本文には表示されなくても、出力料金で課金されます。usageオブジェクトを確認してください。

毎ターン、会話全体に対して料金がかかりますか?

繰り返されるプレフィックスがキャッシュヒットしない限り、かかります。サーバー側の状態保持機能がなければ、クライアントはモデルに見せたい履歴を毎回再送します。その履歴はモデルの料金に基づく新規入力として、またはプレフィックスが一致した場合はキャッシュ読み出しとして課金されます。

失敗したリクエストやリトライにも料金はかかりますか?

LLM Cost Labの請求に関する解説によると、モデルに到達してレスポンスが返ったリクエストは、スキーマエラーやクライアントのタイムアウト後にアプリケーションが結果を破棄しても課金されます。生成前に拒否されたリクエストは例外です。

まだ解決されていないトレードオフ

プランは支出に上限を設ける代わりにアクセスを制限し、従量課金のキーはその逆です。プランの割当量が何トークンに相当するのかは公開されていないため、「自分にとってどちらが安いのか」を判断するには、実際の通信を1週間計測し、上の料金表に当てはめる必要があります。

関連記事: 2026年、最安のLLM API · Claude API料金ガイド