AIREITER

Grok 4.6 vs DeepSeek V4 Pro:5.7倍のコスト差を実測比較

最終更新日: 2026-08-13 03:12:32

料金を重視するならDeepSeek V4 Pro、応答速度を優先するならGrok。この結論は、両APIに同じ7つのタスクを通した比較で変わらなかった。ただし、この判断には大きな留保がある。DeepSeek自身が価格ページで大幅値上げを予告しており、実施されれば、この推奨の前提となるコスト差の大半は縮まる可能性がある。

2026年8月時点で比較しているもの

今回比較した両モデルは、いずれも直前の週に実質的な更新を受けている。Grok 4.6はxAIのモデルドキュメントでLatest枠に入り、「コードからその他すべてまで」対応するフラッグシップとして掲載された。一方のDeepSeek V4 Proは、現在DeepSeek-V4-Pro-0813スナップショットとして提供されている。どちらもAPIのモデルIDには変更が現れない。

xAI documentation listing Grok 4.6 in the Latest slot with 500k context, $2.00 input and $6.00 output per 1M tokens

DeepSeekのバージョン文字列を確認できるのは、価格ページのMODEL VERSION行だけだ。APIでは日付サフィックスなしのdeepseek-v4-proを指定し続ける。そのため、今日送ったリクエストも7月に送ったリクエストもログ上は同じに見える一方で、実際には異なる重みを呼び出している可能性がある。

DeepSeek API pricing page showing MODEL VERSION DeepSeek-V4-Pro-0813 for the deepseek-v4-pro endpoint

以下は、2026年8月13日にxAIの価格ページとDeepSeekの価格ページから確認した仕様と料金の全比較だ。

Grok 4.6DeepSeek V4 Pro (0813)
コンテキストウィンドウ500K1M
最大出力未公表384K
入力 / 1M$2.00$0.435
キャッシュ済み入力 / 1M$0.50$0.003625
出力 / 1M$6.00$0.87
長文コンテキスト料金プロンプトが200K以上で全料金が2倍なし
画像入力対応非対応
ツール呼び出し対応対応
推論設定可能Thinking / non-thinking
知識カットオフ2026年2月1日未公表

Grok 4.6は、Grok 4.5の主要料金である入力$2.00、出力$6.00を維持した。変わったのはキャッシュ済み入力だけで、同じxAIの表ではGrok 4.5が$0.30、Grok 4.6が$0.50となっている。新モデルではキャッシュ再利用のコストが67%上がった計算だ。

外部ゲートウェイではGrok 4.5のままのケースもある

xAIのドキュメントに掲載されたからといって、トークンを購入するすべての経路で使えるとは限らない。今回テストしたゲートウェイでは、grok-4.6はmodel_not_foundエラーを返した。grok-latestとgrokのエイリアスはいずれもgrok-4.5-buildに解決された。xAIの公式APIではなくリセラー経由でGrokを使う場合、バージョンを決めつける前に、エイリアスの実際の解決先を確認したほうがよい。

以下の測定をGrok 4.6ではなくgrok-4.5で実施した理由も、この提供遅延にある。両バージョンは入力・出力料金が同一なので、コストに関する結論は引き継げる。ただし、タスクごとの精度結果は4.5のものだ。

差が出たのは指示への追従性だった

機械的に正誤判定できる7タスクでは、6件が同等で、1件だけが明確に分かれた。そのタスクでは「ちょうど4行で、それぞれの行をちょうど5語の説明で終える」よう求めた。DeepSeek V4 Proは5回中5回成功し、Grokは5回中0回だった。

Grokの失敗は、同じ不具合の繰り返しではない。2回は回答の代わりに、生のweb_searchツール呼び出しを本文として出力した。そのうち1回の出力全文は、「I need accurate information on the four stages of canary deployment. Let me search for that.」だった。別の2回では4行という形式こそ守ったが、説明の語数を4語と6語に誤った。さらに1回は130秒、10,357出力トークンを費やし、331行を返した。

ツール呼び出しの漏出はモデル自体ではなく、ゲートウェイに起因する可能性が高い。6トークンのプロンプトが、報告上は201入力トークンへ膨らんでおり、xAIのサーバーサイドツールを宣言する前置きが注入されていることを示唆する。一方、語数の誤りは別問題だ。該当の実行は通常どおり回答していたにもかかわらず、制約を落としている。

方法:同じOpenAI互換ゲートウェイで、デフォルト設定のdeepseek-v4-proとgrok-4.5を使用した。形式タスクのみ各モデル5回、それ以外は各タスク1回ずつ実行した。すべてのタスクに機械判定可能な正解を用意しており、採点にジャッジモデルは使っていない。同等だった6タスクの名称は、下のコスト表に掲載している。

両モデルとも誤った前提を受け入れた

7つ目のタスクでは、プロンプトに2つの誤情報を仕込んだ。DeepSeek V4 Proのコンテキストウィンドウは128K、Grok 4.6は2026年1月に2Mコンテキストでリリースされた、というものだ。そのうえで、900,000トークンのコーパスにはどちらを使うべきかを尋ねた。どちらのモデルも数値の誤りを指摘せず、誤った前提から筋道立ててGrokを自信を持って推奨した。

古い仕様をプロンプトに貼り付けて推奨を求めても、両モデルは入力を訂正するのではなく、もっともらしく論じられた誤答を返してくる。

Grokは出力トークンが少なくても、コストは5.7倍

両モデルが完了した6タスクの合計では、Grokの出力は5,275トークン、DeepSeekは6,331トークンだった。Grokは17%少ない。それでも各モデルの公式出力料金で計算すると、同じ回答にかかる費用はGrokが$0.0317、DeepSeekが$0.0055となり、Grok側が5.7倍高い。

Grouped bar chart of output cost per task in US cents, DeepSeek V4 Pro versus Grok, across six tasks
タスクDeepSeekトークンGrokトークンDeepSeekコストGrokコスト
厳格なJSON1472190.013¢0.131¢
範囲のマージ3844160.033¢0.250¢
56K needle1811740.016¢0.104¢
料金計算5206470.045¢0.388¢
時間表記パーサー4,0872,6110.356¢1.567¢
SQL集計1,0121,2080.088¢0.725¢
合計6,3315,2750.551¢3.165¢

トークン効率の差は実在するが、それだけでは覆せない。時間表記パーサーではGrokが2,611トークン、DeepSeekが4,087トークンで、Grokのほうが簡潔だった。それでも、その回答のコストはGrokが4倍高かった。

1か月の実運用に当てはめても、計算は単純だ。キャッシュなしの入力50,000トークン、出力3,000トークンのリクエストを1,000回送ると、入力は50M、出力は3Mになる。Grok 4.6では入力$100.00と出力$18.00、合計$118.00。DeepSeek V4 Proでは入力$21.75と出力$2.61、合計$24.36だ。

Grokは6タスクすべてで高速だった。タスクが長くなるほど差も広がり、時間表記パーサーでは48.8秒対83.3秒、JSONタスクでは3.7秒対5.4秒だった。ただし共有ゲートウェイ上での単発実行であるため、小さな差はノイズとして扱い、大きな差は傾向として見るべきだ。

Grouped bar chart of measured end-to-end latency in seconds for DeepSeek V4 Pro and Grok 4.5 across six tasks

仕様表には載らない、請求額を左右する2つのルール

実際の請求額を左右する料金の仕組みが2つある。いずれも、仕様比較表の列だけでは見えてこない。

xAIの長文コンテキスト閾値は段階制ではなく、境界をまたぐと跳ね上がる。プロンプトが200,000トークンに達したリクエストは、その超過分だけでなく、リクエスト内のすべてのトークンが2倍料金になる。199,000トークンのプロンプトの入力料金は$0.398だが、201,000トークンでは$0.804。1%の超過で請求額は2倍になる。

DeepSeekのキャッシュ料金はほぼ無視できる水準だ。キャッシュヒットは入力100万トークンあたり$0.003625で、Grok 4.6の$0.50と比べて約138分の1。安定したコードベースを相手に繰り返し作業するなら、請求額を決めるのはこの数字だ。Hacker Newsでは、ある開発者が次のように報告している。

同じコードベースで長時間のセッションを継続して使うと、DeepSeek公式APIのキャッシュヒット率は99%を超えるため、フロンティアモデルよりずっと安い。claude codeで200Mトークンのセッションの例がある。

ただし、DeepSeekの料金は明確に暫定扱いだ。価格ページの脚注には「We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.」とある。DeepSeekのプロモーション料金をHacker Newsで分析した投稿では、割引前の料金を入力$1.74、出力$3.48としている。$0.435と$0.87はいずれもそのちょうど4分の1なので計算上は整合するが、DeepSeekはプロモーションの条件を公表していない。

仮に値上げ後の料金がその水準になれば、先ほどの月次シナリオは$24.36から$97.44へ上がり、Grokの$118.00に近づく。出力価格の差は6.9倍から約1.7倍に縮まり、価格だけで選ぶ判断はもはや明白ではなくなる。

結局どちらを使うべきか

大量処理、コスト重視、繰り返しコンテキストの用途ならDeepSeek V4 Pro。バッチ処理、単一リポジトリに対する長時間のエージェント型コーディング、そしてGrokの閾値で料金が2倍になるプロンプト200Kトークン超のワークロードに向く。1Mのコンテキストウィンドウとほぼ無料のキャッシュが効き、厳密な出力形式も5回すべてで守った。DeepSeek V4 Pro API pageから直接実行できる。

低レイテンシとマルチモーダル用途ならGrok 4.6。Grokは全タスクで高速だった。ただし速度と形式テストの結果は4.6ではなく4.5で測定したものだ。DeepSeekが対応しない画像入力を受け付け、知識カットオフも2026年2月1日と公表されている。ゲートウェイ経由で利用するなら、4.5ではなく4.6を受け取っていることを確認したい。Grok on AIReiterを含むすべてのリセラーは、上流で接続されているバージョンをそのまま引き継ぐ。

発表された料金だけを根拠に、どちらかを選んではいけない。DeepSeek自身の脚注が示すとおり、現在の優位性は変動する前提だ。Grokも4.5から4.6への移行でキャッシュ済み入力料金をすでに67%引き上げた。ワークロードを固定する前に、上記の計算を最新の価格ページでやり直すべきだ。

FAQ

Grok 4.6は実際にリリースされている?

はい。2026年8月13日時点で、Grok 4.6はxAIのモデルドキュメントでLatestに掲載されている。公表料金は入力100万トークンあたり$2.00、出力100万トークンあたり$6.00で、コンテキストウィンドウは500Kだ。ただし外部ゲートウェイでは、grok-latestが依然としてGrok 4.5へルーティングされる場合がある。

DeepSeek-V4-Pro-0813とは?

DeepSeekがdeepseek-v4-pro APIエンドポイントの背後で現在提供しているモデルバージョン文字列であり、公式価格ページのMODEL VERSION行に記載されている。API IDには日付サフィックスがないため、リクエストを変えずにスナップショットだけが切り替わる可能性がある。

コンテキストウィンドウが大きいのはどちら?

DeepSeek V4 Proだ。Grok 4.6の500Kに対して1Mトークンである。DeepSeekは最大出力384Kも公表しているが、xAIはGrok 4.6の最大出力を公表していない。

DeepSeek V4 ProはGrok 4.6より安い?

2026年8月13日のリスト料金では、はい。入力は4.6倍、出力は6.9倍安い。もっとも、DeepSeekの価格ページは大幅値上げを警告しており、開発者が特定したプロモーション前料金になれば、出力料金の差は約1.7倍まで縮む。

指示により確実に従うのはどちら?

差が出た唯一のテストでは、DeepSeek V4 Proは厳密な形式制約を5回中5回守り、Grokは5回中0回だった。一方で、プロンプトに埋め込んだ誤った仕様については、両モデルとも指摘できなかった。


関連記事: GPT-5.6 Luna vs DeepSeek V4 Pro