AIREITER

Grok 4.6とOpus 5を比較:どのAPIを選ぶべきか

最終更新日: 2026-08-13 10:33:45

コーディングエージェントは、コンテキストが料金区分をまたいだ瞬間や、推論用の予算で出力上限を圧迫した瞬間に、見かけの安さが崩れます。Grok 4.6とOpus 5で迷ったら、プロンプトが200Kトークン未満のコスト重視の用途はGrok 4.6。1Mトークンのコンテキスト、128Kトークンの出力、あるいはドキュメント化されたエージェント制御が要件ならClaude Opus 5です。

xAI release notes showing Grok 4.6 API availability

まずは、どれだけの仕事をさせるかで決める

テキストを生成するコーディングエージェントやナレッジワークのエージェントが、通常200Kプロンプトトークン未満に収まるなら、Grok 4.6が現実的な標準選択です。xAIは2026年8月12日付のリリースノートで、500Kのコンテキストウィンドウ、テキストと画像の入力、テキスト出力、lowからxhighまで4段階のeffort設定を示しています。仕様を確認する際の一次情報はxAI's developer release notesです。

500Kトークンでは足りない、最大128Kトークンの出力が必要、あるいはAnthropicのフォールバックや動的なツール一覧機能に依存するワークフローなら、Claude Opus 5のほうが適しています。Anthropicは、デフォルトかつ最大1Mトークンのコンテキストウィンドウ、デフォルトで有効になるthinking、APIと主要クラウドパートナーでのclaude-opus-5の提供を案内しています。ここでは、小さなベンチマーク差よりもClaude Platform's Opus 5 documentationのほうが、導入判断に大きく影響します。

ここで参照している資料には、あらゆるコーディング作業を一律に決着させる共通ベンチマークはありません。最大プロンプトサイズ、必要な出力長、ツールの契約、そしてタスク完了までのコストを、自分の評価環境で測るところから始めてください。

スコアを見る前に、APIの制約を1枚にまとめる

Grok 4.6とClaude Opus 5はいずれも、テキストと画像を受け取り、テキストを生成します。比較で重要になるのは、コンテキスト容量、長いプロンプトの料金、出力の扱い、そして統合時の制御機能です。

APIの項目Grok 4.6Claude Opus 5
コンテキストウィンドウ500Kトークン1Mトークン
入力モダリティテキスト、画像テキスト、画像、Anthropicが説明するPDF/ドキュメントワークフロー
出力モダリティテキストテキスト
最大テキスト出力xAIのリリースノートに数値上限の記載なし128Kトークン
Effort設定low、medium、high、xhighlow、medium、high、xhigh、max
デフォルトのefforthighhigh
標準入力料金$2/M tokens$5/M tokens
標準出力料金$6/M tokens$25/M tokens
長いプロンプトのルールプロンプトが200Kトークンを超えると、入力は$4/M、出力は$12/MOpus 5のリリースドキュメントに同等のしきい値の記載なし
キャッシュ入力200K未満は$0.50/M、200K超は$1/Mキャッシュ可能なプロンプトは512トークン以上。キャッシュ料金は別途記載

表示上の単価はGrok 4.6のほうが低いものの、プロンプトが200Kトークンを超えると料金は2倍になります。Opus 5は高価ですが、ワークフローで必要になるなら、1Mのコンテキストによって分割処理や検索のオーバーヘッドを避けられます。

Claude Opus 5 API documentation

Grok 4.6では200Kトークンが料金の分岐点になる

Grok 4.6は、プロンプトが200Kトークン未満の場合、入力が100万トークンあたり$2、出力が$6です。200Kトークンを超えると、xAIの料金は入力$4/M、出力$12/Mに上がり、キャッシュ入力はそれぞれ$0.50/Mと$1/Mになります。安いほうの料金だけを見ていると、この境界を見落とします。2つの料金区分はxAI's release notesに記載されています。

表示料金で計算すると、キャッシュされていない入力100Kトークンと出力20Kトークンのリクエストは$0.32です。一方、入力250Kトークンと出力20Kトークンでは、高い料金区分が適用されて$1.24になります。ただし、これはリクエスト単体の計算です。実際のエージェント実行では、リトライ、ツール呼び出し、キャッシュされたプレフィックス、蓄積したコンテキストが請求額を大きく左右します。

最近のr/grokでの議論では、設定に依存するCursorBench 3.2の数値として、Grok 4.6 Extra Highが1タスクあたり$2.81、46ステップ、Opus 5 Maxが$8.23、78ステップだったと報告されています。ただし、これは投稿者の評価環境で得た結果であり、ベンダーに依存しない保証ではありません。同じ投稿では、Terminal-Bench 3.0でのGrok 4.6は26.0%で、名前が挙がった他のモデルを下回ったとも報告されています。

Opus 5はエージェントの組み込み方を変える

Claude Opus 5ではthinkingがデフォルトで有効です。max_tokensは内部のthinkingと目に見える出力で共有するハード上限なので、thinkingを使わないOpus 4.8向けのリクエストから移行する場合は、より大きな出力予算が必要になることがあります。Anthropicは、thinking: {"type":"disabled"}とxhighまたはmaxを組み合わせるとHTTP 400が返るとも説明しています。移行ノートが示す選択肢は2つです。thinkingを無効にするならeffortを下げるか、無効化の設定自体を削除します。

Claude Opus 5では、キャッシュ可能なプロンプトの最小長もOpus 4.8の1,024トークンから512トークンに下がりました。ベータ版の制御機能を使えば、プロンプトキャッシュを無効にせず会話の途中でツールを変更でき、管理されたfallbacks: "default"モードも利用できます。権限やツールセットが頻繁に変わるエージェントには意味のある機能ですが、単純なステートレスの補完エンドポイントには必要ありません。

Fast modeはAPI限定のリサーチプレビューで、料金は入力$10/M、出力$50/Mです。Opus 5の標準料金の2倍にあたります。Anthropicによると、Amazon Bedrock、Google Cloud、Microsoft Foundryでは利用できないため、移植性と速度を両立できるとは限りません。Anthropic's launch announcementには、標準料金として入力$5/M、出力$25/Mが示されています。

コーディングエージェントの評価は、方向性を示す材料にとどまる

Anthropicの報告では、Opus 5は最大effortでCursorBench 3.2の約70.0%に達し、1タスクあたりのコストは約$8.50でした。これは、Fable 5が報告した最高スコアを0.5ポイント以内の差で追いながら、コストはおよそ半分です。ただし、これらはAnthropicが図示した結果であり、プロバイダー横断の監査ではありません。Opus 5の発表によると、Frontier-Benchは各タスクを5回試行し、Anthropic内部の実行環境で測定しています。

コードレビューについては、より限定的ながら実務に近い測定があります。CodeRabbitは、実際のオープンソースプルリクエストから検証済みのエラーパターンをおよそ100件集め、各設定を3回ずつ実行し、フィルタリング後のレビューコメントを評価しました。xhigh effortでは、Opus 5の設定が既知の問題を55.2%検出したのに対し、本番ベースラインは61.1%でした。一方、実用的な精度は39.3%対35.2%で、nitpickはOpus 5が92件、ベースラインが23件でした。CodeRabbit's Opus 5 evaluationは、Opus 5を唯一の安全網にするのではなく、精度を重視した特定の役割で使うことを推奨しています。

この結果から導ける実務的なルールは明確です。Opus 5は複数のeffortレベルで評価し、自分のプルリクエストを使って再現率、適合率、トークン使用量、レビューのノイズを測定してください。Grok 4.6について、xAIの現行リリースノートはAPIの仕様と料金を示していますが、直接比較できるコードレビュー調査は公開していません。コーディングエージェントのスコアだけを根拠に、コードレビューでの勝利まで推測してはいけません。

導入先ごとにモデルを選ぶ

通常のプロンプトが200Kトークン未満に収まり、表示上のAPIコストを抑えたいエージェントなら、Grok 4.6を推奨します。ただし、評価予算はこの境界をまたぐ前提で組みましょう。最初のプロンプトが小さくても、ツールの出力やリトライによってリポジトリエージェントが200Kを超えることがあるためです。

アクティブなコンテキストが500Kトークンを超えるリポジトリ、ドキュメント、エージェントセッション、最大128Kトークンの出力、またはAnthropicが提供するツール変更・フォールバック制御が必要なら、Claude Opus 5を推奨します。まずはhighから始め、maxの効果を決めつける前に、低いeffortでもテストしてください。

自動コードレビューでは、一般的なコーディングベンチマークだけでモデルを選ばないでください。ラベル付きのプルリクエストを用意し、問題の再現率と誤検知の負荷を記録したうえで、同時実行、API利用、検証不備に備えた別のレビュー経路も残しておきます。CodeRabbitの評価では、テストしたOpus 5の設定でこれらのカテゴリが弱点になりました。Its category findingsは、あらゆるClaude導入に対する断定ではなく、タスクとの相性を検証する理由として読むべきです。

導入シナリオデフォルトの選択判断の決め手
200Kプロンプトトークン未満のコスト重視コーディングエージェントGrok 4.6入力$2/M、出力$6/Mという表示料金
500Kを超える長時間のリポジトリ/ドキュメントセッションClaude Opus 51Mのコンテキストウィンドウと128Kの出力上限
ツールが動的に変わるエージェントClaude Opus 5会話中のツール変更後もキャッシュを維持できるベータ機能
200Kトークン超のプロンプトが頻繁に発生するタスク両方を評価Grok 4.6は境界を超えると表示上のトークン料金が2倍になる
コードレビューパイプラインラベル付きPRで両方を評価見出しのスコアより、再現率、適合率、リトライ、レビューのノイズが重要

FAQ

Grok 4.6はOpus 5より安いですか?

プロンプトが200Kトークン未満なら、xAIのGrok 4.6は入力$2/M、出力$6/Mです。Opus 5は入力$5/M、出力$25/Mなので、この範囲ではGrok 4.6のほうが安価です。ただし、Grok 4.6の表示料金はプロンプトが200Kトークンを超えると2倍になるため、最初のリクエスト単価ではなく、タスク完了までのコストで比較してください。

コーディングにはどちらを使うべきですか?

エージェントが通常200Kプロンプトトークン未満に収まり、API料金を抑えたいならGrok 4.6を選びます。1Mのコンテキスト、128Kの出力、Anthropicのエージェント制御が必要ならOpus 5です。最終的には、実際に扱う言語、リポジトリの構成、ツールループで検証してください。

次にやるべき導入テスト

代表的なタスクを20〜50件用意し、固定したツール、リトライ回数、トークンのログ設定で各候補を同じ条件で実行します。必要な合格率を、より低いタスク完了コストで達成できるモデルを選びましょう。そのうえで、コンテキストや制御面の強みが決定的になるワークロード向けに、もう一方のモデルもルーティング先として残しておくと安心です。

関連記事:Claude Opus 5 API pricing guide、Grok 4.6 release details、Grok 4.6 vs GPT-5.6。