AIREITER

Grok 4.6 vs Fable 5:コーディング性能は互角、コンテキストは半分、料金は6分の1

最終更新日: 2026-08-13 11:14:33

コーディングエージェントとしてのCursorBenchでは、Grok 4.6 Extra Highが70.8%、Fable 5 Maxが70.5%だった。同じエージェントハーネスでの比較なら、実質的には引き分けと見てよい。一方、完了タスクあたりのコストはGrokが$2.81、Fableが$17.32。性能が拮抗する中で、コストには約6倍の開きがある。ただし総合的な知能指数ではFable 5がなお上位で、コンテキストウィンドウも2倍だ。

Grok 4.6でFable 5との差はどこまで縮んだか

2か月前なら、この比較の答えはもっと明確だった。2026年7月、Artificial AnalysisのIntelligence Indexでは、Grok 4.5が56、Fable 5が62。6ポイント差でFable 5がリードしていた。2026年8月に登場したGrok 4.6は、報告されたベンチマーク差分から推定すると約5ポイント伸びて~59に到達し、GPT-5.6 Solとほぼ並んだ。Fable 5との差は約3ポイントまで縮小した計算になる。

コーディングエージェントの比較では、さらに差が詰まっている。Fable 5は2026年6月にCursorへ登場し、CursorBenchで72.9%という当時の最高スコアを記録した(r/accelerate)。それまでの最高値を8ポイント上回る結果だった。Grok 4.6のリリース後、8月にr/cursorへ投稿された直接比較では、Grok 4.6 Extra Highが70.8%、Fable 5 Maxが70.5%を記録。同一のエージェントハーネス内では、ほぼ同点といえる。もっとも、この比較を実行したCursorユーザーは重要な留保も示している。

「Grok 4.6を見て考え込んだ。CursorBenchの結果は、どこまでがモデルの実力で、どこまでがハーネスの力なのだろう?」 - r/cursor thread, August 2026

ベンチマークスコアが測るのは、基盤モデル単体ではない。プロンプトの足場、ツール、リトライを含むエージェントスタック全体だ。加えて、Fable 5のローンチ時の72.9%と8月時点の70.5%は異なる構成で得られた数値なので、どちらも方向性を示す材料として扱うべきだろう。

完了タスク単価ではGrok 4.6が圧倒的に有利

8月の比較で特に注目すべきなのは、タスク単価の差だ。

指標(CursorBench)Grok 4.6 Extra HighFable 5 Max
スコア70.8%70.5%
タスクあたりのコスト$2.81$17.32
タスクあたりのステップ数4672

Fable 5はほぼ同じスコアに到達するまでに、57%多いエージェントステップを必要とした。その追加ステップと、そこで消費される推論トークンがコスト差につながっていると考えられる。このため、両モデルを使い分ける開発者の間では、そもそも表示上のトークン単価で比較することへの疑問も出始めている。

「$/tokenは、AIエージェントを比較する尺度として間違いつつある。」 - r/grok thread title, August 2026

CursorBench score vs cost per task: Grok 4.6 at 70.8% and $2.81, Fable 5 at 70.5% and $17.32

トークン単価の公表価格も、この差を部分的に説明できる。Fable 5はAnthropic APIで、入力100万トークンあたり$10、出力100万トークンあたり$50。Grok 4.5のxAI API公表価格は、200Kトークン以下のプロンプトで入力$2、出力$6だった。xAIは4.6専用の料金表を公表していないが、r/grokコミュニティでは4.6を「API価格のごく一部でSol級の性能」と報告している。Fable 5の各ティアにおける料金は、Fable 5 API pricing breakdownを参照してほしい。

ただし、実運用ではこの優位性が縮まる場面もある。xAIの公表価格によれば、Grokは200Kトークン超のプロンプトで料金がおおむね2倍になる(このティアでは100万トークンあたり入力$4、出力$12)。また、ワークフローの大半をFable 5に依存しているなら、モデルを切り替える前にFable 5 token costsを削減する構造的な方法もある。

Fable 5がまだ優位な領域

領域根拠実務での意味
知能指数Fable 5はAA Intelligence Indexで依然1位。62に対し、Grok 4.6はおよそ594.6で差は縮んだが、以前の6ポイント差のうち3ポイントは残っている
コンテキストウィンドウFable 5は1,000,000トークン、Grokは500,000トークン大規模リポジトリとタスク履歴を一度に収めやすく、200K超のティアではGrokの価格優位も小さくなる
最難関タスクの信頼性TryAIのビルドテストでは、Fable 5は初回で3Dルービックキューブを描画し、最良のSVGを生成。Grok 4.5は再実行が必要だった。Goldie Benchでは、47件のワンショットタスク中、Fable 5が20対17でリードし、シェーダーとGPU物理演算のビルドでは0.8~1.6ポイント上回った曖昧で一発勝負のタスクでは、Fable 5の推論能力の上限が表れる

速度・レイテンシ・スループットの比較

TryAIの測定値は、同一プロバイダ経由、400トークン上限、プロンプト種別ごとに3回実行という条件のものだ。

指標Grok 4.5Fable 5
最初のトークンまでの時間0.44秒3.47秒
スループット110 tok/s28 tok/s
返信あたりのコスト$0.00002$0.00009
成功率100%100%

Grokの生成速度は110 tok/sで、GPT-5.5やOpus 4.8のおよそ2倍、Fable 5の28 tok/sと比べると約4倍だ。Artificial Analysisは、最大努力の推論設定におけるFable 5のさらに厳しい数値も示している。最初の回答トークンまで113.68秒で、Grokの8.68秒を大幅に上回る。ただしストリーミング開始後はFable 5のデコード速度がわずかに速く、63.1 tok/s対58.9 tok/sとなる。実際の使用感に置き換えると、対話的な反復作業ではGrokが軽快で、Fable 5は長い思考を先に積み、その分だけ待ち時間が発生する。

利用方法、サブスクリプション、エージェント連携

Fable 5はAnthropic API、Claude Code、Cursorで提供されており、API以外の利用の大半は定額のClaude Proサブスクリプションでカバーされる。CLAUDE.md、プラグイン、スキル、MCPサーバーといったClaude Codeのエコシステムは、長年かけて成熟してきた。

Grok 4.6はxAI APIおよびGrok Build CLI(curl -fsSL https://x.ai/cli/install.sh | bash)で利用でき、X Premiumにはチャットアクセスが含まれる。ClockedCodeによると、Grok Buildは既存のCLAUDE.md、Claude Codeプラグイン、スキル、MCPサーバー、エージェント、フックを設定不要で読み込める。CI向けには-pフラグでヘッドレス実行が可能で、埋め込み用途向けにAgent Client Protocolも公開している。エコシステム自体はまだ新しいが、Claude Codeとの互換性により、対応構成であれば移行コストはほぼゼロに抑えられる。

両者に共通する課金面の現実もある。Claude ProとX Premiumの契約者は定額料金を支払うため、料金表そのものよりも、実際のワークロードでどの程度の利用制限に当たるかのほうが重要だ。

用途別の選び方

状況選ぶべきモデル理由
大量処理が必要で、要件が明確なコーディング作業Grok 4.6CursorBenchで同等のスコアながら、$2.81/タスク対$17.32
大規模リポジトリでの正確性重視の作業Fable 51Mのコンテキストウィンドウ、知能指数1位、初回成功率の高さ
対話型エージェントでの高速な反復Grok 4.6最初のトークンまで0.44秒、110 tok/s
曖昧なワンショット開発、最も難しい推論Fable 5TryAIの最難関タスクとGoldie Benchの直接比較で勝利
API予算が厳格に決まっている場合Grok 4.6出力トークン単価はFable 5のおよそ8分の1

私の見方では、範囲が限定され反復性の高い作業はGrok 4.6を標準にし、誤答のコストがトークン代を上回る仕事でFable 5を使うのがよい。実際に一定の利用量があるチームなら、両方を運用し、代表的なタスク規模、リトライ率、完了タスク単価で振り分けるべきだ。どちらか一方に固定するより、そのほうが安くつく。

よくある質問

コーディング用途ではGrok 4.6のほうがFable 5より優れている?

CursorBenchではほぼ互角だ。8月の比較ではGrok 4.6 Extra Highが70.8%、Fable 5 Maxが70.5%だった。ただし、より広範なArtificial Analysisの知能指数ではFable 5がリードしており、62対~59となっている。また、最難関のワンショットタスクでもFable 5が優勢だ。「優れているか」は、ボトルネックがタスク単価なのか、それとも正確性の上限なのかで変わる。

Grok 4.6はFable 5より安い?

はい。完了したCursorBenchタスクあたりでは、$2.81対$17.32でおよそ6分の1だ。トークン単価の比較では、xAIが4.6専用の料金表を公開していないため、Grok 4.5の公表価格を使っている。出力100万トークンあたり$6で、Fable 5は$50だ。ただし200Kトークンを超えるとGrokの料金はおおむね2倍になり、差は縮小する。

コンテキストウィンドウが大きいのはどちら?

Fable 5だ。1,000,000トークンで、Grokの500,000トークンの2倍にあたる。コードベース全体をコンテキストに保持するワークロードでは、この差がGrokの価格優位を上回ることがある。

Grok Buildは既存のClaude Code環境を使える?

使える。Grok BuildはCLAUDE.md、Claude Codeプラグイン、スキル、MCPサーバー、エージェント、フックを移植不要で自動的に読み込む。加えて、Grok固有の設定には独自の.grok/ディレクトリを使用する。

Grok 4.5のベンチマークはGrok 4.6の代用になる?

能力の比較にはならない。Grok 4.6は4.5比でIntelligence Indexを約5ポイント伸ばし、Fable 5に対する6ポイント差を約3ポイントまで縮めた。CursorBenchでも、明確に後れを取っていた4.5とは異なり、Fable 5 Maxと並んでいる。この記事にある速度とトークン単価の数値は、同等のGrok 4.6測定値がまだ公表されていないため、Grok 4.5の測定値だ。

最後まで残るトレードオフ

リポジトリが50,000行あり、チケットの要件が曖昧で、失敗した試行の検証に1時間かかる場合でも、Grokのコスト優位が維持されるか。今回の比較にあるベンチマークでは、その問いに答えられない。Fable 5の1Mコンテキストと高い知能上限は、まさにそのケースのためにある。高価だが確度を取りにいくFable 5と、低コストでステップを回せるGrok 4.6。この差は十分に大きく、多くのチームが両方を有効な選択肢として残す理由になっている。

関連記事:Grok 4.6 vs GPT-5.6 · Grok 4.6 vs Opus 5 · Claude Sonnet 5 vs Fable 5