Grok Imagine 2は、動画の「Grok Imagine 1.5」の後継ではありません。xAIが2026年8月7日にGAした新しい画像モデル、grok.com/imagineのQuality Modeにあたるモデルです。LM Arenaではテキストから画像生成・画像編集の両部門で#2に入り、上位はGPT-Image-2のみ。ただし、押さえておくべき点があります。APIはまだ公開されていないため、現時点で画像生成や編集をプログラムから実行するには、Grokのコンシューマー向けアプリを使うか、APIを利用できる競合モデルを選ぶ必要があります。
Grok Imagine 2は動画の続編ではなく画像モデル
「Grok Imagine 2」についてまず知っておきたいのは、その正体です。これはGrokの画像ジェネレーターにQuality Modeとして追加された画像モデル、Imagine Image 2.0(モデルID:grok-imagine-image-quality)を指します。既存のGrok Imagine 1.5レビューで扱っている動画モデル、grok-imagine-video-1.5とは別物です。
紛らわしい命名で混同しやすいのは事実です。ページにネイティブ4K解像度、30秒クリップ、Aurora動画エンジン、リップシンク付き音声といった記述があれば、それは画像モデルに動画モデルの仕様を取り違えている可能性があります。Image 2.0が扱うのは静止画の生成と編集であり、尺・音声・動画タイムラインはありません。出力先はgrok.com/imagineおよびiOS/Androidアプリです。
リリース内容を確認するなら、xAIの発表ページがもっとも明確です。
Image 2.0でできること
Imagine Image 2.0は、レイアウトの再現性と編集のコントロール性を重視した画像生成・編集モデルです。大きな特徴は、読み取れる文字を含む画像や、ポスター、商品ページ、インフォグラフィックのような要素数の多い構図を生成できる点です。従来の画像モデルで起きがちだった文字崩れを抑えることを狙っています。
xAIのリリースページに記載された機能は以下のとおりです(2026年8月7日確認)。
| 機能 | できること |
|---|---|
| マジックワンドによる領域編集 | 変更したい領域を指定し、その部分だけを編集するインペインティング型の機能。 |
| セグメンテーション | 手作業でマスクを塗らなくても、編集前に精密な選択範囲を作成できる。 |
| 背景削除 | 背景を削除し、透過状態で書き出せる。 |
| 複数画像を参照した編集 | 1回の編集で最大5枚の参照画像を入力し、被写体やスタイルの一貫性を保てる。 |
| Smart Resize | 9種類のアスペクト比(1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9、2:1)に対応した生成拡張。モデルがキャンバス外を補完する。 |
| 文字・レイアウトの忠実性 | 小さな文字や複数要素のレイアウトでも、可読性と配置を維持する。 |
| 15種類のテンプレート | Photo Edit、Product Color Change、Editorial Product Poster、Reimagine、Photo Collage、Mascot Maker、BG Removal & Change、E-Commerce Photos、UGC Photos、Professional Headshot、Icon Maker、Character Sprite、Props & UI Kit、Emoji Creator、Merch Maker。 |
| 動画向けの世界観づくり | キャラクター、シーン、小道具を一貫したスタイルで個別に生成する。動画制作のプリプロダクション向けの工程。 |
全体を通した軸は編集コントロールです。これは競合がImage 2.0と比較する機能でもあり、後ほどAPIを利用できる競合モデルと比較するポイントでもあります。
Arena #2はどこまで評価できるのか
xAIによると、Imagine Image 2.0はLM Arenaのテキストから画像生成と画像編集の両部門で世界#2です。リーダーボード上では、xAIの掲載名であるSpaceXAIとして表示されています。どちらの部門でも#1はGPT-Image-2です。
ただし、このグラフは適切な前提で読む必要があります。Elo値は独自に実施したテストではなく、公開ArenaデータについてxAIが報告した数値です。GPT-Image-2との差は編集では小さく(1,439対1,463)、テキストから画像生成ではより大きくなっています(1,320対1,380)。#2は十分に強い結果ですが、最上位モデルと同等という意味ではありません。また、APIが公開されていないため、制御されたAPI同士の比較も実施できませんでした。ランキングはlmarena.aiのライブリーダーボードで確認できます。次のグループにはReve 2.1、Meta Muse-Image、Qwen-Image-3.0-Pro、Gemini Image、Seedreamが入っています。
Grok Imagine 2 APIは今すぐ呼び出せる? 答えはNo
APIは未公開です。xAIのリリースページには、"API access is coming soon,"と明記されています。提供日は示されていません(2026年8月10日確認)。
一見すると矛盾する情報もあります。docs.x.aiにはすでにモデルID grok-imagine-image-qualityと、POST /v1/images/generations、POST /v1/images/edits(参照画像は最大3枚)のエンドポイントが掲載されています。しかし、ドキュメントにモデルIDがあることは、課金可能なライブアクセスが提供されていることを意味しません。画像1枚あたりの価格は公開されておらず、アクセスは依然として「coming soon」です。現時点でgrok-imagine-image-qualityを呼び出すことはできません。ドキュメントの記載よりも「coming soon」が優先されます。
AIReiter経由についても結論は同じです。AIReiterが掲載しているGrokは動画モデルのgrok_imagine_1_5のみで、Grok画像モデルへの経路はありません。現在Imagine Image 2.0を使えるのは、Grokのコンシューマー向けアプリ(grok.com、iOS、Android)だけです。
今すぐAPIで使える選択肢をテスト
Grokの画像APIが閉じている以上、実務上の問題は「同じArenaリーダーボードにいるモデルのうち、今すぐ呼び出せるものは何か」です。上位競合のうち、GPT-Image-2(#1)、Nano Banana Pro(Geminiの画像技術をベース)、Seedream V5 Pro(ByteDance)の3つはAPIで利用できます。Image 2.0の代表的な強みである文字の正確な生成と制御された編集をこの3モデルで試し、その機能がImage 2.0だけのものなのかを確認しました。
生成テスト:同一プロンプトで比較
3モデルすべてに同じプロンプトを与えました。内容は、大きなタイトルNEON KYOTO、サブライン2049 EXPRESS、価格表記TICKETS FROM 29000 YENを含む、落ち着いたティールとマゼンタの配色によるレトロな旅行ポスターです。比率は同じ1:1、設定はデフォルト、各モデル1回ずつ生成しました。Image 2.0が強みとして掲げる文字描画とレイアウトを確認するためのテストです。
結果は、3モデルすべてが3つの文字列を正しく描画しました。タイトル、サブライン、価格表記のいずれにもスペルミスや存在しない文字はありません。このサンプル数(n=1、プロンプト1件、ベンチマークではない)で3モデルの文字性能に順位を付けることはできず、このポスタープロンプトでは全モデルが指定の文字を正しく出力したと確認できるだけです。つまり、Image 2.0が訴求する文字描画能力は、この種の用途であればAPI対応の競合モデルからも利用できます。ただし、それがあらゆる条件でImage 2.0の差別化要素ではなくなったことを意味するわけではありません。コストには差があり、同じジョブでGPT-Image-2は1クレジット、Nano Banana Proは6、Seedream V5 Proは7でした。直接試す場合は、GPT-Image-2、Nano Banana Pro、Seedream V5 ProにそれぞれAPIページがあります。
編集テスト:構図を保ったままシーンを変更
Image 2.0のもう一つの訴求点は、構造を残して一部分だけ変える編集です。先ほどのポスターをNano Banana Proに参照画像として渡し、レイアウト、3つの文字列、富士山、列車を維持したまま、ネオンに彩られた夜の街を、淡いピンクとゴールドの桜がある雪の京都の夜明けへ変更するよう指示しました。
結果として、3つの文字列(NEON KYOTO、2049 EXPRESS、TICKETS FROM 29000 YEN)はすべて正しく維持され、富士山と列車も残りました。シーンは暗いネオンの夜から明るい夜明けへ移行しています。一方で、正直に触れておくべき点もあります。出力のアスペクト比は元画像の1024×1024から1376×768に変わっており、キャンバスを厳密に維持するインペイントというより、指示に沿った再レンダリングに近い結果です。これは1モデル・1回だけのテストです。そのため、テキストと被写体を保持しつつシーンを変えるタイプの編集は、現在APIを使える競合でも実現可能だと示すものにすぎません。Grokのより局所的なマジックワンド・インペイントとすべての競合が同等であることは示していません。GrokのAPIは閉じているため私たちで検証できず、公式のGrok編集デモは検証済みの結果ではなくベンダーのショーケースとして扱うべきです。
価格比較:各ルートで画像1枚にかかる費用
各モデルのAIReiterページ(表内リンク)にある1回の生成あたりの価格です。2026年8月10日に確認しました。Grok Image 2.0はAPIがないためAPI価格もありません。利用できるのはGrokのコンシューマー向けアプリのみで、画像1枚あたりの価格は公開されていません。
| モデル | AIReiter対応 | 約1K画像の価格(1回の生成あたり) | Arena順位 | 補足 |
|---|---|---|---|---|
| GPT-Image-2 | あり | $0.02 | #1(T2I & Edit) | 3モデル中で最安かつ最上位。 |
| Nano Banana Pro | あり | $0.05 | トップティア | Geminiベース。文字生成と編集が強い。 |
| Seedream V5 Pro | あり | $0.07(7クレジット) | トップティア | ByteDance製。4Kティアなし。参照画像は1枚につき$0.005。 |
| Grok Image 2.0 | なし(API提供待ち) | n/a | #2(T2I & Edit) | コンシューマー向けのみ。Grokアプリで利用可能。 |
今選ぶなら、用途別のおすすめ
選択肢は、必要なものによって3つに分かれます。
- Grok Image 2.0を使いたい場合。 Grokアプリ(Web/iOS/Android)を使ってください。API経由の利用手段はなく、公開時期も発表されていません。
- 今すぐAPI経由で画像を生成・編集したい場合。 1Kで1回の生成あたり$0.02、Arena #1のGPT-Image-2がおすすめです。比較対象としてNano Banana ProやSeedream V5 Proも選べます。3モデルはいずれも1回の文字生成サンプルを通過し、Nano Banana Proは編集テストでも結果を残しました。
- 動画モデルを探していた場合。 それは別モデルの
grok-imagine-video-1.5です。Grok Imagine 1.5レビューおよびGrok videoページを参照してください。
FAQ
Grok Imagine 2は画像モデルですか、動画モデルですか?
画像モデルです。「Grok Imagine 2」は、grok.com/imagineのQuality ModeであるImagine Image 2.0(モデルID:grok-imagine-image-quality)を指します。動画モデルは別のgrok-imagine-video-1.5です。説明文に4K、30秒クリップ、音声といった記述があれば、それは本モデルではなく動画モデルの情報です。
Grok Imagine 2 APIは呼び出せますか?
まだ呼び出せません。xAIはAPIアクセスを「coming soon」としています(2026年8月7日確認)。docs.x.aiにはモデルIDと/v1/images/generations、/v1/images/editsのエンドポイントが掲載されていますが、2026年8月10日時点で課金可能なライブアクセスはなく、画像1枚あたりの価格も公開されていません。
Grok Imagine 2の料金はいくらですか?
APIについては、API自体が存在しないため価格もありません。Grokのコンシューマー向けアプリについても、xAIは画像1枚あたりの単独料金を公開していません。
APIで使えるGrok Imagine 2の最良の代替モデルは?
GPT-Image-2です。LM Arenaではテキストから画像生成・編集の両方でGrok Image 2.0を上回る#1に位置し、1Kで1回の生成あたり約$0.02と、テストしたAPI対応の上位モデルの中でも最安です。