AIREITER

Grok Imagine 2(Image 2.0)評測、API 與替代方案

最近更新: 2026-08-10 03:45:26

如果你在找「Grok Imagine 2」的 API,先說結論:目前還不能用。這是 xAI 推出的新一代影像模型,也就是 grok.com/imagine 的 Quality Mode,於 2026 年 8 月 7 日正式推出。它不是 Grok Imagine 1.5 那個影片模型的後繼版本。在 LM Arena 的文生圖與影像編輯排行榜上,它都排在第 #2,僅次於 GPT-Image-2;但想以程式方式生成或編輯圖片,現階段只能使用 Grok 消費者版 App,或改選已開放 API 的競品。

先別搞混:Grok Imagine 2 是影像模型

「Grok Imagine 2」最重要的資訊,就是它真正指的是什麼:它是影像模型 Imagine Image 2.0,模型 id 為 grok-imagine-image-quality,作為 Grok 圖像產生器的 Quality Mode 上線。它和我們既有的 Grok Imagine 1.5 review 所介紹的影片模型 grok-imagine-video-1.5 並不是同一件事。

這組命名確實很容易讓人混淆。看到某個頁面提到原生 4K 解析度、30 秒片段、Aurora 影片引擎,或口型同步的語音,那些都是影片模型規格,卻被錯套到影像模型上了。Image 2.0 只產生與編輯靜態圖片,沒有片長、音訊或影片時間軸的概念。成品可在 grok.com/imagine 與 iOS、Android App 中取得。

xAI 的公告頁面是最直接的上市資訊來源:

xAI 發布 Imagine Image 2.0 的公告截圖,展示模型名稱與 Quality Mode 定位

Image 2.0 的重點功能有哪些?

Imagine Image 2.0 是一款同時涵蓋生成與編輯的影像模型,核心訴求是版面還原度與編輯可控性。它主打能在海報、產品頁、資訊圖表等密集多元素畫面中,生成清晰可讀的文字,避免舊一代影像模型常見的亂碼與錯字問題。

以下功能依 xAI 上市頁面整理,於 2026 年 8 月 7 日確認:

功能用途
魔法棒區域編輯指定一個區域,只修改該範圍內容,類似 inpainting。
分割選取編輯前可精準選取物件,不必手動塗繪遮罩。
背景移除移除背景並以透明背景匯出。
多圖片參考編輯單次編輯最多提供 5 張參考圖片,以維持主體或風格一致。
Smart Resize支援 9 種長寬比的生成式延展:1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9、2:1;由模型延伸畫布內容。
文字與版面穩定度小字與多元素版面仍能維持清晰可讀、位置對齊。
15 種範本Photo Edit、Product Color Change、Editorial Product Poster、Reimagine、Photo Collage、Mascot Maker、BG Removal & Change、E-Commerce Photos、UGC Photos、Professional Headshot、Icon Maker、Character Sprite、Props & UI Kit、Emoji Creator、Merch Maker。
為影片建立世界觀分別生成角色、場景與道具並維持一致風格,可作為影片前期製作的一環。

整體來看,Image 2.0 的主軸就是編輯控制力;這也是競品拿來對標它的能力,並且是我們下文與可用 API 對手實測比較的重點。

LM Arena #2 到底代表什麼?

xAI 表示,Imagine Image 2.0 在 LM Arena 的文生圖與影像編輯兩個排行榜都是全球第 #2,榜單中以 SpaceXAI 顯示,也就是 xAI 在該排行榜使用的名稱。兩個項目的第 #1 都是 GPT-Image-2。

LM Arena 影像排行榜,以 Elo 呈現文生圖與影像編輯排名前兩名模型

不過,這張圖要用正確的方式解讀。Elo 分數來自 xAI 對公開 Arena 資料的自行報告,不是我們獨立執行的測試。Image 2.0 與 GPT-Image-2 的差距,在編輯項目較小,為 1,439 對 1,463;在文生圖則較大,為 1,320 對 1,380。第 #2 已是相當強的成績,但不表示 Image 2.0 與榜首模型表現相同;再加上 API 尚未公開,我們無法進行受控的 API 對決測試。想自行查看排名,可前往即時榜單 lmarena.ai;再下一個梯隊包括 Reve 2.1、Meta Muse-Image、Qwen-Image-3.0-Pro、Gemini Image 與 Seedream。

現在能呼叫 Grok Imagine 2 API 嗎?不能

API 尚未開放。xAI 的上市頁面明確寫著 「API access is coming soon」,並未提供日期;本文於 2026 年 8 月 10 日確認。

有個看似矛盾的地方需要釐清。docs.x.ai 已經列出模型 id grok-imagine-image-quality,以及 POST /v1/images/generations、POST /v1/images/edits 端點,後者最多可使用 3 張參考圖片。但文件中出現模型 id,不等於已能實際付費呼叫。目前沒有公開的單張圖片價格,既然存取權仍是「coming soon」,grok-imagine-image-quality 也就還不能呼叫。最終仍應以「coming soon」為準。

這也解答了轉接服務的問題:AIReiter 目前僅列出 Grok 的影片模型 grok_imagine_1_5,因此同樣沒有可通往 Grok 圖像模型的 AIReiter 路徑。現階段使用 Imagine Image 2.0 的唯一方式,是 Grok 消費者版 App,包括 grok.com、iOS 與 Android。

現在能用 API 的替代方案:實測結果

既然 Grok 的影像 API 尚未開放,實際問題就變成:同樣出現在 Arena 排行榜上的模型,哪些今天就能呼叫?前三個強勢對手中,有 GPT-Image-2(第 #1)、Nano Banana Pro(基於 Gemini 影像技術)與 Seedream V5 Pro(ByteDance)可透過 API 使用。我以 Image 2.0 的兩項招牌任務——精準文字生成與受控編輯——測試這三款模型,看看讓 Image 2.0 備受矚目的能力是否真的只有它能做到。

生成測試:相同提示詞正面對決

我給三個模型完全相同的提示詞:製作一張復古旅遊海報,必須包含大型標題 NEON KYOTO、副標 2049 EXPRESS 與票價文字 TICKETS FROM 29000 YEN,配色為低飽和的青綠與洋紅色。三者皆使用相同 1:1 比例、預設設定,各生成一次。測試重點是 Image 2.0 宣傳的文字渲染與版面能力。

相同提示詞對決:GPT-Image-2、Nano Banana Pro 與 Seedream V5 Pro 分別生成同一張復古旅遊海報

結果是:三個模型都正確生成了全部三組文字,包括標題、副標與票價,沒有拼字錯誤或憑空出現的字元。不過這個樣本規模只有 n=1,也就是一個提示詞、每個模型一次生成,並非基準測試;因此無法依文字能力替三者排名,只能確認它們在這張海報提示詞上都正確生成了指定文字。這表示,Image 2.0 主打的文字生成能力,在這類工作上也可透過已開放 API 的對手取得;但不代表 Image 2.0 在所有情境下都不再具備差異化。成本則有明顯差異:同一項工作中,GPT-Image-2 花費 1 credit、Nano Banana Pro 為 6、Seedream V5 Pro 為 7。想直接試用,可前往各自的 API 頁面:GPT-Image-2、Nano Banana Pro 與 Seedream V5 Pro。

編輯測試:對手能否保留元素、改掉場景?

編輯能力是 Image 2.0 的另一半賣點:保留原本結構,只改一個部分。我將上方海報作為參考圖交給 Nano Banana Pro,要求它保留原有版面、三組文字、富士山與火車,同時把霓虹夜晚城市替換成帶有粉金色櫻花的京都雪景清晨。

編輯前後比較:原始霓虹夜景海報與編輯後的雪景清晨版本,皆透過 Nano Banana Pro 參考圖片編輯完成

結果是三組文字都正確保留下來,包括 NEON KYOTO、2049 EXPRESS、TICKETS FROM 29000 YEN,富士山和火車也都還在;畫面則從深色霓虹夜景轉為明亮晨光。有一點必須如實說明:編輯結果的長寬比改變了,從原圖的 1024×1024 變成 1376×768,因此更像是在引導下重新生成,而不是嚴格保留畫布的 inpaint。這只是單一模型的一次測試,所以只能證明「保留文字與主體、改變場景」這類編輯,目前可由已開放 API 的對手做到;不代表每個對手都能媲美 Grok 更精準的魔法棒區域 inpaint。後者 API 尚未開放,我們無法自行驗證;任何官方 Grok 編輯示範都應視為廠商展示,而非我們已驗證的結果。

價格比較:不同途徑生成一張圖片要多少錢?

以下每次生成價格取自各模型的 AIReiter 頁面,表內連結可直接前往,並於 2026 年 8 月 10 日確認。Grok Image 2.0 尚無 API,因此也沒有 API 價格;它僅能透過 Grok 消費者版 App 使用,xAI 尚未公布單張圖片費用。

模型AIReiter 是否提供約 1K 圖片價格(每次生成)Arena 排名備註
GPT-Image-2是$0.02#1(T2I & Edit)三者中最便宜,排名也是最高。
Nano Banana Pro是$0.05頂尖梯隊基於 Gemini;文字與編輯能力都強。
Seedream V5 Pro是$0.07(7 credits)頂尖梯隊ByteDance;沒有 4K 方案;每張參考圖 $0.005。
Grok Image 2.0否(API 尚待開放)n/a#2(T2I & Edit)僅限消費者版,可於 Grok App 使用。

現在該怎麼選?

依你的需求,可分成三條路:

  • 你就是想用 Grok Image 2.0。 請使用 Grok app,支援網頁、iOS 與 Android。目前沒有 API 使用方式,也沒有公布開放日期。
  • 你今天就需要透過 API 生成或編輯圖片。 可使用 GPT-Image-2,它是 Arena 第 #1,1K 圖片每次生成為 $0.02;也可比較 Nano Banana Pro 與 Seedream V5 Pro。三者都通過了我們的一次文字生成樣本,Nano Banana Pro 也在編輯測試中維持不錯表現。
  • 你其實要的是影片。 那是另一個模型 grok-imagine-video-1.5,可參考我們的 Grok Imagine 1.5 review 與 Grok video page。

常見問題

Grok Imagine 2 是影像模型還是影片模型?

它是影像模型。「Grok Imagine 2」指的是 Imagine Image 2.0,模型 id 為 grok-imagine-image-quality,是 grok.com/imagine 的 Quality Mode。影片模型則是另一款 grok-imagine-video-1.5;若描述中提到 4K、30 秒片段或音訊,指的都是影片模型,不是這一款。

我能呼叫 Grok Imagine 2 API 嗎?

目前還不行。xAI 表示 API 存取權「coming soon」,於 2026 年 8 月 7 日確認。docs.x.ai 雖列出了模型 id,以及 /v1/images/generations 和 /v1/images/edits 端點,但截至 2026 年 8 月 10 日,尚未提供可實際計費的存取權,也未公布單張圖片價格。

Grok Imagine 2 要多少錢?

API 目前沒有價格,因為 API 尚未開放。至於 Grok 消費者版 App,xAI 也沒有公布獨立的單張圖片費用。

哪一款是最好的 Grok Imagine 2 API 替代方案?

GPT-Image-2。它在 LM Arena 的文生圖與編輯項目都排第 #1,領先 Grok Image 2.0;以約 1K 圖片每次生成 $0.02 計算,也是我們測試的可用 API 頂尖模型中最便宜的一款。