AIREITER

最佳 GPT 圖像生成模型:Image 2 vs 1.5 實測比較

最近更新: 2026-08-06 02:17:23

若只看盲測競技場的成績,GPT Image 2 已明顯領先:在 Artificial Analysis 拿下 1,340 Elo,比 GPT Image 1.5 高出 78 分,並登上三個大型圖像競技場的榜首。不過,高品質單張成本最高可達 $0.21;若是大量產圖,gpt-image-1-mini 則可將單張價格壓到 $0.01 以下。究竟該選哪一款,取決於你是在製作行銷素材、大規模測試原型,還是修改商品照片。本文整理目前所有 OpenAI 圖像模型的品質、價格、解析度與編輯能力,幫你直接選對模型。

本文只討論 OpenAI 自家的圖像生成產品線:GPT Image 2、GPT Image 1.5、gpt-image-1-mini,以及舊版 GPT-4o。若想進一步比較 Midjourney、FLUX、Stable Diffusion 等不同生態系的工具,可參考我們的2026 AI 圖像生成器比較。

OpenAI 目前有哪些圖像生成模型?

OpenAI 目前透過 API 提供四款圖像生成模型,相關定位可見其提示詞指南。它們分別對應不同的品質與成本需求。

GPT Image 2於 2026 年 4 月 21 日推出,是 OpenAI 的旗艦模型。依 OpenAI 指南說明,它是「整體能力最強的模型」,內建推理步驟,可彈性支援最高實驗性質的約 4K 解析度,並能在像素限制內使用任意長寬比。OpenAI 建議將它作為「多數正式生產工作流程的預設選擇」。

GPT Image 1.5於 2025 年 12 月推出,沒有推理步驟,但提供 input_fidelity 參數,可選擇 low 或 high,控制編輯時保留原始圖片細節的程度。它僅支援固定尺寸:1024×1024、1024×1536、1536×1024 或 auto。OpenAI 建議僅在驗證提示詞遷移期間保留此模型,以維持向下相容。

gpt-image-1-mini是預算導向的選項。依 OpenAI 文件,它針對「成本與吞吐量」最佳化,適合批次產生變體、快速發想、預覽圖,以及不要求頂級品質的草稿素材。

GPT-4o 圖像生成也就是最初的 ChatGPT Images,目前仍可在消費者版 App 中使用。但其背後的 API 模型 GPT Image 1,已被 OpenAI 歸類為「僅供舊版相容性使用」,並明確建議遷移至 GPT Image 2。

品質與提示詞遵從度:Elo 差距有多大?

盲測競技場大概是最接近客觀圖像品質評分的方式:評測者不知道圖片來自哪個模型,只挑選自己認為較好的結果。

截至 2026 年 8 月,GPT Image 2 在三個主要排行榜均居第一:

競技場GPT Image 2GPT Image 1.5差距
Artificial Analysis(13,289 票)1,340 Elo1,262 Elo78 分
arena.ai(LMArena)610–631 Elo未單獨排名—
llm-stats.com(13,552 票)661 Arena 分數333 Arena 分數328 分

在 Artificial Analysis 上,這 78 分的領先幅度,是該排行榜有紀錄以來第一名與第二名之間最大的差距。

文字生成是兩者差異最顯著的地方。GPT Image 2 能準確處理拉丁字母與 CJK 等多語文字,Artificial Analysis 對其評價接近「近乎完美」。因此,製作 Logo、資訊圖表或任何含有文字的圖片時,它幾乎是預設首選。GPT Image 1.5 處理簡單排版的文字已足夠,但在文字密集、多字體的構圖中較容易漏字。

「GPT-Image-2 已推出,這模型在文字渲染與生成複雜軟體介面中的各種微小細節方面,強得驚人。」— u/Glittering-Neck-2505,r/singularity

擬真度也有所提升,但仍有取捨。Reddit 使用者指出,GPT Image 2 初看相當逼真,卻偶爾會在自然元素上產生「重複圖樣/紋理」。有人形容岩石紋理看起來「像電玩裡程式生成的材質」。GPT Image 1.5 沒有這種特定瑕疵,但整體細節較少。

以下是我使用 GPT Image 2 做的測試:以帶有「COFFEE」霓虹招牌的東京咖啡廳場景,刻意測試文字渲染能力(gpt-image-2、高品質、16:9):

GPT Image 2 測試:雨夜東京咖啡廳,窗上有雨滴與 COFFEE 霓虹招牌

霓虹文字第一次生成就正確,窗上的雨滴也保有個別細節,而不是整片模糊處理。

各 GPT 圖像模型的單張成本

OpenAI 的圖像模型不是按張計價,而是按 Token 收費。以下整理 OpenAI 定價頁面上的 Token 費率,並附上預估單張成本;價格於 2026 年 8 月確認。

Token 費率(每 100 萬 Token)

模型文字輸入圖片輸入快取圖片輸入圖片輸出
gpt-image-2$5.00$8.00$2.00$30.00
gpt-image-1.5$5.00$8.00$2.00$32.00
gpt-image-1-mini$2.00$2.50$0.25$8.00

依品質估算的單張成本

以下估算以 1024×1024 的文生圖、50–100 字提示詞為前提。實際費用會隨解析度與提示詞複雜度增加。

品質gpt-image-2gpt-image-1.5gpt-image-1-mini
低~$0.006~$0.009~$0.003
中~$0.03–0.07~$0.04–0.08~$0.01
高~$0.10–0.21~$0.10–0.20~$0.03–0.05

表中的「低」、「中」、「高」對應 API 請求裡的 quality 參數,例如 quality="low"。各設定決定模型用於繪製細節的 Token 預算;低品質產生的輸出 Token 較少,因此成本也較低。

GPT 圖像模型價格比較圖表

有個看似反直覺的細節:GPT Image 1.5 的圖片輸出 Token 價格為 $32/1M,高於 GPT Image 2 的 $30/1M。因此,若要進行低品質快速原型製作,GPT Image 2 每張 $0.006,反而比 GPT Image 1.5 的 $0.009 更便宜。

gpt-image-1-mini的價格約只有三分之一。以高量工作流程來說,例如產生 10,000 張商品變體預覽,$0.003 與 $0.006 的單張差距,每批可省下 $30。

解析度彈性與圖片編輯能力

GPT Image 2可透過 size 參數接受任意解析度,但須符合以下限制,規格來自OpenAI 文件:

  • 最長邊 < 3,840px
  • 兩邊長度皆須為 16 的倍數
  • 長寬比 ≤ 3:1
  • 總像素介於 655,360 與 8,294,400 之間

常見輸出尺寸包括:1024×1024(正方形)、2560×1440(穩定的 2K),以及 3824×2144(實驗性質的接近 4K)。OpenAI 也提醒,超過 2K 的結果「變異性較高」。

GPT Image 1.5則固定支援四種尺寸:1024×1024、1024×1536、1536×1024 與 auto,不能自訂解析度。

在圖片編輯方面,GPT Image 2 以 1,255 Elo 位居 Artificial Analysis 圖像編輯競技場第一,領先 Google 的 Nano Banana Pro(1,247)。GPT Image 1.5 的 input_fidelity 參數,則讓使用者能明確控制編輯時對原始圖片的保留程度。GPT Image 2 不支援此參數,OpenAI 的說法是其「輸出預設已具備高保真度」。

功能gpt-image-2gpt-image-1.5gpt-image-1-mini
最高解析度~4K(實驗性質)1536×1024(固定)1536×1024(固定)
自訂長寬比可以不行(4 種預設 + auto)不行(4 種預設 + auto)
推理步驟有無無
input_fidelity停用(固定高保真)Low / HighLow / High
編輯競技場 Elo1,255(#1)未單獨排名未排名

不同工作,該選哪一款 GPT 圖像模型?

行銷素材與廣告創意

使用中或高品質的 GPT Image 2。它的推理步驟更能理解創意簡報式提示詞,生成較準確的排版與文字。OpenAI 的指南建議,針對這款模型應把提示詞寫成「創意簡報」,而不是純技術規格。

商品情境圖與電商素材

主視覺用 GPT Image 2,變體預覽用 gpt-image-1-mini。主打商品圖可用高品質 GPT Image 2,彈性解析度能對應商店頁面的精確尺寸;接著再以 gpt-image-1-mini 產生不同顏色、角度或背景的版本,每張僅 $0.003。一條有 50 個 SKU、每個 SKU 需 5 種變體的產品線,以 mini 的低品質生成,總成本約為 $0.75。

資訊圖表與大量文字圖片

選 GPT Image 2。根據 Artificial Analysis,它對拉丁字母與 CJK 文字的渲染近乎完美。GPT Image 1.5 能處理簡單文字,但在多字體、資訊密集的版面中可能漏字。品質建議設為中或高,因為所有模型在低品質下的文字可讀性都會下降。

高量批次生成

低品質 gpt-image-1-mini。單張 $0.003,生成 100,000 張的成本是 $300。如果品質比吞吐量更重要,低品質 GPT Image 2 的 $0.006 也算合理。GPT Image 1.5 在這方面沒有成本優勢,因為它的圖片輸出 Token 每 100 萬個比 GPT Image 2 高出 $2。

反覆修改的編輯流程

一般編輯選 GPT Image 2;需要控制 input_fidelity 時選 GPT Image 1.5。GPT Image 2 在編輯競技場領先,但 GPT Image 1.5 的保真度切換可讓你在「盡量完整保留」與「較自由地重新詮釋」之間選擇。若你的工作流程依賴這項控制,GPT Image 1.5 在功能結構上更有優勢。

常見問題

GPT Image 2 一定比 GPT Image 1.5 好嗎?

不一定,取決於工作流程。GPT Image 1.5 在編輯時提供 input_fidelity 控制,而且在岩石、植被、毛髮等自然場景中,不會出現使用者回報於 GPT Image 2 的重複紋理瑕疵。若你需要嚴格保留原圖內容,GPT Image 1.5 可能更好;但在文字生成、提示詞遵從度和擬真度上,GPT Image 2 勝出。

我還需要用 GPT-4o 生成圖片嗎?

不需要,除非你只能使用消費者版 ChatGPT 介面,無法存取 API。OpenAI 已將 GPT-4o 背後的 GPT Image 1 歸為「僅供舊版相容性使用」,並建議遷移至 GPT Image 2。

GPT Image 2 可以免費使用嗎?

ChatGPT 免費方案與每月 $8 的 Go 方案都提供有限度的圖片生成功能。若使用 API,新 OpenAI 帳號可獲得 $5 免費額度,依品質設定不同,約可生成 25–800 張圖片。

gpt-image-1-mini 適合做什麼?

它適合高產量、成本敏感的工作:快速發想、A/B 測試變體、佔位素材、縮圖預覽,以及批次個人化內容。低品質下每張約 $0.003,約比中品質 GPT Image 2 便宜 10 倍。若是文字很多的圖片,或需要靠首次生成品質減少審稿輪次的客戶素材,則不建議使用它。