若只看盲測競技場的成績,GPT Image 2 已明顯領先:在 Artificial Analysis 拿下 1,340 Elo,比 GPT Image 1.5 高出 78 分,並登上三個大型圖像競技場的榜首。不過,高品質單張成本最高可達 $0.21;若是大量產圖,gpt-image-1-mini 則可將單張價格壓到 $0.01 以下。究竟該選哪一款,取決於你是在製作行銷素材、大規模測試原型,還是修改商品照片。本文整理目前所有 OpenAI 圖像模型的品質、價格、解析度與編輯能力,幫你直接選對模型。
本文只討論 OpenAI 自家的圖像生成產品線:GPT Image 2、GPT Image 1.5、gpt-image-1-mini,以及舊版 GPT-4o。若想進一步比較 Midjourney、FLUX、Stable Diffusion 等不同生態系的工具,可參考我們的2026 AI 圖像生成器比較。
OpenAI 目前有哪些圖像生成模型?
OpenAI 目前透過 API 提供四款圖像生成模型,相關定位可見其提示詞指南。它們分別對應不同的品質與成本需求。
GPT Image 2於 2026 年 4 月 21 日推出,是 OpenAI 的旗艦模型。依 OpenAI 指南說明,它是「整體能力最強的模型」,內建推理步驟,可彈性支援最高實驗性質的約 4K 解析度,並能在像素限制內使用任意長寬比。OpenAI 建議將它作為「多數正式生產工作流程的預設選擇」。
GPT Image 1.5於 2025 年 12 月推出,沒有推理步驟,但提供 input_fidelity 參數,可選擇 low 或 high,控制編輯時保留原始圖片細節的程度。它僅支援固定尺寸:1024×1024、1024×1536、1536×1024 或 auto。OpenAI 建議僅在驗證提示詞遷移期間保留此模型,以維持向下相容。
gpt-image-1-mini是預算導向的選項。依 OpenAI 文件,它針對「成本與吞吐量」最佳化,適合批次產生變體、快速發想、預覽圖,以及不要求頂級品質的草稿素材。
GPT-4o 圖像生成也就是最初的 ChatGPT Images,目前仍可在消費者版 App 中使用。但其背後的 API 模型 GPT Image 1,已被 OpenAI 歸類為「僅供舊版相容性使用」,並明確建議遷移至 GPT Image 2。
品質與提示詞遵從度:Elo 差距有多大?
盲測競技場大概是最接近客觀圖像品質評分的方式:評測者不知道圖片來自哪個模型,只挑選自己認為較好的結果。
截至 2026 年 8 月,GPT Image 2 在三個主要排行榜均居第一:
| 競技場 | GPT Image 2 | GPT Image 1.5 | 差距 |
|---|---|---|---|
| Artificial Analysis(13,289 票) | 1,340 Elo | 1,262 Elo | 78 分 |
| arena.ai(LMArena) | 610–631 Elo | 未單獨排名 | — |
| llm-stats.com(13,552 票) | 661 Arena 分數 | 333 Arena 分數 | 328 分 |
在 Artificial Analysis 上,這 78 分的領先幅度,是該排行榜有紀錄以來第一名與第二名之間最大的差距。
文字生成是兩者差異最顯著的地方。GPT Image 2 能準確處理拉丁字母與 CJK 等多語文字,Artificial Analysis 對其評價接近「近乎完美」。因此,製作 Logo、資訊圖表或任何含有文字的圖片時,它幾乎是預設首選。GPT Image 1.5 處理簡單排版的文字已足夠,但在文字密集、多字體的構圖中較容易漏字。
「GPT-Image-2 已推出,這模型在文字渲染與生成複雜軟體介面中的各種微小細節方面,強得驚人。」— u/Glittering-Neck-2505,r/singularity
擬真度也有所提升,但仍有取捨。Reddit 使用者指出,GPT Image 2 初看相當逼真,卻偶爾會在自然元素上產生「重複圖樣/紋理」。有人形容岩石紋理看起來「像電玩裡程式生成的材質」。GPT Image 1.5 沒有這種特定瑕疵,但整體細節較少。
以下是我使用 GPT Image 2 做的測試:以帶有「COFFEE」霓虹招牌的東京咖啡廳場景,刻意測試文字渲染能力(gpt-image-2、高品質、16:9):
霓虹文字第一次生成就正確,窗上的雨滴也保有個別細節,而不是整片模糊處理。
各 GPT 圖像模型的單張成本
OpenAI 的圖像模型不是按張計價,而是按 Token 收費。以下整理 OpenAI 定價頁面上的 Token 費率,並附上預估單張成本;價格於 2026 年 8 月確認。
Token 費率(每 100 萬 Token)
| 模型 | 文字輸入 | 圖片輸入 | 快取圖片輸入 | 圖片輸出 |
|---|---|---|---|---|
| gpt-image-2 | $5.00 | $8.00 | $2.00 | $30.00 |
| gpt-image-1.5 | $5.00 | $8.00 | $2.00 | $32.00 |
| gpt-image-1-mini | $2.00 | $2.50 | $0.25 | $8.00 |
依品質估算的單張成本
以下估算以 1024×1024 的文生圖、50–100 字提示詞為前提。實際費用會隨解析度與提示詞複雜度增加。
| 品質 | gpt-image-2 | gpt-image-1.5 | gpt-image-1-mini |
|---|---|---|---|
| 低 | ~$0.006 | ~$0.009 | ~$0.003 |
| 中 | ~$0.03–0.07 | ~$0.04–0.08 | ~$0.01 |
| 高 | ~$0.10–0.21 | ~$0.10–0.20 | ~$0.03–0.05 |
表中的「低」、「中」、「高」對應 API 請求裡的 quality 參數,例如 quality="low"。各設定決定模型用於繪製細節的 Token 預算;低品質產生的輸出 Token 較少,因此成本也較低。
有個看似反直覺的細節:GPT Image 1.5 的圖片輸出 Token 價格為 $32/1M,高於 GPT Image 2 的 $30/1M。因此,若要進行低品質快速原型製作,GPT Image 2 每張 $0.006,反而比 GPT Image 1.5 的 $0.009 更便宜。
gpt-image-1-mini的價格約只有三分之一。以高量工作流程來說,例如產生 10,000 張商品變體預覽,$0.003 與 $0.006 的單張差距,每批可省下 $30。
解析度彈性與圖片編輯能力
GPT Image 2可透過 size 參數接受任意解析度,但須符合以下限制,規格來自OpenAI 文件:
- 最長邊 < 3,840px
- 兩邊長度皆須為 16 的倍數
- 長寬比 ≤ 3:1
- 總像素介於 655,360 與 8,294,400 之間
常見輸出尺寸包括:1024×1024(正方形)、2560×1440(穩定的 2K),以及 3824×2144(實驗性質的接近 4K)。OpenAI 也提醒,超過 2K 的結果「變異性較高」。
GPT Image 1.5則固定支援四種尺寸:1024×1024、1024×1536、1536×1024 與 auto,不能自訂解析度。
在圖片編輯方面,GPT Image 2 以 1,255 Elo 位居 Artificial Analysis 圖像編輯競技場第一,領先 Google 的 Nano Banana Pro(1,247)。GPT Image 1.5 的 input_fidelity 參數,則讓使用者能明確控制編輯時對原始圖片的保留程度。GPT Image 2 不支援此參數,OpenAI 的說法是其「輸出預設已具備高保真度」。
| 功能 | gpt-image-2 | gpt-image-1.5 | gpt-image-1-mini |
|---|---|---|---|
| 最高解析度 | ~4K(實驗性質) | 1536×1024(固定) | 1536×1024(固定) |
| 自訂長寬比 | 可以 | 不行(4 種預設 + auto) | 不行(4 種預設 + auto) |
| 推理步驟 | 有 | 無 | 無 |
| input_fidelity | 停用(固定高保真) | Low / High | Low / High |
| 編輯競技場 Elo | 1,255(#1) | 未單獨排名 | 未排名 |
不同工作,該選哪一款 GPT 圖像模型?
行銷素材與廣告創意
使用中或高品質的 GPT Image 2。它的推理步驟更能理解創意簡報式提示詞,生成較準確的排版與文字。OpenAI 的指南建議,針對這款模型應把提示詞寫成「創意簡報」,而不是純技術規格。
商品情境圖與電商素材
主視覺用 GPT Image 2,變體預覽用 gpt-image-1-mini。主打商品圖可用高品質 GPT Image 2,彈性解析度能對應商店頁面的精確尺寸;接著再以 gpt-image-1-mini 產生不同顏色、角度或背景的版本,每張僅 $0.003。一條有 50 個 SKU、每個 SKU 需 5 種變體的產品線,以 mini 的低品質生成,總成本約為 $0.75。
資訊圖表與大量文字圖片
選 GPT Image 2。根據 Artificial Analysis,它對拉丁字母與 CJK 文字的渲染近乎完美。GPT Image 1.5 能處理簡單文字,但在多字體、資訊密集的版面中可能漏字。品質建議設為中或高,因為所有模型在低品質下的文字可讀性都會下降。
高量批次生成
低品質 gpt-image-1-mini。單張 $0.003,生成 100,000 張的成本是 $300。如果品質比吞吐量更重要,低品質 GPT Image 2 的 $0.006 也算合理。GPT Image 1.5 在這方面沒有成本優勢,因為它的圖片輸出 Token 每 100 萬個比 GPT Image 2 高出 $2。
反覆修改的編輯流程
一般編輯選 GPT Image 2;需要控制 input_fidelity 時選 GPT Image 1.5。GPT Image 2 在編輯競技場領先,但 GPT Image 1.5 的保真度切換可讓你在「盡量完整保留」與「較自由地重新詮釋」之間選擇。若你的工作流程依賴這項控制,GPT Image 1.5 在功能結構上更有優勢。
常見問題
GPT Image 2 一定比 GPT Image 1.5 好嗎?
不一定,取決於工作流程。GPT Image 1.5 在編輯時提供 input_fidelity 控制,而且在岩石、植被、毛髮等自然場景中,不會出現使用者回報於 GPT Image 2 的重複紋理瑕疵。若你需要嚴格保留原圖內容,GPT Image 1.5 可能更好;但在文字生成、提示詞遵從度和擬真度上,GPT Image 2 勝出。
我還需要用 GPT-4o 生成圖片嗎?
不需要,除非你只能使用消費者版 ChatGPT 介面,無法存取 API。OpenAI 已將 GPT-4o 背後的 GPT Image 1 歸為「僅供舊版相容性使用」,並建議遷移至 GPT Image 2。
GPT Image 2 可以免費使用嗎?
ChatGPT 免費方案與每月 $8 的 Go 方案都提供有限度的圖片生成功能。若使用 API,新 OpenAI 帳號可獲得 $5 免費額度,依品質設定不同,約可生成 25–800 張圖片。
gpt-image-1-mini 適合做什麼?
它適合高產量、成本敏感的工作:快速發想、A/B 測試變體、佔位素材、縮圖預覽,以及批次個人化內容。低品質下每張約 $0.003,約比中品質 GPT Image 2 便宜 10 倍。若是文字很多的圖片,或需要靠首次生成品質減少審稿輪次的客戶素材,則不建議使用它。