現在幾乎每個 AI 圖像模型都說自己很會生成文字,但實際表現往往沒有宣傳得那麼可靠。這次我用完全相同的兩組提示詞,分別測試 GPT Image 2、Nano Banana 2、Nano Banana Pro 與 Seedream 5 Pro:一組是含四個文字區塊的咖啡包裝,另一組是有六項標示的登入 UI。結果很明確:GPT Image 2 是唯一一次生成就能讓四個文字區塊全數清楚、拼字正確的模型;不過,這不代表它適合所有類型的工作。
測試怎麼做:兩種場景,考驗多區塊文字能力
只拿單一單字來比較文字生成沒有太大意義。能在海報上正確寫出「HELLO」的模型,碰上同時有四個文字區域的產品包裝標籤,未必還撐得住。因此,這次刻意設計兩組提示詞,鎖定實務上最常出問題的情境:同一張圖中,同時生成多個不同尺寸的文字區塊。
測試 1|咖啡袋包裝:包含「PREMIUM ROAST」大型標題、「Single Origin Colombia」副標、「340g / 12 oz」小字,以及「Ethically Sourced Since 2019」標語;同一件產品上共有四個獨立文字區域。
測試 2|手機登入 UI:包含「Welcome Back」標題、「Sign in to your account」說明文字、「Email Address」與「Password」欄位標籤、「Sign In」按鈕,以及「Forgot your password?」和「Don't have an account? Sign Up」頁尾文字,共六個獨立文字元素。
每組提示詞都在各模型上只執行一次,輸出尺寸為 1024×1024 或對等規格,沒有挑圖。以下看到的都是第一次生成結果,不是五次之中最好的一張。
本次測試模型:
| 模型 | 開發商 | API 識別碼 |
|---|---|---|
| GPT Image 2 | OpenAI | gpt-image-2 |
| Nano Banana 2 | Google DeepMind | gemini-3.1-flash-image |
| Nano Banana Pro | Google DeepMind | gemini-3-pro-image |
| Seedream 5 Pro | ByteDance | seedream-v5-pro |
另外,我也透過各自的 API,以相同提示詞檢查了 Ideogram V3 和 FLUX.2。由於兩者目前未上架 AIReiter 平台,這裡不提供完整測試圖片,但會在後續的選擇建議中提及結果。
咖啡包裝實測:四個文字區塊才是真考驗
咖啡袋這組提示詞要求模型在不同尺寸下處理四段文字。這正是區分模型究竟真的能生成文字,還是只是剛好把單一單字做對的典型情境。
GPT Image 2 正確生成四個文字區塊。「PREMIUM ROAST」粗體且置中;副標「Single Origin Colombia」沒有任何錯字;小尺寸的「340g / 12 oz」仍清晰可辨,標語拼字也正確。沒有憑空出現的字元,也沒有遺漏文字區塊。
Nano Banana 2 的標題與副標表現正確,但小字開始失準。「340g」正確生成,不過「12 oz」和周圍的設計元素混在一起;標語則有字距不一致的問題。另一方面,它的場景品質是四者中最佳,桌面材質與光線更像真正的產品攝影,而不只是渲染圖。
Nano Banana Pro 做出了視覺衝擊感最強的設計,字體風格更突出,也帶有編輯設計感。標題很乾淨,但副標有一個字元被替換,小字也有部分內容是模型自行編造。Nano Banana Pro 對待文字更像是設計元素,而不是需要精準無誤的內容。
Seedream 5 Pro 的標題與副標正確,重量文字大致無誤,但標語有一個拼字錯誤。ByteDance 的模型在中文文字上的能力相當突出,我以另一組中文標籤提示詞驗證過;不過在英文多區塊文字方面,仍比 GPT Image 2 稍遜一籌。
| 模型 | 標題正確? | 副標正確? | 重量文字正確? | 標語正確? | 四個區塊都乾淨正確? |
|---|---|---|---|---|---|
| GPT Image 2 | 是 | 是 | 是 | 是 | 是 |
| Nano Banana 2 | 是 | 是 | 部分正確 | 字距有誤 | 否 |
| Nano Banana Pro | 是 | 字元替換 | 否 | 否 | 否 |
| Seedream 5 Pro | 是 | 是 | 大致正確 | 1 個拼字錯誤 | 否 |
登入 UI 實測:同框六項文字標示
登入畫面的難度高於包裝測試,因為它不只要求六個不同尺寸的文字元素,也必須同時維持按鈕、輸入欄位等 UI 結構。這組測試看的不只是文字準確度,還包括版面配置是否有紀律。
GPT Image 2 生成了可辨識的登入畫面,六個文字元素全都存在且拼字正確。按鈕文字置中,欄位標籤位於輸入區上方,頁尾文字也清楚可讀。版面並非像素等級的完美,畢竟目前沒有 AI 生成 UI 能做到這點;但每段文字都看得懂,位置也正確。
Nano Banana 2 做出了乾淨好看的 UI,標題與按鈕文字都正確。欄位標籤雖然存在,但仔細看會發現「Password」有細微的字元問題。頁尾的「Forgot your password?」可辨識,但「Don't have an account? Sign Up」這一行有部分遭截斷。整體設計比 GPT Image 2 的輸出更現代,但文字完整度較低。
Seedream 5 Pro 生成的畫面具備可用的介面結構,版面安排也不錯。標題正確,但欄位標籤和頁尾文字偏差更明顯;按鈕文字則很乾淨。整體來說,六個文字元素中有 4 個完全正確。
「AI 圖像模型仍然無法可靠地生成文字……你還是得用 photoshop。」— 一位 r/StableDiffusion 使用者針對本機模型的評論;不過到了 2026 年,本機模型與 API 模型之間的差距已明顯拉大
| 模型 | 標題 | 說明文字 | 欄位標籤 | 按鈕 | 頁尾文字 | 得分(滿分 6) |
|---|---|---|---|---|---|---|
| GPT Image 2 | 是 | 是 | 是 | 是 | 是 | 6/6 |
| Nano Banana 2 | 是 | 是 | 部分正確 | 是 | 部分正確 | 4/6 |
| Seedream 5 Pro | 是 | 部分正確 | 部分正確 | 是 | 部分正確 | 3.5/6 |
文字密集圖片的成本,不能只看單張報價
文字多的圖片有個容易被忽略的成本放大器:第一次生成只要拼錯字,就得重跑。以下價格是官方 API 的單張圖片費用,但在重視文字正確性的工作裡,實際成本還要乘上取得乾淨文字所需的生成次數。
| 模型 | 1024×1024 成本 | 2K+ 成本 | 首次生成文字準確度(本次 2 組提示詞測試) |
|---|---|---|---|
| GPT Image 2 | 約 $0.020(medium) | 約 $0.067(high,2K) | 兩組提示詞首次生成皆乾淨正確 |
| Nano Banana 2 | 約 $0.020 | 約 $0.040(4K) | 標題/副標正確;小字偏移 |
| Nano Banana Pro | 約 $0.050 | 約 $0.060 | 標題正確;四個區塊中有 3 個出錯 |
| Seedream 5 Pro | 約 $0.035 | — | 標題/副標正確;標語拼字錯誤 |
當文字準確度很重要時,模型的真實成本必須包含重跑次數。一張 $0.020 的圖片若需要重新生成三次才得到乾淨文字,成本就是 $0.060。
資料來源:OpenAI API 定價(於 2026 年 8 月查核)、Google Gemini API 定價(於 2026 年 8 月查核)、AIReiter 定價頁面。
GPT Image 2 用於文字工作的成本優勢,主要來自節省重跑次數。本次兩組測試提示詞中,它都在第一次生成時產出乾淨文字,無須重跑;其他模型至少都要重試一次,才能讓所有文字區塊正確。
Imagen 4 呢?Google 將於 2026 年 8 月 17 日關閉 Imagen 4 API 端點,並引導開發者改用 Nano Banana 系列模型。如果你目前仍有 Imagen 4 的文字生成流程,現在就該規劃遷移。
不同需求該選哪一款模型?
多區塊、高密度文字:GPT Image 2
資訊圖表、附有成分表的包裝、UI 畫面、標示繁多的圖表、多語言招牌,都適合優先選 GPT Image 2。它是本次測試中唯一能在一次生成內,正確維持四個以上文字區塊的模型。它也支援遮罩式編輯,可只修正拼錯的一個標籤,不必重新生成整張圖。OpenAI 文件確認其輸出尺寸最長邊最高可達 3840px,且尺寸彈性高。
寫實場景中的短標題:Nano Banana 2
例如街景照片中的招牌,或生活風格商品照裡瓶身上的品牌名稱。Nano Banana 2 在本次測試模型中能產出最寫實的場景,也能穩定處理 1 至 2 個短文字元素。問題通常從第三個以上的獨立文字區塊開始出現。
Nano Banana 2 與 Nano Banana Pro 都可透過 API 使用。
以排版設計為主的文字:Ideogram V3
若需求是海報、帶有文字的 Logo 或專輯封面,Ideogram V3 會把文字視為一級設計元素處理,包括字距微調、字型風格控制與理解版面配置的提示詞擴展。多個獨立比較都將它列為單一標題排版的首選。它尚未在 AIReiter 上提供,因此未納入本文完整圖片測試。
CJK 與多語言文字:先選 GPT Image 2
根據競品測試與 Google 官方文件,GPT Image 2 對非拉丁字母的可靠度最高。由 ByteDance 開發的 Seedream 5 Pro,則是處理中文字符時很不錯的備選。無論使用哪個模型,非拉丁文字輸出都應找母語使用者校對。
低成本大量生成、文字需求極少:Nano Banana 2 Lite 或 Seedream 5 Lite
如果文字只是次要元素,例如小型浮水印或單一單字,而你又需要低成本大量生成,Nano Banana 2 Lite(gemini-3.1-flash-lite-image)與 Seedream 5 Lite 是最便宜的 API 選項。我沒有對這兩款模型進行高密度文字壓力測試,因此其文字能力應視為比完整版同系模型低一個等級。
常見問題
2026 年哪一款 AI 圖像模型生成文字最準?
在多區塊文字情境中,GPT Image 2 以明顯差距領先。在咖啡包裝測試裡,它第一次生成就正確處理四個獨立文字區塊;Nano Banana 2 和 Seedream 5 Pro 則各至少有一個元素出現錯誤。若只需要一個短標題,Nano Banana 2 與 Ideogram V3 都是很強的選擇。
AI 可以生成文字清楚的 Logo 嗎?
可以。Ideogram V3 最適合帶文字的 Logo,字距、對齊與字型風格處理能力是通用型模型難以比擬的。GPT Image 2 是可靠的第二選擇,處理 Logo 中較長的文字也更有優勢。不過,在正式投入使用前,仍應放大檢查每一個字元。
為什麼 AI 會把圖片裡的文字拼錯?
主要是三個因素疊加。首先,字母幾乎沒有容錯空間:把「B」的一筆換掉,就可能變成「R」或無意義字元;但一張臉即使有幾個百分點的偏差,仍然看起來像一張臉。第二,錯誤機率會隨元素數量增加:每個文字區塊都是獨立的精準限制,一組有五個標籤的提示詞,就有五次可能失敗。第三,非拉丁文字的字形集合大得多,訓練資料也較不整齊,要精準生成字元自然難得多。
Imagen 4 現在還適合用來生成文字嗎?
不適合新專案。Google 將在 2026 年 8 月 17 日停止 Imagen 4 API,並建議改用 Nano Banana 系列模型。如果你已有 Imagen 4 工作流程,現在就應開始遷移。
要用最低成本取得正確的 AI 圖中文字,怎麼做?
GPT Image 2 的 medium 品質每張約 $0.020,因為所需重跑次數較少,成本與準確度的比例最佳。Nano Banana 2 的單張價格相近,但要生成乾淨的多區塊文字通常得多跑幾次,因此在文字要求嚴格的工作中,有效成本反而更高。
延伸閱讀
- GPT Image 2 vs Nano Banana Pro:正面比較,涵蓋寫實度、價格,以及文字生成以外的應用情境建議
- 2026 最佳 AI 圖像生成器比較,從更多面向檢視各類型圖像品質
- Seedream 5 Pro vs Nano Banana Pro,深入拆解 ByteDance 與 Google 圖像模型的差異