Z-Image Turbo 不用 guidance,也不靠獨立的負面提示詞欄位。你要把畫面需求寫成一段精簡的創意簡報,連同修正與排除條件一起放進主提示詞;這也是 Tongyi-MAI 與 fal 文件建議的操作方式。
先決定畫面優先順序,Z-Image Turbo 的結果就會不同
別把一串標籤丟進去就期待好結果。更可靠的做法,是寫成一段自然語言的創意簡報:先交代圖片類型與主體,再補上構圖、場景、光線、風格與限制條件。官方模型卡指出,Turbo 是經過蒸餾的 8-NFE 模型,採用 guidance_scale=0.0;fal 的提示詞指南也明確表示不支援負面提示詞。
剛開始可以依照以下順序組織提示詞:
- 圖片類型與構圖:近景人像、商品攝影、編輯插畫,或是 16:9 電影感場景。
- 主體與動作:畫面中是誰或什麼、正在做什麼,以及最關鍵的外觀特徵。
- 環境設定:地點、時間、背景,以及一兩個有意義的道具。
- 光線與色彩:光源、方向、柔硬程度、色溫與主色調。
- 風格定位:紀實攝影、乾淨的商品攝影、水彩,或其他單一媒材風格。
- 直接寫進主提示詞的限制:清晰對焦、乾淨背景、自然的手部、精確的引號文字、沒有浮水印與品牌標誌。
提示詞改寫實戰:把好看但不能用的圖,變成可交付素材
以下改寫每次只處理一項製作需求。這樣遇到問題時,能找出真正的失敗原因,而不是不停亂加形容詞。
先交代視覺主次,再談風格形容詞
鬆散的提示詞:
花園裡的漂亮女人,電影感,高細節,8K。
可用於製作的提示詞:
一名成年女性在維多利亞風格花園裡修剪紅玫瑰的中景人像,三分之四側面,她的雙手和修枝剪位於前景。身後是覆滿苔蘚的石牆,清晨時分,橡樹葉間灑落斑駁陽光,低飽和綠色與暖紅色調,紀實生活風格攝影,自然柔和的皮膚質感,臉部與雙手清晰對焦,乾淨構圖,沒有標誌或浮水印。
第二段提示詞先把鏡位、動作、景深、光線與配色講清楚;像「漂亮」這類模糊形容詞,無法給 Z-Image Turbo 足夠具體的繪製線索。
別寫負面提示詞,把排除條件併入主提示詞
使用 Turbo 管線時,不要依賴 negative_prompt: "blur, extra fingers, clutter" 這類獨立欄位。你想要的特質與不想出現的元素,都應該直接寫進主提示詞:
| 要避免的問題 | 可放進主提示詞的寫法 |
|---|---|
| 主體模糊 | sharp focus on the subject, crisp fine detail |
| 背景過於雜亂 | simple clean backdrop, uncluttered negative space |
| 手部不自然 | natural hands with five clearly separated fingers |
| 出現不想要的品牌 | plain unbranded surface, no visible logo or watermark |
| 莫名出現文字 | no extra lettering, only the quoted title is readable |
Turbo 沒有獨立的負面提示詞欄位,但你仍然可以在主提示詞中加入「no watermark」這類排除條件。
一個鏡頭線索就夠了,不必塞進整份器材清單
放一個相機或底片感線索即可,其餘篇幅留給主體與版面安排,例如 35mm street-photography framing, cool window light, visible fabric texture。
八步是實用基準,但別只為了速度犧牲判斷
官方 Z-Image-Turbo 範例使用 num_inference_steps=9,Tongyi-MAI 模型卡說明這會產生八次 DiT 前向傳遞。相同範例也使用 guidance_scale=0.0、固定 seed,以及 1024 × 1024 圖片。別把這組可重現的模型設定,誤認成任何硬體都能達成的速度承諾:專案提到的次秒級表現,是以企業級 H800 硬體為前提;消費級裝置實際執行可能慢得多。
fal 模型頁面列出可設定的 1–8 步範圍、每次請求最多 4 張圖片,以及最高 4 百萬像素輸出。用於實際製作時,建議先以最低步數快速產出縮圖草案,再把值得保留的素材提高到接近八步。
| 控制項目 | 實用起始設定 | 影響範圍 |
|---|---|---|
| 推理步數 | 8 次前向傳遞,介面常顯示為 9 個設定步數 | Turbo 最主要的品質與延遲取捨 |
| Guidance scale | 0.0 | Turbo 蒸餾後不使用一般的 CFG 控制 |
| 解析度 | 1024 × 1024,適合平衡測試 | 輸出越大成本越高,也越容易暴露構圖問題 |
| 長寬比 | 正方形、直式或橫式預設 | 讓畫布比例對應實際發布渠道 |
| Seed | 修改提示詞時固定 | 更容易比較文字調整帶來的差異 |
| 批次數量 | 支援時產生 2–4 個變體 | 讓你可以從多張結果中挑選,而非押注單一樣本 |
| 提示詞擴寫 | 選用,主要適合短提示詞 | 能補充細節,但也可能把已經完整的簡報過度延伸 |
幾個快速模型,工作流程上差在哪裡?
公開資料採用的硬體與設定彼此不可直接比較,因此以下是工作流程比較,不是同一張 GPU 上的速度排名。
| 模型 | 文件中的快速路徑 | 提示詞與品質取捨 | 適合的選擇時機 |
|---|---|---|---|
| Z-Image Turbo | 8 NFE;宣稱可在 16 GB 消費級裝置運行;宣稱 H800 可達次秒延遲 | 主打強大的擬真表現與英文/中文文字能力,但模型表將多樣性評為低,Turbo 也不使用 CFG | 適合大量首輪生成,以及需要雙語商業視覺概念時 |
| FLUX.1-schnell | 1–4 步;官方 Diffusers 範例使用 4 步與 guidance_scale=0.0 | 12B 模型,擁有成熟的本機生態系與 Apache 2.0 授權;模型卡未公布實際耗時基準 | 當 1–4 步工作流程與既有本機工具鏈,比 Z-Image 的文字能力更重要時 |
| SDXL Turbo | 1–4 步、guidance_scale=0.0,訓練與預設解析度為 512 × 512 | Diffusers 文件警告,768² 與 1024² 可能造成品質下降;商業授權需要另行確認 | 適合 512px 即時預覽,或既有 SDXL 管線 |
模型表與端點文件對 adapter 的說法並不完全一致:官方模型庫把 Turbo 的微調能力標為 N/A,但 fal 指南則記錄了 Turbo LoRA 端點。因此,LoRA 是否可用應視包裝器而定;如果 adapter 訓練是核心需求,從基礎版 Z-Image 開始會更穩妥。
能撐過批量生成的提示詞結構
批量製作時,先固定 seed 來修改措辭;等構圖穩定後,再改變 seed 擴大選擇範圍。
可以採用三階段流程:
- 探索:用短而有結構的提示詞,搭配多個 seed 與低步數或平衡步數設定。
- 挑選:留下最能傳達概念的構圖,再固定 seed,收緊文字、手部與商品位置的描述。
- 完成:當活動主視覺需要最高細節、多樣性或微調能力時,把選定概念交給較慢但可控性更高的模型。
編輯插畫與社群視覺
只用一個視覺隱喻與一個焦點,並確保縮圖尺寸下仍看得懂。
範本:以 [subject] 呈現 [visual metaphor] 的編輯插畫,[foreground focal object] 位於 [left/center/right],[simple background]、[two-color palette]、[lighting],乾淨且適合縮圖辨識的構圖,沒有文字、沒有浮水印。
範例:描繪擁擠 AI 內容管線收束到單一人類編輯桌面的編輯插畫,右側有一個亮藍色漏斗,將散落的紙本草稿引導至一張被選中的頁面,暖橘與青綠配色,乾淨的等角構圖,柔和棚燈,沒有文字、沒有浮水印。
商品與包裝視覺
商品圖的優先順序應是幾何結構與表面材質表現,而不是氛圍堆疊。請明確描述商品位置、材質、光線方向,以及必須出現的精確文案。
範例:一包霧面黑色咖啡袋直立於暖灰色石材表面,正面三分之四角度的商品視圖,左上方柔光箱打光,陰影受控地延伸至右側,細微紙張紋理,高級包裝攝影。正面標籤只包含可清楚閱讀的小型奶油色襯線大寫文字「YUNNAN COFFEE」,不含其他文字、沒有標誌、沒有浮水印。
包裝需要的文字應保持簡短,並用引號精確標示。官方 Z-Image 模型卡特別強調英文與中文文字渲染能力,但相較於密集菜單或一整段小字,短標籤仍是更安全的量產目標。
避免磨皮感的人像提示詞
拍人像時,與其只寫「photorealistic」,不如加入一個日常動作、一種具體表情,以及一項克制的材質線索。
範例:一名成年男子在社區修車工作室外修理自行車的自然中景人像,眉毛略微不對稱,自然皮膚質感,穿著磨損的深藍色工作外套,視線專注於自行車而非鏡頭,午後偏晚的側光,低飽和藍色與鐵鏽色調,35mm 紀實攝影,雙手與臉部清晰,乾淨背景且沒有品牌標示。
含文字的圖片
把精確文字放在提示詞前段,讓模型優先處理,再描述它的位置與字體風格。同一張設計若同時包含英文與中文,最好將兩者分別描述為獨立元素。
範例:黃昏時分的擬真茶吧店面,中央懸掛招牌包含精確中文文字「山茶」,下方是精確英文文字「MOUNTAIN TEA」,兩者皆採大型奶油色襯線字體,溫暖室內燈光,乾淨的玻璃立面,菜單板上只有短字「OOLONG」,不雜亂的城市構圖,沒有額外文字、沒有標誌、沒有浮水印。
大尺寸的短標題,比小型標籤更可靠;發布前務必檢查文字輸出。
實際使用者最常碰到的失敗情境,怎麼修
下表優先處理一項提示詞調整,再考慮更換 seed 或改動執行設定。一位實際使用者的心得很貼切:
「它是 Z Image Turbo,有時確實會有點不穩,也需要正確的提示詞,但它能做出很不錯的東西。」— @RodAndByte
| 症狀 | 第一個提示詞調整 | 接著再做的調整 |
|---|---|---|
| 臉部塑膠感重,或眼神總是直視鏡頭 | 加入真實動作、candid、unposed,以及明確的視線方向 | 等措辭穩定後才更換 seed |
| 文字跑掉或多出字詞 | 用引號標示精確短文字,指定大小與位置,移除次要文案 | 換一個 seed,並以最終輸出尺寸檢查 |
| 商品場景變得雜亂 | 道具限制在一兩件,並定義前景與背景位置 | 提高步數前,先減少風格描述 |
| 手部看起來不對 | 描述可見的手部動作,並要求自然的五指解剖結構 | 生成多個 seed;不要期待單一樣本就能解決 |
| 本機生成速度慢或不穩定 | 在改提示詞前,先檢查包裝器、dtype、GPU 記憶體與解析度 | 用託管端點測試吞吐量 |
@iamzhihui 與 @9o_zZz_o6 的回報顯示,Mac、較舊 GTX 硬體及不同配置下的本機速度差異很大。因此,判斷問題是否出在提示詞前,先測試包裝器、dtype、記憶體、解析度與編譯狀態。
Z-Image Turbo 提示詞常見問題
Z-Image Turbo 支援負面提示詞嗎?
不支援獨立的負面提示詞欄位,這是文件所述的 Turbo 工作流程。請將所需特徵與「no watermark」等排除條件一起寫進主提示詞。
推理步數該設 8 還是 9?
依端點的命名為準:Tongyi-MAI 以 num_inference_steps=9 表示八次 DiT 前向傳遞,而 fal 提供的是 1–8 範圍。
Z-Image Turbo 的提示詞該寫多長?
社群提示詞手冊與 MindCraft 指南都將約 80–250 字作為實務範圍,但這不是官方 token 上限;與其一味補細節,不如先刪除彼此競爭的概念。
Z-Image Turbo 比 FLUX schnell 或 SDXL Turbo 快嗎?
公開來源沒有公平的同硬體延遲測試;Z-Image Turbo 使用八次 NFE,而 FLUX.1-schnell 與 SDXL Turbo 文件記載的是一到四步。
適合大量批次生成圖片嗎?
適合用來生成並篩選首輪概念:fal 列出每次請求最多可產生四張圖,因此可在修改提示詞時固定 seed,並透過不同 seed 進行選擇。
為什麼本機執行會變慢或不穩?
次秒級的宣稱是以 H800 硬體為前提,所以別急著把本機變慢歸咎於提示詞。請先檢查 VRAM、dtype、解析度、包裝器與編譯狀態。