Avec Z-Image Turbo, pas de guidance ni de champ négatif séparé : toutes les consignes doivent vivre dans le prompt principal. Considérez-le comme un brief créatif concis, auquel vous ajoutez aussi les exigences de nettoyage. C'est le workflow documenté par Tongyi-MAI et fal.
La décision de prompt qui transforme les résultats de Z-Image Turbo
Plutôt qu'une accumulation de mots-clés, rédigez un seul brief en langage naturel : commencez par le type d'image et le sujet, puis précisez le cadrage, le décor, la lumière, le style et les contraintes. La fiche officielle du modèle présente Turbo comme un modèle distillé à 8 NFE avec guidance_scale=0.0 ; le guide de prompting de fal confirme également que les prompts négatifs ne sont pas pris en charge.
Cette structure constitue un point de départ fiable :
- Type d'image et cadrage : portrait serré, photo produit, illustration éditoriale ou scène cinématographique en 16:9.
- Sujet et action : ce qui est visible, ce qui se passe et les détails physiques distinctifs.
- Environnement : le lieu, le moment de la journée, l'arrière-plan et un ou deux accessoires pertinents.
- Lumière et palette : la source, la direction, la douceur, la température et les couleurs dominantes.
- Ancrage stylistique : photographie documentaire, photo produit épurée, aquarelle ou tout autre médium unique.
- Contraintes dans le prompt principal : mise au point nette, fond propre, mains naturelles, texte exact entre guillemets, absence de filigrane ou de marque.
Réécrire un prompt : passer du joli visuel à un résultat exploitable
Les réécritures suivantes isolent un seul impératif de production à la fois. Vous pouvez ainsi identifier l'origine d'un échec plutôt que d'empiler des adjectifs au hasard.
Définissez la hiérarchie visuelle avant les adjectifs
Prompt vague :
Beautiful woman in a garden, cinematic, highly detailed, 8K.
Prompt de production :
Medium portrait of an adult woman pruning red roses in a Victorian garden, three-quarter view, her hands and pruning shears visible in the foreground. Moss-covered stone wall behind her, early morning, dappled sunlight through oak leaves, muted green and warm red palette, documentary lifestyle photography, soft natural skin texture, sharp focus on her face and hands, clean composition with no logo or watermark.
Le second prompt commence par le type de plan, l'action, la profondeur, la lumière et la palette. Des qualificatifs flous comme « beautiful » ne donnent à Z-Image Turbo aucun élément concret à représenter.
Remplacez les prompts négatifs par des contraintes explicites
Pour le pipeline Turbo, ne comptez pas sur un champ séparé tel que negative_prompt: "blur, extra fingers, clutter". Intégrez les caractéristiques souhaitées comme les exclusions directement au prompt principal :
| Défaut à éviter | Formulation à essayer dans le prompt principal |
|---|---|
| Sujet flou | sharp focus on the subject, crisp fine detail |
| Arrière-plan chargé | simple clean backdrop, uncluttered negative space |
| Mains maladroites | natural hands with five clearly separated fingers |
| Marquage indésirable | plain unbranded surface, no visible logo or watermark |
| Lettres parasites | no extra lettering, only the quoted title is readable |
Turbo ne propose pas de champ dédié aux prompts négatifs ; vous pouvez malgré tout inscrire une exclusion telle que « no watermark » dans le prompt principal.
Un seul repère photo suffit, pas un CV de photographe
Ajoutez un unique repère lié à l'appareil ou à la pellicule, puis réservez le reste du prompt au sujet et à la composition, par exemple : 35mm street-photography framing, cool window light, visible fabric texture.
La base à huit étapes, et les cas où la vitesse ne doit pas primer
L'exemple officiel de Z-Image-Turbo utilise num_inference_steps=9, ce qui correspond, selon la fiche Tongyi-MAI, à huit passes avant DiT. Ce même exemple emploie guidance_scale=0.0, une seed fixe et une image de 1024 × 1024. Ne confondez pas ce réglage reproductible avec une promesse universelle de temps réel : l'affirmation d'une latence inférieure à une seconde concerne du matériel H800 d'entreprise, tandis que les exécutions sur des machines grand public peuvent être nettement plus lentes.
La page du modèle fal annonce un réglage de 1 à 8 étapes, jusqu'à 4 images par requête et une sortie pouvant atteindre 4 mégapixels. C'est une approche raisonnable pour la production : utilisez le minimum d'étapes pour les miniatures exploratoires, puis rapprochez-vous de huit étapes pour les assets à conserver.
| Paramètre | Point de départ pratique | Ce qu'il modifie |
|---|---|---|
| Étapes d'inférence | 8 passes avant, souvent présentées comme 9 réglages | Le principal compromis qualité/latence de Turbo |
| Échelle de guidance | 0.0 | Turbo est distillé sans contrôle CFG classique |
| Résolution | 1024 × 1024 pour un test équilibré | Les sorties plus grandes coûtent davantage et révèlent les erreurs de composition |
| Format | Préréglage carré, portrait ou paysage | Adaptez le canevas au canal de publication |
| Seed | Fixe pendant la modification d'un prompt | Facilite la comparaison des changements de formulation |
| Lot | 2 à 4 variantes lorsque c'est pris en charge | Permet de sélectionner plutôt que de faire confiance à un seul essai |
| Expansion du prompt | Facultative, surtout pour les prompts courts | Peut ajouter des détails, mais aussi surcharger un brief déjà précis |
Ce qui distingue les alternatives rapides
Les sources publiques s'appuient sur des matériels et réglages non comparables. Il s'agit donc d'une comparaison de workflows, pas de vitesse sur un même GPU.
| Modèle | Parcours rapide documenté | Compromis sur le prompt et la qualité | Quand le choisir |
|---|---|---|---|
| Z-Image Turbo | 8 NFE ; compatibilité revendiquée avec un appareil grand public doté de 16 Go ; latence inférieure à une seconde revendiquée sur H800 | Fortes revendications en photoréalisme et en texte anglais/chinois, mais diversité faible dans la table du modèle et absence de CFG dans Turbo | À choisir pour les premiers passages à gros volume et les concepts commerciaux bilingues |
| FLUX.1-schnell | 1 à 4 étapes ; l'exemple officiel Diffusers utilise 4 étapes et guidance_scale=0.0 | Modèle 12B avec un vaste écosystème local et une licence Apache 2.0 ; la fiche du modèle ne publie pas de benchmark en temps réel | À choisir si le workflow en 1 à 4 étapes et les outils locaux établis comptent davantage que l'accent mis par Z-Image sur le texte |
| SDXL Turbo | 1 à 4 étapes, guidance_scale=0.0, entraîné et configuré par défaut en 512 × 512 | La documentation Diffusers prévient que 768² et 1024² peuvent dégrader le résultat ; la licence commerciale doit être vérifiée | À choisir pour les aperçus temps réel en 512 px ou un pipeline SDXL existant |
La table du modèle et la documentation de l'endpoint ne sont pas parfaitement alignées au sujet des adapters : le zoo officiel de modèles indique que le fine-tuning de Turbo est N/A, tandis que le guide fal documente un endpoint LoRA Turbo. Considérez donc la disponibilité des LoRA comme dépendante du wrapper ; si l'entraînement d'adapters est central, le modèle Z-Image de base est le point de départ le plus sûr.
Des modèles de prompts qui tiennent la route en production par lots
En production par lots, gardez la seed fixe pendant les ajustements de formulation et ne la faites varier qu'une fois la composition stabilisée.
Travaillez en trois temps :
- Explorer : utilisez un prompt court et structuré, plusieurs seeds et un réglage d'étapes faible ou équilibré.
- Sélectionner : conservez la composition qui porte l'idée, puis affinez le texte, les mains et le placement produit avec une seed fixe.
- Finaliser : passez le concept retenu sur un modèle plus lent ou plus contrôlable lorsqu'un visuel de campagne exige un maximum de détail, de diversité ou de fine-tuning.
Visuels éditoriaux et sociaux
Choisissez une métaphore visuelle et un seul point focal, qui reste lisible au format miniature.
Modèle : Editorial illustration of [subject] showing [visual metaphor], [foreground focal object] placed at [left/center/right], [simple background], [two-color palette], [lighting], clean thumbnail-readable composition, no text, no watermark.
Exemple : Editorial illustration of a crowded AI content pipeline narrowing into a single human editor’s desk, a bright blue funnel on the right guiding scattered paper drafts toward one selected page, warm orange and teal palette, clean isometric composition, soft studio lighting, no text, no watermark.
Produits et packagings
Pour les prises de vue produit, privilégiez la géométrie et le comportement des surfaces plutôt que l'ambiance. Indiquez la position du produit, son matériau, la direction de la lumière et le texte exact à afficher.
Exemple : Photorealistic matte-black coffee bag standing upright on a warm-gray stone surface, front-facing three-quarter product view, softbox from the upper left, controlled shadow to the right, subtle paper texture, premium packaging photography. The front label contains only the readable text “YUNNAN COFFEE” in small cream serif capitals, no other lettering, no logo, no watermark.
Pour un packaging, limitez le texte requis et citez-le exactement. La fiche officielle de Z-Image met en avant le rendu de texte anglais et chinois, mais des libellés courts sont une cible de production plus sûre qu'un menu dense ou un paragraphe en petits caractères.
Des portraits sans effet peau lissée
Pour un portrait, ajoutez une action ordinaire, une expression précise et un indice de texture discret plutôt que de vous en remettre au seul mot « photorealistic ».
Exemple : Candid medium portrait of an adult man repairing a bicycle outside a neighborhood workshop, slightly uneven eyebrows, natural skin texture, worn navy work jacket, eyes focused on the bicycle rather than the camera, late-afternoon side light, muted blue and rust palette, 35mm documentary photography, sharp hands and face, clean background with no branding.
Images avec texte
Placez le texte exact suffisamment tôt dans le prompt pour qu'il soit pris en compte, puis décrivez son emplacement et sa typographie. Si un même design contient de l'anglais et du chinois, traitez-les comme des éléments distincts.
Exemple : Photorealistic tea-bar storefront at dusk, centered hanging sign with the exact Chinese text “山茶” above the exact English text “MOUNTAIN TEA,” both in large cream serif lettering, warm interior light, clean glass facade, menu board with only the short word “OOLONG,” uncluttered urban composition, no extra text, no logo, no watermark.
Les titres courts et placés en grand sont plus fiables que les petites étiquettes ; vérifiez toujours le rendu du texte avant publication.
Résoudre les problèmes que rencontrent réellement les utilisateurs
Le tableau de dépannage ci-dessous privilégie une modification du prompt avant tout changement de seed ou de runtime. Un utilisateur résume ainsi l'expérience :
“It was Z Image Turbo, it can be janky sometimes, and needs proper prompting but it can deliver really good stuff.” — @RodAndByte
| Symptôme | Première modification du prompt | À modifier ensuite |
|---|---|---|
| Visage plastique ou regard figé vers l'objectif | Ajoutez une action réelle, candid, unposed et une direction du regard claire | Ne changez la seed qu'une fois la formulation stabilisée |
| Le texte dérive ou des mots supplémentaires apparaissent | Citez le court texte exact, indiquez sa taille et son emplacement, puis supprimez les textes secondaires | Essayez une autre seed et vérifiez à la taille finale de sortie |
| La scène produit devient encombrée | Limitez les accessoires à un ou deux et définissez les positions au premier plan et à l'arrière-plan | Réduisez le langage stylistique avant d'augmenter les étapes |
| Les mains sont incorrectes | Décrivez l'action visible des mains et demandez une anatomie naturelle à cinq doigts | Générez plusieurs seeds ; n'attendez pas qu'un seul essai règle le problème |
| La génération locale est lente ou instable | Vérifiez le wrapper, le dtype, la mémoire GPU et la résolution avant de réécrire le prompt | Utilisez un endpoint hébergé pour tester le débit |
Les retours de @iamzhihui et @9o_zZz_o6 montrent que la vitesse en local varie selon les Mac, les cartes GTX plus anciennes et les configurations. Testez donc le wrapper, le dtype, la mémoire, la résolution et l'état de compilation avant de juger le prompt.
FAQ : les prompts Z-Image Turbo
Les prompts négatifs fonctionnent-ils avec Z-Image Turbo ?
Aucun champ de prompt négatif séparé n'est pris en charge dans le workflow Turbo documenté. Placez les caractéristiques désirées et les exclusions, telles que « no watermark », dans le prompt principal.
Faut-il utiliser 8 ou 9 étapes d'inférence ?
Suivez la nomenclature de l'endpoint : Tongyi-MAI utilise num_inference_steps=9 pour huit passes avant DiT, tandis que fal expose une plage de 1 à 8.
Quelle longueur doit faire un prompt Z-Image Turbo ?
Le manuel communautaire de prompting et le guide MindCraft donnent tous deux une fourchette de travail d'environ 80 à 250 mots, et non une limite officielle de tokens ; éliminez les concepts concurrents avant d'ajouter des détails.
Z-Image Turbo est-il plus rapide que FLUX schnell ou SDXL Turbo ?
Les sources publiques ne proposent pas de test de latence équitable sur un même matériel : Z-Image Turbo utilise huit NFE, tandis que FLUX.1-schnell et SDXL Turbo documentent une à quatre étapes.
Convient-il à une grande production d'images par lots ?
Oui, pour générer et sélectionner des concepts de premier jet : fal annonce jusqu'à quatre images par requête. Gardez donc la seed fixe pour modifier le prompt et faites varier les seeds pour la sélection.
Pourquoi les exécutions locales deviennent-elles lentes ou instables ?
L'affirmation d'une latence inférieure à une seconde est liée au matériel H800. Vérifiez donc la VRAM, le dtype, la résolution, le wrapper et la compilation avant d'attribuer un ralentissement local à un problème de prompt.