O Z-Image Turbo não trabalha com guidance nem com um campo separado de prompt negativo. Aqui, as restrições entram no próprio prompt principal: pense nele como um briefing criativo conciso, incluindo também os requisitos de limpeza da imagem. Esse é o fluxo documentado pela Tongyi-MAI e pela fal.
O princípio de prompt que muda os resultados do Z-Image Turbo
Em vez de empilhar tags, escreva um briefing em linguagem natural. Comece pelo tipo de imagem e pelo assunto; depois, defina composição, cenário, luz, estilo e restrições. O model card oficial apresenta o Turbo como um modelo destilado de 8 NFEs com guidance_scale=0.0. O guia de prompts da fal também informa que prompts negativos não são compatíveis.
Esta sequência é um ponto de partida confiável:
- Tipo de imagem e composição: retrato fechado, foto de produto, ilustração editorial ou cena cinematográfica em 16:9.
- Assunto e ação: quem ou o que aparece, o que está fazendo e quais são os detalhes físicos que o definem.
- Ambiente: local, horário, plano de fundo e um ou dois objetos de cena relevantes.
- Iluminação e paleta: fonte, direção, suavidade e temperatura da luz, além das cores predominantes.
- Referência de estilo: fotografia documental, fotografia de produto limpa, aquarela ou outro meio único.
- Restrições no prompt principal: foco nítido, fundo limpo, mãos naturais, texto entre aspas exatamente como solicitado, sem marca-d’água ou branding.
Como transformar um prompt bonito, mas inútil, em algo pronto para produção
Os exemplos abaixo alteram um requisito de produção por vez. Assim, fica mais fácil identificar a causa de uma falha em vez de sair adicionando adjetivos aleatórios.
Defina a hierarquia visual antes dos adjetivos
Prompt solto:
Beautiful woman in a garden, cinematic, highly detailed, 8K.
Prompt de produção:
Medium portrait of an adult woman pruning red roses in a Victorian garden, three-quarter view, her hands and pruning shears visible in the foreground. Moss-covered stone wall behind her, early morning, dappled sunlight through oak leaves, muted green and warm red palette, documentary lifestyle photography, soft natural skin texture, sharp focus on her face and hands, clean composition with no logo or watermark.
O segundo prompt começa pelo enquadramento, pela ação, pela profundidade, pela luz e pela paleta. Adjetivos vagos como “beautiful” não dão ao Z-Image Turbo nada concreto para representar.
Troque prompts negativos por restrições no prompt principal
No pipeline Turbo, não conte com um campo separado como negative_prompt: "blur, extra fingers, clutter". Inclua no prompt principal tanto os atributos desejados quanto as exclusões:
| Problema a evitar | Formulação para usar no prompt principal |
|---|---|
| Assunto desfocado | sharp focus on the subject, crisp fine detail |
| Fundo poluído | simple clean backdrop, uncluttered negative space |
| Mãos estranhas | natural hands with five clearly separated fingers |
| Branding indesejado | plain unbranded surface, no visible logo or watermark |
| Letras aleatórias | no extra lettering, only the quoted title is readable |
O Turbo não tem um campo independente para prompt negativo. Ainda assim, uma exclusão como “no watermark” pode ser escrita dentro do prompt principal.
Use uma referência de câmera, não um currículo de câmera
Inclua uma única referência de câmera ou filme e deixe o restante do prompt para o assunto e o layout. Por exemplo: 35mm street-photography framing, cool window light, visible fabric texture.
A base de oito etapas — e quando não vale a pena perseguir velocidade
O exemplo oficial do Z-Image-Turbo usa num_inference_steps=9, configuração que, segundo o model card da Tongyi-MAI, resulta em oito passagens forward do DiT. O mesmo exemplo utiliza guidance_scale=0.0, uma seed fixa e uma imagem de 1024 × 1024. Não confunda essa configuração reproduzível do modelo com uma promessa universal de tempo de execução: a alegação de menos de um segundo está vinculada ao hardware empresarial H800, enquanto execuções em equipamentos de consumo podem ser bem mais lentas.
A página do modelo na fal lista uma faixa configurável de 1 a 8 etapas, até 4 imagens por solicitação e saída de até 4 megapixels. Para um fluxo de produção, a orientação é simples: use o menor número de etapas nos thumbnails iniciais e avance em direção a oito etapas para os assets que merecem ser aproveitados.
| Controle | Ponto de partida prático | O que muda |
|---|---|---|
| Etapas de inferência | 8 passagens forward, frequentemente expostas como 9 configurações | É a principal relação entre qualidade e latência no Turbo |
| Escala de guidance | 0.0 | O Turbo foi destilado sem o controle CFG convencional |
| Resolução | 1024 × 1024 para um teste equilibrado | Saídas maiores custam mais e evidenciam erros de composição |
| Proporção | Predefinição quadrada, vertical ou horizontal | Adapte a tela ao canal de publicação |
| Seed | Fixa enquanto o prompt é ajustado | Facilita comparar mudanças na redação |
| Lote | 2–4 variações, quando houver suporte | Permite selecionar resultados em vez de confiar em uma única amostra |
| Expansão de prompt | Opcional, principalmente para prompts curtos | Pode acrescentar detalhes, mas também exagerar em um briefing já detalhado |
O que muda nas alternativas rápidas
As fontes públicas usam hardwares e configurações que não podem ser comparados diretamente. Portanto, esta é uma comparação de fluxo de trabalho, não de velocidade na mesma GPU.
| Modelo | Caminho rápido documentado | Concessão entre prompt e qualidade | Melhor escolha |
|---|---|---|---|
| Z-Image Turbo | 8 NFEs; é alegada compatibilidade com dispositivos de consumo com 16 GB; também é alegada latência inferior a um segundo em H800 | Boas alegações de fotorrealismo e texto em inglês/chinês, mas a tabela do modelo classifica a diversidade como baixa e o Turbo não usa CFG | Escolha para primeiras rodadas em alto volume e conceitos comerciais bilíngues |
| FLUX.1-schnell | 1–4 etapas; o exemplo oficial do Diffusers usa 4 e guidance_scale=0.0 | Modelo de 12B com ecossistema local amplo e licença Apache 2.0; o model card não publica benchmark de tempo de execução | Escolha quando o fluxo de 1–4 etapas e as ferramentas locais já estabelecidas pesam mais do que a ênfase do Z-Image em texto |
| SDXL Turbo | 1–4 etapas, guidance_scale=0.0, treinado/com padrão em 512 × 512 | A documentação do Diffusers alerta que 768² e 1024² podem degradar; o licenciamento comercial precisa ser verificado | Escolha para prévias em tempo real a 512px ou para um pipeline SDXL existente |
A tabela do modelo e a documentação do endpoint não estão perfeitamente alinhadas quanto a adaptadores: o zoo oficial de modelos marca a capacidade de fine-tuning do Turbo como N/A, enquanto o guia da fal documenta um endpoint Turbo LoRA. Trate a disponibilidade de LoRA como algo específico de cada wrapper; se o treinamento de adaptadores for central, o modelo Z-Image base é o ponto de partida mais seguro.
Padrões de prompt que aguentam produção em lote
Na produção em lote, mantenha a seed fixa enquanto ajusta a redação. Só varie as seeds quando a composição estiver estável.
Trabalhe em três estágios:
- Explorar: use um prompt curto e estruturado, várias seeds e uma configuração baixa ou equilibrada de etapas.
- Selecionar: mantenha a composição que comunica a ideia e, com seed fixa, refine texto, mãos e posicionamento do produto.
- Finalizar: leve o conceito escolhido a um modelo mais lento ou mais controlável quando uma imagem de campanha exigir máximo detalhe, diversidade ou fine-tuning.
Visuais editoriais e para redes sociais
Use uma metáfora visual e um ponto focal que continue legível no tamanho de thumbnail.
Modelo: Editorial illustration of [subject] showing [visual metaphor], [foreground focal object] placed at [left/center/right], [simple background], [two-color palette], [lighting], clean thumbnail-readable composition, no text, no watermark.
Exemplo: Editorial illustration of a crowded AI content pipeline narrowing into a single human editor’s desk, a bright blue funnel on the right guiding scattered paper drafts toward one selected page, warm orange and teal palette, clean isometric composition, soft studio lighting, no text, no watermark.
Produtos e embalagens
Em imagens de produto, priorize a geometria e o comportamento da superfície, não a atmosfera. Informe a posição do produto, o material, a direção da luz e o texto exato que precisa aparecer.
Exemplo: Photorealistic matte-black coffee bag standing upright on a warm-gray stone surface, front-facing three-quarter product view, softbox from the upper left, controlled shadow to the right, subtle paper texture, premium packaging photography. The front label contains only the readable text “YUNNAN COFFEE” in small cream serif capitals, no other lettering, no logo, no watermark.
Para embalagens, mantenha o texto obrigatório curto e entre aspas exatamente como deve ser reproduzido. O model card oficial do Z-Image destaca a renderização de texto em inglês e chinês, mas rótulos curtos são um alvo de produção mais seguro do que um cardápio denso ou um parágrafo em letras pequenas.
Retratos sem aparência de pele plastificada
Em retratos, acrescente uma ação comum, uma expressão concreta e uma única indicação discreta de textura. Isso funciona melhor do que depender apenas de “photorealistic”.
Exemplo: Candid medium portrait of an adult man repairing a bicycle outside a neighborhood workshop, slightly uneven eyebrows, natural skin texture, worn navy work jacket, eyes focused on the bicycle rather than the camera, late-afternoon side light, muted blue and rust palette, 35mm documentary photography, sharp hands and face, clean background with no branding.
Imagens com texto
Coloque o texto exato cedo o bastante no prompt para que ele receba atenção; depois, descreva sua posição e tipografia. Quando inglês e chinês aparecerem no mesmo design, trate-os como elementos separados.
Exemplo: Photorealistic tea-bar storefront at dusk, centered hanging sign with the exact Chinese text “山茶” above the exact English text “MOUNTAIN TEA,” both in large cream serif lettering, warm interior light, clean glass facade, menu board with only the short word “OOLONG,” uncluttered urban composition, no extra text, no logo, no watermark.
Manchetes curtas e em tamanho grande são mais confiáveis do que rótulos pequenos. Sempre inspecione o texto gerado antes de publicar.
Como corrigir os problemas que aparecem na prática
A tabela abaixo prioriza uma mudança no prompt antes de mexer na seed ou no tempo de execução. Um usuário resumiu a experiência assim:
“It was Z Image Turbo, it can be janky sometimes, and needs proper prompting but it can deliver really good stuff.” — @RodAndByte
| Sintoma | Primeiro ajuste no prompt | Ajuste seguinte |
|---|---|---|
| Rosto plastificado ou olhar fixo para a câmera | Adicione uma ação real, candid, unposed e uma direção clara para o olhar | Mude a seed somente depois que a redação estiver estável |
| Texto se altera ou aparecem palavras extras | Coloque o texto curto exato entre aspas, especifique tamanho e posição, e remova textos secundários | Teste outra seed e inspecione no tamanho final de saída |
| Cena de produto fica poluída | Limite os objetos de cena a um ou dois e defina as posições de primeiro plano e fundo | Reduza a linguagem de estilo antes de aumentar as etapas |
| Mãos saem erradas | Descreva a ação visível das mãos e solicite anatomia natural de cinco dedos | Gere várias seeds; não espere que uma única amostra resolva isso |
| Geração local lenta ou instável | Verifique wrapper, dtype, memória da GPU e resolução antes de reescrever o prompt | Use um endpoint hospedado para testar throughput |
Relatos de @iamzhihui e @9o_zZz_o6 mostram que a velocidade local varia entre Macs, hardware GTX mais antigo e diferentes configurações. Antes de julgar o prompt, teste o wrapper, dtype, memória, resolução e estado de compilação.
Perguntas frequentes sobre prompts no Z-Image Turbo
Prompts negativos funcionam no Z-Image Turbo?
Não há suporte a um campo separado de prompt negativo no fluxo Turbo documentado. Coloque os atributos desejados e exclusões como “no watermark” no prompt principal.
Devo usar 8 ou 9 etapas de inferência?
Siga a nomenclatura do endpoint: a Tongyi-MAI usa num_inference_steps=9 para oito passagens forward do DiT, enquanto a fal expõe uma faixa de 1 a 8.
Qual deve ser o tamanho de um prompt para Z-Image Turbo?
O manual comunitário de prompting e o guia MindCraft usam aproximadamente 80–250 palavras como faixa de trabalho, não como limite oficial de tokens. Antes de acrescentar detalhes, elimine conceitos concorrentes.
O Z-Image Turbo é mais rápido que FLUX schnell ou SDXL Turbo?
As fontes públicas não trazem um teste justo de latência no mesmo hardware. O Z-Image Turbo usa oito NFEs, enquanto FLUX.1-schnell e SDXL Turbo documentam de uma a quatro etapas.
Ele serve para grandes lotes de geração de imagens?
Sim, para gerar e selecionar conceitos iniciais. A fal lista até quatro imagens por solicitação, então mantenha a seed fixa ao editar prompts e varie as seeds para selecionar resultados.
Por que execuções locais ficam lentas ou instáveis?
A alegação de menos de um segundo está ligada ao hardware H800. Portanto, verifique VRAM, dtype, resolução, wrapper e compilação antes de interpretar uma lentidão local como falha de prompt.