Z-Image Turbo trabaja con guía cero y concentra las restricciones en el prompt principal, no en un campo negativo aparte. La forma de usarlo, según documentan Tongyi-MAI y fal, es describir la imagen como un briefing creativo compacto e incluir en ese mismo texto los requisitos de limpieza y control.
La decisión de prompt que define los resultados de Z-Image Turbo
En lugar de acumular etiquetas, redacta un único briefing en lenguaje natural: empieza por el tipo de imagen y el sujeto, y continúa con composición, entorno, luz, estilo y restricciones. La model card oficial presenta Turbo como un modelo destilado de 8 NFE con guidance_scale=0.0; la guía de prompts de fal también indica que no admite prompts negativos.
Este orden es un buen punto de partida:
- Tipo de imagen y composición: retrato cerrado, fotografía de producto, ilustración editorial o escena cinematográfica en 16:9.
- Sujeto y acción: quién o qué aparece, qué está haciendo y cuáles son sus rasgos físicos decisivos.
- Entorno: ubicación, hora del día, fondo y uno o dos elementos de atrezzo relevantes.
- Iluminación y paleta: fuente y dirección de la luz, suavidad, temperatura y colores dominantes.
- Ancla de estilo: fotografía documental, fotografía limpia de producto, acuarela u otro único medio visual.
- Restricciones en el prompt principal: foco nítido, fondo limpio, manos naturales, texto exacto entre comillas, sin marca de agua ni branding.
Cómo convertir un prompt bonito pero poco útil en uno listo para producción
Estos cambios aíslan un requisito de producción cada vez. Así puedes diagnosticar los fallos sin empezar a añadir adjetivos al azar.
Define la jerarquía visual antes de adornar la escena
Prompt impreciso:
Beautiful woman in a garden, cinematic, highly detailed, 8K.
Prompt listo para producción:
Medium portrait of an adult woman pruning red roses in a Victorian garden, three-quarter view, her hands and pruning shears visible in the foreground. Moss-covered stone wall behind her, early morning, dappled sunlight through oak leaves, muted green and warm red palette, documentary lifestyle photography, soft natural skin texture, sharp focus on her face and hands, clean composition with no logo or watermark.
El segundo prompt prioriza el tipo de plano, la acción, la profundidad, la luz y la paleta. Adjetivos vagos como “beautiful” no le dan a Z-Image Turbo nada concreto que representar.
Sustituye los prompts negativos por restricciones en el prompt principal
No dependas de un campo independiente como negative_prompt: "blur, extra fingers, clutter" en el pipeline de Turbo. Incluye tanto los rasgos deseados como las exclusiones dentro del prompt principal:
| Fallo que quieres evitar | Redacción que puedes probar en el prompt principal |
|---|---|
| Sujeto borroso | sharp focus on the subject, crisp fine detail |
| Fondo recargado | simple clean backdrop, uncluttered negative space |
| Manos extrañas | natural hands with five clearly separated fingers |
| Branding no deseado | plain unbranded surface, no visible logo or watermark |
| Letras aleatorias | no extra lettering, only the quoted title is readable |
Turbo no cuenta con un campo separado para prompts negativos, pero puedes escribir “no watermark” como exclusión dentro del prompt principal.
Una referencia de cámara basta; no escribas su currículum
Incluye una sola referencia de cámara o película y reserva el resto del prompt para el sujeto y la composición, por ejemplo: 35mm street-photography framing, cool window light, visible fabric texture.
La referencia de ocho pasos y cuándo no obsesionarse con la velocidad
El ejemplo oficial de Z-Image-Turbo emplea num_inference_steps=9, una cifra que la model card de Tongyi-MAI explica como ocho pasadas hacia delante de DiT. Ese mismo ejemplo usa guidance_scale=0.0, una semilla fija y una imagen de 1024 × 1024. No confundas esa configuración reproducible con una promesa universal de tiempo real: la afirmación de menos de un segundo del proyecto está vinculada a hardware H800 empresarial, mientras que en equipos de consumo las ejecuciones pueden ser bastante más lentas.
La página del modelo en fal indica un rango configurable de 1 a 8 pasos, hasta 4 imágenes por solicitud y una salida de hasta 4 megapíxeles. Su recomendación encaja bien en un flujo de producción: usa el ajuste de menos pasos para bocetos rápidos y acércate a ocho cuando estés generando recursos que merezca la pena conservar.
| Control | Punto de partida práctico | Qué modifica |
|---|---|---|
| Pasos de inferencia | 8 pasadas hacia delante, a menudo expuestas como 9 ajustes | El principal equilibrio entre calidad y latencia en Turbo |
| Escala de guía | 0.0 | Turbo se ha destilado sin el control CFG habitual |
| Resolución | 1024 × 1024 para una prueba equilibrada | Las salidas más grandes cuestan más y hacen más visibles los errores de composición |
| Relación de aspecto | Preajuste cuadrado, vertical u horizontal | Ajusta el lienzo al canal de publicación |
| Semilla | Fija mientras editas el prompt | Facilita comparar los cambios de redacción |
| Lote | 2–4 variantes cuando esté disponible | Te permite seleccionar en lugar de confiar en una sola muestra |
| Expansión de prompt | Opcional, sobre todo para prompts cortos | Puede añadir detalle, pero también elaborar en exceso un briefing ya detallado |
En qué se diferencian las alternativas rápidas
Las fuentes públicas usan hardware y ajustes no comparables, así que esta es una comparación de flujos de trabajo, no de velocidad en la misma GPU.
| Modelo | Ruta rápida documentada | Compromiso entre prompt y calidad | Mejor decisión de uso |
|---|---|---|---|
| Z-Image Turbo | 8 NFE; se afirma que cabe en dispositivos de consumo con 16 GB; se afirma una latencia inferior a un segundo en H800 | Promete fotorealismo sólido y texto en inglés y chino, pero la tabla del modelo califica la diversidad como baja y Turbo no usa CFG | Elígelo para primeras pasadas de gran volumen y conceptos comerciales bilingües |
| FLUX.1-schnell | 1–4 pasos; el ejemplo oficial de Diffusers usa 4 y guidance_scale=0.0 | Modelo de 12B con un amplio ecosistema local y licencia Apache 2.0; la model card no publica una prueba de tiempo real | Elígelo si el flujo de 1–4 pasos y las herramientas locales consolidadas importan más que el énfasis de Z-Image en el texto |
| SDXL Turbo | 1–4 pasos, guidance_scale=0.0, entrenado/con valor predeterminado de 512 × 512 | La documentación de Diffusers advierte que 768² y 1024² pueden degradarse; hay que revisar la licencia comercial | Elígelo para vistas previas en tiempo real a 512 px o para un pipeline SDXL ya existente |
La tabla del modelo y la documentación del endpoint no están completamente alineadas respecto a los adaptadores: el zoo oficial de modelos marca la capacidad de fine-tuning de Turbo como N/A, mientras que la guía de fal documenta un endpoint Turbo LoRA. Considera la disponibilidad de LoRA como algo específico de cada wrapper; si el entrenamiento de adaptadores es esencial, el modelo base Z-Image es un punto de partida más seguro.
Patrones de prompt que resisten la producción por lotes
En producción por lotes, mantén fija la semilla mientras ajustas el texto y varíala solo cuando la composición ya sea estable.
Aplica un ciclo de tres fases:
- Explora: utiliza un prompt breve y estructurado con varias semillas y un ajuste bajo o equilibrado de pasos.
- Selecciona: conserva la composición que mejor comunica la idea y, con una semilla fija, ajusta texto, manos y colocación del producto.
- Finaliza: lleva el concepto elegido a un modelo más lento o controlable cuando una imagen de campaña requiera el máximo detalle, diversidad o fine-tuning.
Visuales editoriales y para redes sociales
Utiliza una única metáfora visual y un punto focal que siga siendo legible en tamaño miniatura.
Plantilla: Editorial illustration of [subject] showing [visual metaphor], [foreground focal object] placed at [left/center/right], [simple background], [two-color palette], [lighting], clean thumbnail-readable composition, no text, no watermark.
Ejemplo: Editorial illustration of a crowded AI content pipeline narrowing into a single human editor’s desk, a bright blue funnel on the right guiding scattered paper drafts toward one selected page, warm orange and teal palette, clean isometric composition, soft studio lighting, no text, no watermark.
Producto y packaging
En las tomas de producto, da prioridad a la geometría y al comportamiento de las superficies antes que a la atmósfera. Indica la posición, el material, la dirección de la luz y el texto exacto que debe aparecer.
Ejemplo: Photorealistic matte-black coffee bag standing upright on a warm-gray stone surface, front-facing three-quarter product view, softbox from the upper left, controlled shadow to the right, subtle paper texture, premium packaging photography. The front label contains only the readable text “YUNNAN COFFEE” in small cream serif capitals, no other lettering, no logo, no watermark.
Para packaging, mantén el texto obligatorio corto y entrecomíllalo exactamente. La model card oficial de Z-Image destaca el renderizado de texto en inglés y chino, pero las etiquetas breves son un objetivo de producción más seguro que un menú denso o un párrafo de texto pequeño.
Retratos que no parecen retocados con aerógrafo
En retratos, añade una acción cotidiana, una expresión concreta y una sola pista de textura discreta, en vez de limitarte a “photorealistic”.
Ejemplo: Candid medium portrait of an adult man repairing a bicycle outside a neighborhood workshop, slightly uneven eyebrows, natural skin texture, worn navy work jacket, eyes focused on the bicycle rather than the camera, late-afternoon side light, muted blue and rust palette, 35mm documentary photography, sharp hands and face, clean background with no branding.
Imágenes con texto
Introduce el texto exacto con suficiente antelación para que reciba atención y, después, describe su ubicación y tipografía. Cuando ambos aparezcan en el mismo diseño, trata el texto en inglés y chino como elementos separados.
Ejemplo: Photorealistic tea-bar storefront at dusk, centered hanging sign with the exact Chinese text “山茶” above the exact English text “MOUNTAIN TEA,” both in large cream serif lettering, warm interior light, clean glass facade, menu board with only the short word “OOLONG,” uncluttered urban composition, no extra text, no logo, no watermark.
Los titulares cortos y colocados en grande son más fiables que las etiquetas pequeñas; revisa el resultado del texto antes de publicar.
Cómo corregir los fallos que realmente encuentran los usuarios
La siguiente tabla de recuperación prioriza un cambio en el prompt antes de tocar la semilla o el tiempo de ejecución. Un usuario resumió la experiencia así:
“It was Z Image Turbo, it can be janky sometimes, and needs proper prompting but it can deliver really good stuff.” — @RodAndByte
| Síntoma | Primer cambio en el prompt | Cambio posterior |
|---|---|---|
| Rostro plástico o mirada fija a cámara | Añade una acción real, candid, unposed y una dirección de mirada clara | Cambia la semilla solo cuando la redacción sea estable |
| El texto se desvía o aparecen palabras extra | Entrecomilla el texto breve exacto, especifica tamaño y posición, y elimina el texto secundario | Prueba otra semilla y revisa el resultado al tamaño final de salida |
| La escena de producto se vuelve recargada | Limita el atrezzo a uno o dos elementos y define las posiciones de primer plano y fondo | Reduce el lenguaje de estilo antes de aumentar los pasos |
| Las manos salen mal | Describe la acción visible de las manos y pide una anatomía natural de cinco dedos | Genera varias semillas; no esperes resolverlo con una sola muestra |
| La generación local es lenta o inestable | Comprueba el wrapper, dtype, memoria de GPU y resolución antes de reescribir el prompt | Usa un endpoint alojado para probar el rendimiento |
Los informes de @iamzhihui y @9o_zZz_o6 muestran que la velocidad local varía entre Mac, hardware GTX antiguo y distintas configuraciones. Antes de juzgar el prompt, prueba el wrapper, dtype, memoria, resolución y estado de compilación.
Preguntas frecuentes sobre prompts para Z-Image Turbo
¿Funcionan los prompts negativos con Z-Image Turbo?
El flujo documentado de Turbo no admite un campo separado para prompt negativo; coloca los rasgos deseados y exclusiones como “no watermark” en el prompt principal.
¿Debo usar 8 o 9 pasos de inferencia?
Sigue la nomenclatura del endpoint: Tongyi-MAI utiliza num_inference_steps=9 para ocho pasadas hacia delante de DiT, mientras que fal expone un rango de 1 a 8.
¿Qué longitud debe tener un prompt para Z-Image Turbo?
El manual comunitario de prompting y la guía de MindCraft sitúan el rango de trabajo aproximadamente entre 80 y 250 palabras; no es un límite oficial de tokens. Antes de añadir detalle, elimina los conceptos que compiten entre sí.
¿Z-Image Turbo es más rápido que FLUX schnell o SDXL Turbo?
Las fuentes públicas no incluyen una prueba de latencia justa en el mismo hardware. Z-Image Turbo usa ocho NFE, mientras que FLUX.1-schnell y SDXL Turbo documentan entre uno y cuatro pasos.
¿Es adecuado para un lote grande de generación de imágenes?
Sí, para generar y seleccionar conceptos de primera pasada: fal indica hasta cuatro imágenes por solicitud, así que fija la semilla al editar prompts y varía las semillas para seleccionar resultados.
¿Por qué las ejecuciones locales se vuelven lentas o inestables?
La afirmación de menos de un segundo está ligada a hardware H800. Revisa VRAM, dtype, resolución, wrapper y compilación antes de considerar que una ralentización local es un fallo del prompt.