AIREITER
DOCS APIPRECIOS
PLANTILLAS
  • AIReiter
  • Blog
  • Guía de prompts para Z Image Turbo: patrones que escalan

Guía de prompts para Z Image Turbo: patrones que escalan

Última actualización: 2026-09-06 02:00:09

Z-Image Turbo trabaja con guía cero y concentra las restricciones en el prompt principal, no en un campo negativo aparte. La forma de usarlo, según documentan Tongyi-MAI y fal, es describir la imagen como un briefing creativo compacto e incluir en ese mismo texto los requisitos de limpieza y control.

Interfaz de fal Z-Image Turbo con un prompt y su resultado

La decisión de prompt que define los resultados de Z-Image Turbo

En lugar de acumular etiquetas, redacta un único briefing en lenguaje natural: empieza por el tipo de imagen y el sujeto, y continúa con composición, entorno, luz, estilo y restricciones. La model card oficial presenta Turbo como un modelo destilado de 8 NFE con guidance_scale=0.0; la guía de prompts de fal también indica que no admite prompts negativos.

Este orden es un buen punto de partida:

  1. Tipo de imagen y composición: retrato cerrado, fotografía de producto, ilustración editorial o escena cinematográfica en 16:9.
  2. Sujeto y acción: quién o qué aparece, qué está haciendo y cuáles son sus rasgos físicos decisivos.
  3. Entorno: ubicación, hora del día, fondo y uno o dos elementos de atrezzo relevantes.
  4. Iluminación y paleta: fuente y dirección de la luz, suavidad, temperatura y colores dominantes.
  5. Ancla de estilo: fotografía documental, fotografía limpia de producto, acuarela u otro único medio visual.
  6. Restricciones en el prompt principal: foco nítido, fondo limpio, manos naturales, texto exacto entre comillas, sin marca de agua ni branding.

Cómo convertir un prompt bonito pero poco útil en uno listo para producción

Estos cambios aíslan un requisito de producción cada vez. Así puedes diagnosticar los fallos sin empezar a añadir adjetivos al azar.

Define la jerarquía visual antes de adornar la escena

Prompt impreciso:

Beautiful woman in a garden, cinematic, highly detailed, 8K.

Prompt listo para producción:

Medium portrait of an adult woman pruning red roses in a Victorian garden, three-quarter view, her hands and pruning shears visible in the foreground. Moss-covered stone wall behind her, early morning, dappled sunlight through oak leaves, muted green and warm red palette, documentary lifestyle photography, soft natural skin texture, sharp focus on her face and hands, clean composition with no logo or watermark.

El segundo prompt prioriza el tipo de plano, la acción, la profundidad, la luz y la paleta. Adjetivos vagos como “beautiful” no le dan a Z-Image Turbo nada concreto que representar.

Sustituye los prompts negativos por restricciones en el prompt principal

No dependas de un campo independiente como negative_prompt: "blur, extra fingers, clutter" en el pipeline de Turbo. Incluye tanto los rasgos deseados como las exclusiones dentro del prompt principal:

Fallo que quieres evitarRedacción que puedes probar en el prompt principal
Sujeto borrososharp focus on the subject, crisp fine detail
Fondo recargadosimple clean backdrop, uncluttered negative space
Manos extrañasnatural hands with five clearly separated fingers
Branding no deseadoplain unbranded surface, no visible logo or watermark
Letras aleatoriasno extra lettering, only the quoted title is readable

Turbo no cuenta con un campo separado para prompts negativos, pero puedes escribir “no watermark” como exclusión dentro del prompt principal.

Una referencia de cámara basta; no escribas su currículum

Incluye una sola referencia de cámara o película y reserva el resto del prompt para el sujeto y la composición, por ejemplo: 35mm street-photography framing, cool window light, visible fabric texture.

La referencia de ocho pasos y cuándo no obsesionarse con la velocidad

El ejemplo oficial de Z-Image-Turbo emplea num_inference_steps=9, una cifra que la model card de Tongyi-MAI explica como ocho pasadas hacia delante de DiT. Ese mismo ejemplo usa guidance_scale=0.0, una semilla fija y una imagen de 1024 × 1024. No confundas esa configuración reproducible con una promesa universal de tiempo real: la afirmación de menos de un segundo del proyecto está vinculada a hardware H800 empresarial, mientras que en equipos de consumo las ejecuciones pueden ser bastante más lentas.

La página del modelo en fal indica un rango configurable de 1 a 8 pasos, hasta 4 imágenes por solicitud y una salida de hasta 4 megapíxeles. Su recomendación encaja bien en un flujo de producción: usa el ajuste de menos pasos para bocetos rápidos y acércate a ocho cuando estés generando recursos que merezca la pena conservar.

ControlPunto de partida prácticoQué modifica
Pasos de inferencia8 pasadas hacia delante, a menudo expuestas como 9 ajustesEl principal equilibrio entre calidad y latencia en Turbo
Escala de guía0.0Turbo se ha destilado sin el control CFG habitual
Resolución1024 × 1024 para una prueba equilibradaLas salidas más grandes cuestan más y hacen más visibles los errores de composición
Relación de aspectoPreajuste cuadrado, vertical u horizontalAjusta el lienzo al canal de publicación
SemillaFija mientras editas el promptFacilita comparar los cambios de redacción
Lote2–4 variantes cuando esté disponibleTe permite seleccionar en lugar de confiar en una sola muestra
Expansión de promptOpcional, sobre todo para prompts cortosPuede añadir detalle, pero también elaborar en exceso un briefing ya detallado

En qué se diferencian las alternativas rápidas

Las fuentes públicas usan hardware y ajustes no comparables, así que esta es una comparación de flujos de trabajo, no de velocidad en la misma GPU.

ModeloRuta rápida documentadaCompromiso entre prompt y calidadMejor decisión de uso
Z-Image Turbo8 NFE; se afirma que cabe en dispositivos de consumo con 16 GB; se afirma una latencia inferior a un segundo en H800Promete fotorealismo sólido y texto en inglés y chino, pero la tabla del modelo califica la diversidad como baja y Turbo no usa CFGElígelo para primeras pasadas de gran volumen y conceptos comerciales bilingües
FLUX.1-schnell1–4 pasos; el ejemplo oficial de Diffusers usa 4 y guidance_scale=0.0Modelo de 12B con un amplio ecosistema local y licencia Apache 2.0; la model card no publica una prueba de tiempo realElígelo si el flujo de 1–4 pasos y las herramientas locales consolidadas importan más que el énfasis de Z-Image en el texto
SDXL Turbo1–4 pasos, guidance_scale=0.0, entrenado/con valor predeterminado de 512 × 512La documentación de Diffusers advierte que 768² y 1024² pueden degradarse; hay que revisar la licencia comercialElígelo para vistas previas en tiempo real a 512 px o para un pipeline SDXL ya existente

La tabla del modelo y la documentación del endpoint no están completamente alineadas respecto a los adaptadores: el zoo oficial de modelos marca la capacidad de fine-tuning de Turbo como N/A, mientras que la guía de fal documenta un endpoint Turbo LoRA. Considera la disponibilidad de LoRA como algo específico de cada wrapper; si el entrenamiento de adaptadores es esencial, el modelo base Z-Image es un punto de partida más seguro.

Patrones de prompt que resisten la producción por lotes

En producción por lotes, mantén fija la semilla mientras ajustas el texto y varíala solo cuando la composición ya sea estable.

Aplica un ciclo de tres fases:

  1. Explora: utiliza un prompt breve y estructurado con varias semillas y un ajuste bajo o equilibrado de pasos.
  2. Selecciona: conserva la composición que mejor comunica la idea y, con una semilla fija, ajusta texto, manos y colocación del producto.
  3. Finaliza: lleva el concepto elegido a un modelo más lento o controlable cuando una imagen de campaña requiera el máximo detalle, diversidad o fine-tuning.

Visuales editoriales y para redes sociales

Utiliza una única metáfora visual y un punto focal que siga siendo legible en tamaño miniatura.

Plantilla: Editorial illustration of [subject] showing [visual metaphor], [foreground focal object] placed at [left/center/right], [simple background], [two-color palette], [lighting], clean thumbnail-readable composition, no text, no watermark.

Ejemplo: Editorial illustration of a crowded AI content pipeline narrowing into a single human editor’s desk, a bright blue funnel on the right guiding scattered paper drafts toward one selected page, warm orange and teal palette, clean isometric composition, soft studio lighting, no text, no watermark.

Producto y packaging

En las tomas de producto, da prioridad a la geometría y al comportamiento de las superficies antes que a la atmósfera. Indica la posición, el material, la dirección de la luz y el texto exacto que debe aparecer.

Ejemplo: Photorealistic matte-black coffee bag standing upright on a warm-gray stone surface, front-facing three-quarter product view, softbox from the upper left, controlled shadow to the right, subtle paper texture, premium packaging photography. The front label contains only the readable text “YUNNAN COFFEE” in small cream serif capitals, no other lettering, no logo, no watermark.

Para packaging, mantén el texto obligatorio corto y entrecomíllalo exactamente. La model card oficial de Z-Image destaca el renderizado de texto en inglés y chino, pero las etiquetas breves son un objetivo de producción más seguro que un menú denso o un párrafo de texto pequeño.

Retratos que no parecen retocados con aerógrafo

En retratos, añade una acción cotidiana, una expresión concreta y una sola pista de textura discreta, en vez de limitarte a “photorealistic”.

Ejemplo: Candid medium portrait of an adult man repairing a bicycle outside a neighborhood workshop, slightly uneven eyebrows, natural skin texture, worn navy work jacket, eyes focused on the bicycle rather than the camera, late-afternoon side light, muted blue and rust palette, 35mm documentary photography, sharp hands and face, clean background with no branding.

Imágenes con texto

Introduce el texto exacto con suficiente antelación para que reciba atención y, después, describe su ubicación y tipografía. Cuando ambos aparezcan en el mismo diseño, trata el texto en inglés y chino como elementos separados.

Ejemplo: Photorealistic tea-bar storefront at dusk, centered hanging sign with the exact Chinese text “山茶” above the exact English text “MOUNTAIN TEA,” both in large cream serif lettering, warm interior light, clean glass facade, menu board with only the short word “OOLONG,” uncluttered urban composition, no extra text, no logo, no watermark.

Los titulares cortos y colocados en grande son más fiables que las etiquetas pequeñas; revisa el resultado del texto antes de publicar.

Cómo corregir los fallos que realmente encuentran los usuarios

La siguiente tabla de recuperación prioriza un cambio en el prompt antes de tocar la semilla o el tiempo de ejecución. Un usuario resumió la experiencia así:

“It was Z Image Turbo, it can be janky sometimes, and needs proper prompting but it can deliver really good stuff.” — @RodAndByte

SíntomaPrimer cambio en el promptCambio posterior
Rostro plástico o mirada fija a cámaraAñade una acción real, candid, unposed y una dirección de mirada claraCambia la semilla solo cuando la redacción sea estable
El texto se desvía o aparecen palabras extraEntrecomilla el texto breve exacto, especifica tamaño y posición, y elimina el texto secundarioPrueba otra semilla y revisa el resultado al tamaño final de salida
La escena de producto se vuelve recargadaLimita el atrezzo a uno o dos elementos y define las posiciones de primer plano y fondoReduce el lenguaje de estilo antes de aumentar los pasos
Las manos salen malDescribe la acción visible de las manos y pide una anatomía natural de cinco dedosGenera varias semillas; no esperes resolverlo con una sola muestra
La generación local es lenta o inestableComprueba el wrapper, dtype, memoria de GPU y resolución antes de reescribir el promptUsa un endpoint alojado para probar el rendimiento

Los informes de @iamzhihui y @9o_zZz_o6 muestran que la velocidad local varía entre Mac, hardware GTX antiguo y distintas configuraciones. Antes de juzgar el prompt, prueba el wrapper, dtype, memoria, resolución y estado de compilación.

Preguntas frecuentes sobre prompts para Z-Image Turbo

¿Funcionan los prompts negativos con Z-Image Turbo?

El flujo documentado de Turbo no admite un campo separado para prompt negativo; coloca los rasgos deseados y exclusiones como “no watermark” en el prompt principal.

¿Debo usar 8 o 9 pasos de inferencia?

Sigue la nomenclatura del endpoint: Tongyi-MAI utiliza num_inference_steps=9 para ocho pasadas hacia delante de DiT, mientras que fal expone un rango de 1 a 8.

¿Qué longitud debe tener un prompt para Z-Image Turbo?

El manual comunitario de prompting y la guía de MindCraft sitúan el rango de trabajo aproximadamente entre 80 y 250 palabras; no es un límite oficial de tokens. Antes de añadir detalle, elimina los conceptos que compiten entre sí.

¿Z-Image Turbo es más rápido que FLUX schnell o SDXL Turbo?

Las fuentes públicas no incluyen una prueba de latencia justa en el mismo hardware. Z-Image Turbo usa ocho NFE, mientras que FLUX.1-schnell y SDXL Turbo documentan entre uno y cuatro pasos.

¿Es adecuado para un lote grande de generación de imágenes?

Sí, para generar y seleccionar conceptos de primera pasada: fal indica hasta cuatro imágenes por solicitud, así que fija la semilla al editar prompts y varía las semillas para seleccionar resultados.

¿Por qué las ejecuciones locales se vuelven lentas o inestables?

La afirmación de menos de un segundo está ligada a hardware H800. Revisa VRAM, dtype, resolución, wrapper y compilación antes de considerar que una ralentización local es un fallo del prompt.

>_Directorio de modelos AIReiter

Acceso API rápido a modelos relacionados con esta guía

Z-Image Turbo

Image

Texto a imagen fotorrealista de costo ultrabajo con renderizado nítido de texto en inglés y chino.

AlibabaCrear API Key >

FLUX.2 Pro

Image

Generación y edición de imágenes lista para producción con detalle fotorrealista y hasta ocho referencias.

Black Forest LabsCrear API Key >

Krea 2 Turbo

Image

Modelo de texto a imagen ultrarrápido que produce imágenes cinematográficas de alta fidelidad en segundos.

kreaCrear API Key >

Nano Banana

Image

Retratos ligeros y creativos

GoogleCrear API Key >

Nano Banana Pro

Image

Modelo de imagen AI más rápido, inteligente y de mayor resolución

GoogleCrear API Key >

Publicaciones recientes

Análisis de la API de GPT-6 Astra (2026): creada para agentes, no para sustituir sin más

2026-09-07

API de Kling: guía de integración oficial y mediante agregadores (2026)

2026-09-07

Suno API Key: cómo conseguir una y cuánto cuesta (2026)

2026-09-07

Análisis de GPT-6 Astra: ¿merece la pena su precio de API de $10/$50?

2026-09-06
AIREITER

¿Preguntas? Contáctanos en
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagen IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Ver todo →

Compañía

Política de privacidadTérminos de servicioPolítica de reembolso

© 2026 AIReiter. Todos los derechos reservados.