Las clasificaciones públicas no se ponen de acuerdo sobre la fidelidad al prompt de Veo 3.1: una le da un 7,8 y otra un 9,2, pero ninguna revela qué prompt utilizó. Para salir de dudas, redactamos dos prompts con veinte elementos comprobables por separado y los enviamos a seis modelos el 2026-07-30. Los resultados fueron más parejos de lo que esas clasificaciones sugieren. La diferencia real no la marca tanto la marca como el tipo de instrucción.
El modelo de vídeo con IA que mejor sigue las instrucciones
Seedance 2.0 Fast fue el que más instrucciones respetó: 19 de 20 elementos verificables y un impecable 10/10 en el prompt más exigente. Kling 3 Turbo y Veo 3.1 empataron con 18; Wan 2.7 obtuvo 17,5; Grok Imagine, 16; y Hailuo 02 Pro cerró la tabla con 15,5 tras ignorar una secuencia completa de eventos. Tres repeticiones del prompt difícil mantuvieron ese mismo orden. Sora 2 no pudo probarse.
| Modelo | Prompt literal | Prompt de estrés | Total /20 | Coste por clip | Por segundo | Espera |
|---|---|---|---|---|---|---|
| Seedance 2.0 Fast | 9.0 | 10.0 | 19.0 | $0.83 | $0.165 | 121–132s |
| Kling 3 Turbo | 9.5 | 8.5 | 18.0 | $0.45 | $0.090 | 45–54s |
| Veo 3.1 | 9.0 | 9.0 | 18.0 | $1.25 | $0.156 | 88–95s |
| Wan 2.7 | 9.0 | 8.5 | 17.5 | $0.40 | $0.080 | 103–104s |
| Grok Imagine | 8.0 | 8.0 | 16.0 | $0.09 | $0.015 | 43–49s |
| Hailuo 02 Pro | 9.0 | 6.5 | 15.5 | $0.29 | $0.049 | 166–185s |
| Sora 2 | — | — | — | — | — | 5 envíos fallidos |
Los precios proceden de las tarifas de créditos publicadas: la tabla de precios de Kie para Kling, Seedance, Wan, Hailuo y Grok; y las páginas de modelos de AIReiter para Veo 3.1 y Sora 2. Los dividimos entre la duración que devolvió realmente cada modelo, detallada en la tabla siguiente.
La elección depende de lo que necesite el plano:
- El prompt incluye una cantidad, un orden o un «nunca se mueve» → Seedance 2.0 Fast. Fue el único que acertó los diez elementos de este tipo; eso es lo que compra su sobreprecio.
- Estás afinando una estética, no una secuencia → Kling 3 Turbo. Obediencia casi idéntica por aproximadamente la mitad de precio y un tercio del tiempo de espera.
- Quieres comprobar si un prompt se interpreta correctamente → Grok Imagine, a $0.015 por segundo. Su 16/20 se explica, sobre todo, por una entrada que faltó.
- Acción secuenciada → no Hailuo 02 Pro, que se saltó un evento entero.
Sora 2 devolvió UPSTREAM_BUSY / Upstream service is busy or upgrading en los cinco envíos realizados entre las 03:57 y las 03:59 UTC del 2026-07-30, con ambos prompts y tres reintentos espaciados. Sin cargo, sin clip y sin puntuación.
Metodología: dos prompts y veinte elementos verificables
Cada cláusula de los dos prompts corresponde a algo que puede identificarse en el fotograma. Nada de «cinematic», «8k» o «moody»: no son conceptos puntuables. Cada uno de los diez elementos por prompt se marca con ✓ (1 punto), ~ (0,5; presente parcialmente) o ✗ (0). Esta prueba no evalúa la calidad de imagen ni la consistencia temporal: un clip puede ser bonito y estable mientras omite discretamente la mitad de las indicaciones. La salida de Grok Imagine parece un render 3D en lugar de una imagen fotográfica, y eso no le restó puntos.
El prompt literal comprueba si el modelo puede construir una escena descrita. Sus diez elementos son los diez detalles que menciona: una bicicleta vintage roja, apoyada contra una pared de ladrillo amarilla, un gato blanco con una oreja negra, entrando por el lado derecho del encuadre, deteniéndose junto a la rueda delantera y mirando hacia arriba, el letrero con el texto OPEN 7AM, un travelling de plano general a plano medio, cámara a ras de suelo, luz nublada sin sol y nadie en plano.
A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.
El prompt de estrés pone a prueba el conteo, el orden de los eventos y la negación. Sus diez elementos son: exactamente tres patos, los tres del mismo tamaño, en fila sobre una mesa de madera, sin manos ni personas, el pato central cae primero, el izquierdo cae después, el de la derecha no se mueve nunca, cámara fija, fondo blanco liso y luz dura cenital.
Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.
El ajuste que reescribe el prompt antes de llegar al modelo
Dos de estos modelos incorporan por defecto un reescritor de prompts: prompt_extend en Wan 2.7 y prompt_optimizer en Hailuo 02 Pro. La documentación indica que ambos vienen activados, con el valor true. Si envías el prompt sin tocarlos, el texto que se evalúa no es el que escribiste. En esta prueba, ambos se configuraron como false; con los valores predeterminados activos, estarías midiendo tanto al reescritor como al modelo.
Otros parámetros ni siquiera se respetan. Todos los clips se solicitaron a 5 segundos, 720p y 16:9, pero tres modelos lo sustituyeron por sus propios ajustes. Por eso, los precios por segundo de arriba se calculan sobre lo devuelto, no sobre lo pedido:
| Modelo | Enviado | Devuelto | Créditos facturados |
|---|---|---|---|
| Seedance 2.0 Fast | 5s, 720p, 16:9 | 5.0s, 1280×720 | 165 (33/s) |
| Kling 3 Turbo | 5s, 720p, 16:9 | 5.0s, 1280×720 | 90 (18/s) |
| Veo 3.1 | 5s, 16:9 | 8.0s, 1280×720 | 125 por llamada |
| Wan 2.7 | 5s, 720p, 16:9 | 5.0s, 1280×720 | 80 (16/s) |
| Grok Imagine | 6s (mínimo), 720p, 16:9 | 6.0s, 1280×720 | 18 (3/s) |
| Hailuo 02 Pro | 5s, 720p, 16:9 | 5.9s, 1920×1080 | 57 |
Las únicas entradas documentadas de Hailuo 02 Pro son el prompt y dos interruptores, así que no hay nada más que configurar; devolvió 1080p en ambas ocasiones. Veo 3.1 devolvió 8 segundos independientemente de lo que enviamos, y Grok Imagine documenta un mínimo de 6 segundos.
Lo que los seis modelos hicieron bien
La composición general no fue el punto débil de ninguna de las seis salidas. Todos los modelos colocaron exactamente una bicicleta vintage roja contra una pared de ladrillo amarilla, y todos generaron el texto en pantalla «OPEN 7AM» sin un solo carácter incorrecto. También respetaron las dos instrucciones negativas: no apareció ninguna persona en los seis clips de la calle y ninguna cámara se movió en los seis clips de patos con cámara fija.
Cómo fallan: cuatro tipos de instrucciones
Conteo y precisión en los atributos
«Un gato blanco con una oreja negra» se siguió exactamente una vez de seis. Hailuo 02 Pro produjo el único gato con una única oreja negra y el resto del cuerpo blanco. Kling 3 Turbo y Veo 3.1 acertaron con la oreja negra, pero añadieron una cola negra; Wan 2.7 extendió una mancha negra por ambas orejas; Grok Imagine pintó una máscara siamesa completa; y Seedance 2.0 Fast generó un gato casi enteramente blanco con una leve mancha oscura en la punta de una oreja.
Todos entendieron «gato blanco con una marca negra». Salvo Hailuo, ninguno interpretó «una» como una cantidad. En estas seis salidas, contar atributos resultó notablemente menos fiable que resolver la composición general.
Orden y timing de los eventos
El prompt de los patos pedía una secuencia concreta: cae el central, luego el izquierdo y el derecho nunca se mueve. Cuatro modelos la ejecutaron correctamente: Kling 3 Turbo a los 2.0s y 4.9s; Seedance 2.0 Fast a los 2.0s y 3.5s; Wan 2.7 a los 1.0s y 4.0s; y Veo 3.1 a los 1.6s y 4.8s. Ninguno clavó el intervalo solicitado de dos segundos, pero el pato de la derecha se quedó quieto en los seis clips.
Hailuo 02 Pro no ejecutó la secuencia en absoluto. El pato central nunca cayó. En su lugar, el pato izquierdo giró hasta verse de perfil y creció hasta casi duplicar su tamaño, mientras los tres permanecían erguidos.
Grok Imagine inclinó los patos correctos en el orden correcto, pero los dejó caer hacia delante, sobre el pico, en vez de sobre un costado. Veo 3.1 respetó el orden y después permitió que los dos patos caídos se levantaran de nuevo antes del último fotograma: el evento ocurrió, pero el estado no se mantuvo.
Disciplina de cámara
Las cámaras fijas se respetaron sin excepción; los movimientos de cámara descritos, no. Wan 2.7 y Veo 3.1 empezaron el travelling solicitado de plano general a plano medio, pero siguieron avanzando hasta llegar a un primerísimo primer plano. Wan acabó mostrando solo una llanta, con el gato completamente fuera de cuadro. Grok Imagine se movió tan poco que el avance apenas se percibe. Hailuo 02 Pro fue el único modelo que incumplió «a ras de suelo»: filmó aproximadamente a la altura de la cadera, mientras los otros cinco mantuvieron la cámara baja.
Consistencia de los objetos
Los objetos cambian de tamaño al moverse. El pato izquierdo de Hailuo creció hasta casi duplicar su tamaño inicial; los dos patos caídos de Grok Imagine también se agrandaron de forma evidente; y los patos inclinados de Kling 3 Turbo y Veo 3.1 crecieron ligeramente. Solo Seedance 2.0 Fast y Wan 2.7 mantuvieron a los tres patos del mismo tamaño desde el primer fotograma hasta el último.
La consistencia de tamaño no se pide y, por eso mismo, suele pasar desapercibida.
Cinco de los seis modelos se agrupan entre 8.0 y 9.5 en la escena estática; solo se distancian al afrontar cantidades y eventos ordenados, donde Hailuo pierde 2.5 puntos. La elección de modelo aporta poco en un plano sencillo, pero importa mucho en cuanto el prompt contiene un número.
¿Se mantiene la clasificación al repetir la prueba?
Sí, en los tres modelos que repetimos. Cada uno recibió dos intentos adicionales del prompt de estrés, evaluados de la misma forma, y los rangos de puntuación no se solapan.
| Modelo | Ejecución 1 | Ejecución 2 | Ejecución 3 | Mediana | Rango |
|---|---|---|---|---|---|
| Seedance 2.0 Fast | 10.0 | 9.5 | 10.0 | 10.0 | 9.5–10.0 |
| Kling 3 Turbo | 8.5 | 8.0 | 8.0 | 8.0 | 8.0–8.5 |
| Hailuo 02 Pro | 6.5 | 6.5 | — | 6.5 | n=2 |
Kling 3 Turbo generó una pared azul grisácea en vez del fondo blanco liso solicitado en las tres ejecuciones. Es una preferencia estable, no ruido de muestreo. Hailuo 02 Pro repitió exactamente el mismo fallo ambas veces: el pato central no cayó y el izquierdo creció hasta casi duplicar su tamaño. La tercera ejecución de Hailuo quedó bloqueada por un límite diario de créditos, así que su mediana se basa en dos muestras.
Las repeticiones revelaron un comportamiento que una única pasada ocultaba. En la ejecución 2, el pato central de Kling 3 Turbo cayó y volvió a levantarse antes del fotograma final, la misma reversión de estado que Veo 3.1 mostró en su única ejecución. Los eventos suceden; los estados no siempre perduran.
Cuánto cuesta reintentar cuando el modelo no te hace caso
Precio y velocidad no van de la mano. Hailuo 02 Pro fue el segundo modelo más barato por clip y, con diferencia, el más lento: 166–185 segundos. Kling 3 Turbo, en cambio, entregó su 18/20 en 45–54 segundos. Los precios por clip también favorecen artificialmente a los modelos de clips cortos: Veo 3.1 cuesta $1.25 frente a los $0.83 de Seedance 2.0 Fast, pero Veo devuelve 8 segundos y Seedance 5. Por segundo, ambos son casi idénticos: $0.156 y $0.165.
Los 17 clips de este artículo costaron 1,387 créditos de Kie más 250 créditos de AIReiter, que a 200 y 100 créditos por dólar suman $9.44; los cinco envíos fallidos a Sora 2 no costaron nada. Generar es la parte barata. Generar tres veces porque faltó el cuarto elemento y ninguna lista de comprobación lo detectó, no lo es.
Como lo expresó un usuario de r/SoraAi: "No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions." Puntuar elemento por elemento convierte esa queja en una lista de instrucciones concretas, y eso sí permite actuar.
Cómo aplicar esta prueba a tu propia lista de planos
- Reescribe un prompt real para que cada cláusula sea verificable: sustituye «cinematic» por la altura de cámara, la dirección de la luz y el encuadre en el que termina el movimiento.
- Divídelo en una lista numerada de elementos antes de generar. Diez bastan; anótalos o acabarás evaluando de memoria y serás demasiado generoso.
- Desactiva los reescritores. Configura
prompt_extendcomofalseen Wan,prompt_optimizercomofalseen Hailuo, y comprueba si tu plataforma incluye otro propio antes de comparar nada. - Envía exactamente la misma cadena a dos o tres modelos, con duración y resolución equivalentes, y anota qué parámetros sustituye cada uno sin avisar.
- Revisa el clip completo; usa el primer fotograma, el central y el final como puntos de control, porque puede haber fallos breves de estado entre las muestras. Después, repite solo el modelo que haya fallado en los elementos que realmente te importan. Que falte una oreja negra no importa; que un pato vuelva a levantarse, sí.
Si quieres reproducir directamente nuestras ejecuciones, las páginas de modelo de Veo 3.1, Seedance 2 Fast y Sora 2 incluyen los ID exactos de modelo y los precios por segundo en créditos utilizados arriba.
Preguntas frecuentes
¿Qué generador de vídeo con IA es más preciso?
En esta prueba, Seedance 2.0 Fast: cumplió 19 de 20 elementos verificables y fue el único en superar limpiamente las pruebas de conteo, orden y negación. En escenas sencillas, la precisión fue prácticamente idéntica en cinco de los seis modelos, por lo que la clasificación solo los separa en prompts secuenciados.
¿Seedance es mejor que Veo 3.1 o Sora 2?
Seedance 2.0 Fast superó a Veo 3.1 por un punto, 19 frente a 18, a dos tercios del precio por clip, y ambos ejecutaron la secuencia de patos en el orden correcto. No podemos clasificar Sora 2: sus cinco envíos del 2026-07-30 fallaron aguas arriba, así que aquí no tiene una puntuación baja, sino ninguna puntuación.
¿Merece la pena Kling 3 Turbo para trabajos con prompts exigentes?
Sí, cuando la velocidad importa más que la secuenciación. Kling 3 Turbo logró la mejor puntuación de los seis en el prompt literal, con 9.5/10, y devolvió el resultado en 45–54 segundos. Sin embargo, perdió un punto en el prompt de estrés por generar una pared azul grisácea cuando se pedía un fondo blanco liso.
¿Un prompt más largo mejora la fidelidad?
No por sí solo. El prompt literal de esta prueba es más largo que el de estrés y todos los modelos obtuvieron mejores resultados con él, porque sus cláusulas describen una disposición estática y no cantidades ni orden de eventos.
Lo que esta prueba no puede responder
Tres ejecuciones bastan para mostrar que estas puntuaciones no son ruido de muestreo, pero no para convertirlas en un benchmark. Solo se repitieron Seedance, Kling y Hailuo; Veo 3.1, Wan 2.7 y Grok Imagine siguen basándose en un único intento cada uno. Ambos prompts son además de un único plano, sin diálogo y de menos de diez segundos, por lo que dejan completamente sin probar los tipos de instrucciones con más probabilidades de romper una edición real: continuidad entre planos, líneas habladas o la reaparición de un personaje con nombre. La clasificación anterior indica quién sigue mejor un plano descrito. Saber si resiste una lista de planos es la siguiente prueba, y es una distinta.
Lectura relacionada: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · Prompts de movimientos de cámara con IA, a prueba