Le classifiche pubbliche sull'aderenza ai prompt di Veo 3.1 riportano risultati molto diversi: 7.8 in una leaderboard, 9.2 in un'altra. Nessuna delle due, però, pubblica il prompt usato. Per questo il 2026-07-30 abbiamo messo alla prova sei modelli con due prompt composti da venti elementi verificabili singolarmente. I risultati sono più ravvicinati di quanto suggeriscano quelle classifiche: a fare la differenza non è tanto il brand, quanto il tipo di istruzione.
Quale modello video AI segue meglio i prompt
In questo test Seedance 2.0 Fast è stato il più fedele alle istruzioni: 19 elementi corretti su 20 e un netto 10/10 nel prompt più impegnativo. Kling 3 Turbo e Veo 3.1 hanno chiuso a pari merito con 18, Wan 2.7 ha ottenuto 17.5, Grok Imagine 16 e Hailuo 02 Pro è arrivato ultimo con 15.5, dopo aver saltato un'intera sequenza di eventi. Tre esecuzioni aggiuntive del prompt più difficile hanno confermato lo stesso ordine. Sora 2 non è stato testabile.
| Modello | Prompt letterale | Prompt stress | Totale /20 | Costo per clip | Al secondo | Attesa |
|---|---|---|---|---|---|---|
| Seedance 2.0 Fast | 9.0 | 10.0 | 19.0 | $0.83 | $0.165 | 121–132s |
| Kling 3 Turbo | 9.5 | 8.5 | 18.0 | $0.45 | $0.090 | 45–54s |
| Veo 3.1 | 9.0 | 9.0 | 18.0 | $1.25 | $0.156 | 88–95s |
| Wan 2.7 | 9.0 | 8.5 | 17.5 | $0.40 | $0.080 | 103–104s |
| Grok Imagine | 8.0 | 8.0 | 16.0 | $0.09 | $0.015 | 43–49s |
| Hailuo 02 Pro | 9.0 | 6.5 | 15.5 | $0.29 | $0.049 | 166–185s |
| Sora 2 | — | — | — | — | — | 5 invii falliti |
I prezzi derivano dalle tariffe pubblicate per i crediti — la tabella prezzi di Kie per Kling, Seedance, Wan, Hailuo e Grok, le pagine modello AIReiter per Veo 3.1 e Sora 2 — e sono stati divisi per la durata effettivamente restituita da ogni modello, riportata nella tabella qui sotto.
Scegli in base a ciò che richiede la scena:
- Il prompt contiene un numero, una sequenza o un "non si muove mai" → Seedance 2.0 Fast. È stato l'unico a centrare tutti e dieci questi elementi: è questo che giustifica il suo sovrapprezzo.
- Stai iterando sull'estetica, non su una sequenza → Kling 3 Turbo. Aderenza quasi identica, circa metà del prezzo e un terzo dell'attesa.
- Vuoi verificare se un prompt funziona almeno sulla carta → Grok Imagine, a $0.015 al secondo. Il suo 16/20 dipende soprattutto da un ingresso mancato.
- Azione in sequenza → non Hailuo 02 Pro, che ha saltato un intero evento.
Sora 2 ha restituito UPSTREAM_BUSY / Upstream service is busy or upgrading per tutti e cinque gli invii tra le 03:57 e le 03:59 UTC del 2026-07-30, sui due prompt e in tre tentativi distanziati: nessun addebito, nessuna clip, nessun punteggio.
Come abbiamo testato: due prompt, venti elementi verificabili
Ogni clausola dei due prompt corrisponde a qualcosa che si può individuare nel fotogramma. Niente "cinematic", "8k" o "moody": non sono parametri valutabili. Ciascuno dei dieci elementi per prompt riceve ✓ (1 punto), ~ (0.5, presente solo in parte) oppure ✗ (0). Il test non misura né la qualità visiva né la coerenza temporale: una clip può essere bella e stabile, ma ignorare silenziosamente metà delle istruzioni. L'output di Grok Imagine sembra un render 3D più che una ripresa fotografica, e questo non gli è costato punti.
Il prompt letterale verifica se un modello sa comporre una scena descritta. I suoi dieci elementi sono quelli nominati nel testo: una bicicletta vintage rossa, appoggiata a un muro di mattoni gialli, un gatto bianco con un orecchio nero, che entra da destra nell'inquadratura, si ferma accanto alla ruota anteriore e guarda in alto, il cartello con scritto OPEN 7AM, una carrellata da campo lungo a medio, camera a livello del terreno, luce coperta senza sole, nessun'altra persona in scena.
A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.
Il prompt stress mette alla prova il conteggio, l'ordine degli eventi e le negazioni. I suoi dieci elementi sono: esattamente tre paperelle, tutte e tre della stessa dimensione, in fila su un tavolo di legno, nessuna mano o persona, cade prima quella centrale, poi quella a sinistra, quella a destra non si muove mai, camera fissa, sfondo bianco semplice, luce dura dall'alto.
Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.
L'impostazione che riscrive il prompt prima di inviarlo al modello
Due di questi modelli includono un riscrittore del prompt attivo per impostazione predefinita: prompt_extend su Wan 2.7 e prompt_optimizer su Hailuo 02 Pro, entrambi documentati con valore predefinito true. Se invii un prompt senza intervenire su queste opzioni, il testo valutato non è quello che hai scritto. Qui sono state impostate entrambe su false: lasciandole attive, il test misurerebbe il riscrittore oltre al modello.
Altri parametri, invece, non vengono rispettati affatto. Ogni clip è stata richiesta a 5 secondi, 720p e 16:9, ma tre modelli hanno sovrascritto tali impostazioni. Perciò i prezzi al secondo qui sopra usano ciò che è stato restituito, non ciò che era stato richiesto:
| Modello | Inviato | Restituito | Crediti addebitati |
|---|---|---|---|
| Seedance 2.0 Fast | 5s, 720p, 16:9 | 5.0s, 1280×720 | 165 (33/s) |
| Kling 3 Turbo | 5s, 720p, 16:9 | 5.0s, 1280×720 | 90 (18/s) |
| Veo 3.1 | 5s, 16:9 | 8.0s, 1280×720 | 125 per chiamata |
| Wan 2.7 | 5s, 720p, 16:9 | 5.0s, 1280×720 | 80 (16/s) |
| Grok Imagine | 6s (minimo), 720p, 16:9 | 6.0s, 1280×720 | 18 (3/s) |
| Hailuo 02 Pro | 5s, 720p, 16:9 | 5.9s, 1920×1080 | 57 |
Gli unici input documentati di Hailuo 02 Pro sono il prompt e due interruttori, quindi non c'è altro da impostare; in entrambi i casi ha restituito 1080p. Veo 3.1 ha restituito 8 secondi indipendentemente da ciò che veniva inviato, mentre Grok Imagine documenta un minimo di 6 secondi.
Cosa hanno fatto bene tutti e sei
La composizione generale non è stata il punto debole di nessuno dei sei output. Tutti i modelli hanno collocato esattamente una bicicletta vintage rossa contro un muro di mattoni gialli e tutti hanno renderizzato il testo in scena "OPEN 7AM" senza un solo carattere errato. Tutti e sei hanno inoltre rispettato le due istruzioni negative: in nessuna delle sei clip della strada sono comparse persone e in nessuna delle sei clip delle paperelle la camera si è mossa.
Dove si inceppano: quattro tipi di istruzione
Conteggi e dettagli degli attributi
"Un gatto bianco con un orecchio nero" è stato eseguito alla lettera una sola volta su sei. Hailuo 02 Pro ha prodotto l'unico gatto con un singolo orecchio nero su un corpo altrimenti bianco. Kling 3 Turbo e Veo 3.1 hanno azzeccato l'orecchio nero, ma hanno aggiunto una coda nera; Wan 2.7 ha esteso una macchia nera su entrambe le orecchie; Grok Imagine ha dipinto una maschera siamese completa; Seedance 2.0 Fast ha creato un gatto quasi del tutto bianco, con una lieve sbavatura scura sulla punta di un orecchio.
Tutti i modelli hanno capito "gatto bianco con una macchia nera". Tranne Hailuo, nessuno ha interpretato "uno" come un numero. In questi sei output, il conteggio degli attributi si è rivelato nettamente meno affidabile della composizione generale.
Ordine e tempi degli eventi
Il prompt delle paperelle richiedeva una sequenza precisa: cade la centrale, poi la sinistra, mentre la destra non si muove mai. Quattro modelli l'hanno eseguita correttamente: Kling 3 Turbo a 2.0s e poi 4.9s, Seedance 2.0 Fast a 2.0s e poi 3.5s, Wan 2.7 a 1.0s e poi 4.0s, Veo 3.1 a 1.6s e poi 4.8s. Nessuno ha rispettato con precisione l'intervallo richiesto di due secondi, ma la paperella di destra è rimasta ferma in tutte e sei le clip.
Hailuo 02 Pro non ha eseguito affatto la sequenza. La paperella centrale non è mai caduta; al suo posto, quella sinistra è ruotata fino a mostrarsi di profilo ed è cresciuta fino a quasi il doppio, mentre tutte e tre sono rimaste in piedi.
Grok Imagine ha fatto cadere le paperelle giuste nell'ordine corretto, ma in avanti sul becco anziché di lato. Veo 3.1 ha rispettato l'ordine, poi ha lasciato rialzare entrambe le paperelle cadute entro il fotogramma finale: l'evento è avvenuto, ma lo stato non è rimasto tale.
Disciplina della camera
Le camere fisse sono state rispettate da tutti; i movimenti di camera descritti, no. Wan 2.7 e Veo 3.1 hanno entrambi avviato la carrellata richiesta da campo lungo a medio, per poi continuare fino a un primissimo piano estremo. Wan termina su un cerchione nudo, con il gatto completamente fuori campo. Grok Imagine si muove così poco che l'avanzamento è appena percepibile. Hailuo 02 Pro è stato l'unico a infrangere l'indicazione "a livello del terreno", riprendendo da circa altezza fianchi mentre gli altri cinque rimanevano bassi.
Coerenza degli oggetti
Gli oggetti cambiano dimensione quando si muovono. La paperella sinistra di Hailuo è arrivata a quasi il doppio della dimensione iniziale, le due paperelle cadute di Grok Imagine si sono entrambe ingrandite in modo evidente, mentre quelle ribaltate di Kling 3 Turbo e Veo 3.1 sono cresciute leggermente. Solo Seedance 2.0 Fast e Wan 2.7 hanno mantenuto tutte e tre le paperelle della stessa dimensione dal primo all'ultimo fotogramma.
La coerenza delle dimensioni non viene quasi mai richiesta, e poi passa inosservata.
Cinque modelli su sei si concentrano tra 8.0 e 9.5 nella scena statica e divergono solo su conteggi ed eventi ordinati, dove Hailuo perde 2.5 punti. Per una scena semplice, la scelta del modello conta poco; conta molto non appena il prompt include un numero.
La classifica regge al secondo giro?
Sì, per i tre modelli sottoposti a nuove prove. Ciascuno ha ricevuto altri due tentativi con il prompt stress, valutati allo stesso modo, e gli intervalli di punteggio non si sovrappongono.
| Modello | Run 1 | Run 2 | Run 3 | Mediana | Intervallo |
|---|---|---|---|---|---|
| Seedance 2.0 Fast | 10.0 | 9.5 | 10.0 | 10.0 | 9.5–10.0 |
| Kling 3 Turbo | 8.5 | 8.0 | 8.0 | 8.0 | 8.0–8.5 |
| Hailuo 02 Pro | 6.5 | 6.5 | — | 6.5 | n=2 |
In tutte e tre le prove Kling 3 Turbo ha generato un muro grigio-blu anziché lo sfondo bianco semplice richiesto: una preferenza stabile, non rumore di campionamento. Hailuo 02 Pro ha replicato esattamente il proprio errore in entrambi i casi: la paperella centrale non cade mai e quella sinistra cresce fino a quasi il doppio. La terza esecuzione di Hailuo è stata bloccata da un limite giornaliero di crediti, quindi la sua mediana si basa su due campioni.
Le ripetizioni hanno mostrato un comportamento nuovo, invisibile in una singola esecuzione. Nella run 2 di Kling 3 Turbo, la paperella centrale cade e poi torna in piedi prima del fotogramma finale: lo stesso ritorno allo stato iniziale visto nell'unica prova di Veo 3.1. Gli eventi accadono, ma gli stati non sempre persistono.
Quanto costa riprovare quando il modello ignora il prompt
Prezzo e velocità non vanno di pari passo. Hailuo 02 Pro è stato il secondo modello meno costoso per clip e, con 166–185 secondi, di gran lunga il più lento; Kling 3 Turbo ha invece consegnato il suo 18/20 in 45–54 secondi. Anche il costo per clip favorisce i modelli con clip brevi: Veo 3.1 costa $1.25 contro gli $0.83 di Seedance 2.0 Fast, ma Veo restituisce 8 secondi e Seedance 5, quindi il costo al secondo è quasi identico: $0.156 e $0.165.
Le 17 clip alla base di questo articolo sono costate 1,387 crediti Kie più 250 crediti AIReiter, equivalenti a $9.44 con 200 e 100 crediti per dollaro; i cinque invii falliti a Sora 2 non sono costati nulla. Generare è la parte economica. Generare tre volte perché manca il quarto elemento e nessuna checklist l'ha rilevato, non lo è.
Come ha scritto un utente di r/SoraAi: "No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions." Una valutazione elemento per elemento trasforma questa frustrazione in un elenco di istruzioni specifiche: qualcosa su cui puoi intervenire.
Come applicare questo test alla tua shot list
- Riscrivi un prompt reale affinché ogni clausola sia verificabile: sostituisci "cinematic" con altezza della camera, direzione della luce e inquadratura finale del movimento.
- Prima di generare, dividilo in una lista numerata di elementi. Dieci sono sufficienti; annotali, altrimenti valuterai a memoria e sarai troppo generoso.
- Disattiva i riscrittori. Imposta
prompt_extendsufalsein Wan,prompt_optimizersufalsein Hailuo, e prima di confrontare qualsiasi risultato verifica se la tua piattaforma ne usa uno proprio. - Invia la stessa stringa a due o tre modelli, con durata e risoluzione abbinate, e annota cosa ciascuno sovrascrive silenziosamente.
- Esamina l'intera clip, usando primo fotogramma, metà e finale come punti di controllo: brevi errori di stato possono verificarsi tra un campione e l'altro. Poi ripeti solo con il modello che ha mancato gli elementi che ti interessano davvero. Un orecchio nero assente non conta; una paperella che si rialza, sì.
Per riprodurre direttamente le nostre esecuzioni, le pagine modello di Veo 3.1, Seedance 2 Fast e Sora 2 riportano gli ID modello esatti e i prezzi in crediti al secondo usati sopra.
FAQ
Qual è il generatore video AI più preciso?
In questo test, Seedance 2.0 Fast, con 19 elementi verificabili su 20 e l'unico risultato pulito su conteggio, ordine e negazione. Nelle scene semplici, l'accuratezza è stata quasi identica per cinque modelli su sei: la classifica li distingue soltanto sui prompt sequenziali.
Seedance è migliore di Veo 3.1 o Sora 2?
Seedance 2.0 Fast ha superato Veo 3.1 di un punto, 19 contro 18, a due terzi del prezzo per clip, e entrambi hanno eseguito la sequenza delle paperelle nell'ordine corretto. Non possiamo classificare Sora 2: tutti e cinque gli invii del 2026-07-30 sono falliti upstream, quindi qui non ha un punteggio, non un punteggio basso.
Kling 3 Turbo vale la pena per lavori con prompt complessi?
Sì, quando la velocità conta più della sequenza. Kling 3 Turbo ha ottenuto il punteggio più alto dei sei sul prompt letterale, 9.5/10, ed è tornato in 45–54 secondi; ha però perso un punto nel prompt stress per un muro grigio-blu laddove il prompt richiedeva un bianco semplice.
Un prompt più lungo migliora l'aderenza?
Non da solo. Il prompt letterale di questo test è più lungo del prompt stress e tutti i modelli hanno ottenuto risultati migliori con il primo, perché descrive una disposizione statica anziché conteggi e ordine degli eventi.
Ciò a cui questo test non può rispondere
Tre esecuzioni bastano a mostrare che questi punteggi non sono semplice rumore di campionamento, ma non bastano per farne un benchmark. Solo Seedance, Kling e Hailuo sono stati ripetuti; Veo 3.1, Wan 2.7 e Grok Imagine si basano ancora su un solo tentativo ciascuno. Entrambi i prompt sono inoltre a inquadratura singola, senza dialoghi e sotto i dieci secondi. Restano quindi del tutto inesplorati i tipi di istruzione che con maggiore probabilità mettono in crisi un vero montaggio: continuità tra più inquadrature, battute parlate, ricomparsa di un personaggio nominato. La classifica qui sopra dice chi segue una scena descritta. Capire se regge una shot list è il prossimo test, ed è un test diverso.
Approfondimenti correlati: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · Prompt per movimenti di camera AI, testati