Les classements publics ne racontent pas tous la même histoire : l’un attribue 7,8 à Veo 3.1 pour le respect des prompts, un autre 9,2, sans jamais publier le prompt utilisé. Nous avons donc conçu deux prompts totalisant vingt éléments vérifiables individuellement, puis les avons soumis à six modèles le 2026-07-30. Résultat : les écarts entre modèles sont moins marqués que ces classements ne le laissent penser. Ce qui compte avant tout, c’est le type d’instruction demandé, pas la marque du modèle.
Quel modèle vidéo IA respecte le mieux les prompts ?
Seedance 2.0 Fast est celui qui a suivi le plus d’instructions : 19 éléments sur 20, dont un sans-faute de 10/10 sur le prompt le plus exigeant. Kling 3 Turbo et Veo 3.1 arrivent ensuite à égalité avec 18, devant Wan 2.7 à 17,5, Grok Imagine à 16 et Hailuo 02 Pro à 15,5 après avoir ignoré toute une séquence d’événements. Trois exécutions supplémentaires du prompt difficile n’ont pas modifié cet ordre. Sora 2, lui, n’a tout simplement pas pu être testé.
| Modèle | Prompt littéral | Prompt de stress | Total /20 | Coût par clip | Par seconde | Attente |
|---|---|---|---|---|---|---|
| Seedance 2.0 Fast | 9.0 | 10.0 | 19.0 | $0.83 | $0.165 | 121–132s |
| Kling 3 Turbo | 9.5 | 8.5 | 18.0 | $0.45 | $0.090 | 45–54s |
| Veo 3.1 | 9.0 | 9.0 | 18.0 | $1.25 | $0.156 | 88–95s |
| Wan 2.7 | 9.0 | 8.5 | 17.5 | $0.40 | $0.080 | 103–104s |
| Grok Imagine | 8.0 | 8.0 | 16.0 | $0.09 | $0.015 | 43–49s |
| Hailuo 02 Pro | 9.0 | 6.5 | 15.5 | $0.29 | $0.049 | 166–185s |
| Sora 2 | — | — | — | — | — | 5 soumissions échouées |
Les prix proviennent des barèmes de crédits publiés : la grille tarifaire de Kie pour Kling, Seedance, Wan, Hailuo et Grok, ainsi que les pages modèles d’AIReiter pour Veo 3.1 et Sora 2. Ils ont été divisés par la durée de clip effectivement renvoyée par chaque modèle, détaillée ci-dessous.
Choisissez selon les exigences de votre plan :
- Le prompt contient un nombre, un ordre ou une action qui ne doit « jamais bouger » → Seedance 2.0 Fast. C’est le seul modèle à avoir validé les dix éléments de ce type, et c’est ce que finance son surcoût.
- Vous itérez sur une esthétique, pas sur une séquence → Kling 3 Turbo. Son respect des consignes est presque équivalent, pour environ la moitié du prix et un tiers du temps d’attente.
- Vous vérifiez simplement si un prompt fonctionne → Grok Imagine, à $0.015 par seconde. Son 16/20 s’explique surtout par une entrée manquante.
- Vous avez besoin d’une action séquencée → évitez Hailuo 02 Pro, qui a sauté un événement entier.
Sora 2 a renvoyé UPSTREAM_BUSY / Upstream service is busy or upgrading pour les cinq soumissions effectuées entre 03:57 et 03:59 UTC le 2026-07-30, sur les deux prompts et après trois nouvelles tentatives espacées : aucun coût, aucun clip, aucun score.
Notre protocole : deux prompts et vingt critères vérifiables
Chaque proposition des deux prompts correspond à un élément que l’on peut identifier dans l’image. Pas de « cinematic », de « 8k » ou de « moody » : ces qualificatifs ne se notent pas. Chacun des dix éléments de chaque prompt reçoit ✓ (1 point), ~ (0,5 point, partiellement respecté) ou ✗ (0). Ce test ne mesure ni la qualité de l’image ni la cohérence temporelle : un clip peut être superbe, stable, et ignorer discrètement la moitié de vos consignes. Le rendu de Grok Imagine évoque davantage une animation 3D que de la photographie, mais cela ne lui a retiré aucun point.
Le prompt littéral évalue la capacité d’un modèle à composer une scène décrite. Ses dix éléments sont les dix objets ou actions nommés : un unique vélo vintage rouge, appuyé contre un mur de briques jaunes, un chat blanc avec une oreille noire, entrant par la droite du cadre, s’arrêtant près de la roue avant et levant les yeux, l’enseigne « OPEN 7AM », un travelling avant du plan large au plan moyen, une caméra au niveau du sol, une lumière couverte sans soleil et personne dans le plan.
A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.
Le prompt de stress teste le comptage, l’ordre des événements et la négation. Ses dix éléments sont : exactement trois canards, tous trois de taille constante, alignés sur une table en bois, sans mains ni personnes, le canard central qui tombe en premier, celui de gauche qui tombe ensuite, celui de droite qui ne bouge jamais, une caméra fixe, un fond blanc uni et une lumière dure venant du dessus.
Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.
Le réglage qui réécrit votre prompt avant même le modèle
Deux de ces modèles activent par défaut un réécrivain de prompt : prompt_extend sur Wan 2.7 et prompt_optimizer sur Hailuo 02 Pro. Leur documentation indique que les deux sont réglés sur true par défaut. Si vous envoyez un prompt sans toucher à ces paramètres, le texte évalué n’est donc pas celui que vous avez écrit. Ils ont tous deux été définis sur false pour ce test ; avec les réglages par défaut, on mesure autant le réécrivain que le modèle.
D’autres paramètres ne sont tout simplement pas respectés. Tous les clips ont été demandés en 5 secondes, 720p et 16:9, mais trois modèles ont imposé autre chose. Les prix par seconde ci-dessus reposent donc sur ce qui a été livré, et non sur ce qui avait été demandé :
| Modèle | Envoyé | Renvoyé | Crédits facturés |
|---|---|---|---|
| Seedance 2.0 Fast | 5s, 720p, 16:9 | 5.0s, 1280×720 | 165 (33/s) |
| Kling 3 Turbo | 5s, 720p, 16:9 | 5.0s, 1280×720 | 90 (18/s) |
| Veo 3.1 | 5s, 16:9 | 8.0s, 1280×720 | 125 par appel |
| Wan 2.7 | 5s, 720p, 16:9 | 5.0s, 1280×720 | 80 (16/s) |
| Grok Imagine | 6s (minimum), 720p, 16:9 | 6.0s, 1280×720 | 18 (3/s) |
| Hailuo 02 Pro | 5s, 720p, 16:9 | 5.9s, 1920×1080 | 57 |
Les seules entrées documentées pour Hailuo 02 Pro sont le prompt et deux interrupteurs : il n’y a donc rien à régler ; il a renvoyé du 1080p dans les deux cas. Veo 3.1 a livré 8 secondes quelle que soit notre demande, et Grok Imagine documente une durée minimale de 6 secondes.
Ce que les six modèles ont tous réussi
La composition générale n’est le point de rupture d’aucun des six rendus. Tous les modèles ont placé exactement un vélo vintage rouge contre un mur de briques jaunes, et tous ont affiché le texte « OPEN 7AM » sans une seule erreur de caractère. Ils ont également tous respecté les deux consignes négatives : aucune personne n’apparaît dans les six clips de rue, et aucune caméra ne bouge dans les six clips de canards à plan fixe.
Là où les modèles décrochent : quatre familles d’instructions
Comptage et précision des attributs
« Un chat blanc avec une oreille noire » n’a été suivi à la lettre qu’une seule fois sur six. Hailuo 02 Pro a produit le seul chat avec une unique oreille noire sur un corps autrement blanc. Kling 3 Turbo et Veo 3.1 ont bien ajouté l’oreille noire, mais aussi une queue noire ; Wan 2.7 a étalé une tache noire sur les deux oreilles ; Grok Imagine a peint un masque siamois complet ; Seedance 2.0 Fast a généré un chat presque entièrement blanc, avec une légère marque sombre au bout d’une oreille.
Tous les modèles ont compris « chat blanc avec une marque noire ». À l’exception de Hailuo, aucun n’a traité « une » comme un nombre. Dans ces six sorties, le décompte des attributs s’est révélé nettement moins fiable que la composition globale.
Ordre et timing des événements
Le prompt des canards demandait une séquence précise : le canard central tombe, puis celui de gauche, tandis que celui de droite reste immobile. Quatre modèles l’ont exécutée correctement : Kling 3 Turbo à 2.0s puis 4.9s, Seedance 2.0 Fast à 2.0s puis 3.5s, Wan 2.7 à 1.0s puis 4.0s et Veo 3.1 à 1.6s puis 4.8s. Aucun n’a respecté exactement l’intervalle demandé de deux secondes, mais le canard de droite est resté en place dans les six clips.
Hailuo 02 Pro n’a pas exécuté la séquence du tout. Le canard central n’est jamais tombé. À la place, le canard de gauche a pivoté de profil et presque doublé de taille, tandis que les trois canards restaient debout.
Grok Imagine a fait tomber les canards dans le bon ordre, mais vers l’avant, sur leur bec, plutôt que sur le côté. Veo 3.1 a respecté l’ordre puis laissé les deux canards tombés se relever avant la dernière image : l’événement a eu lieu, mais l’état n’a pas été conservé.
Discipline de caméra
Les caméras fixes ont été respectées par tous ; les mouvements de caméra décrits, beaucoup moins. Wan 2.7 et Veo 3.1 ont tous deux commencé le travelling avant demandé, du plan large au plan moyen, avant de poursuivre jusqu’au très gros plan. Wan termine sur une simple jante de roue, avec le chat complètement hors cadre. Grok Imagine bouge si peu que le travelling est à peine perceptible. Hailuo 02 Pro est le seul à avoir enfreint la consigne « au niveau du sol », en filmant environ à hauteur de hanche alors que les cinq autres restent bas.
Cohérence des objets
Les objets changent de taille lorsqu’ils bougent. Le canard de gauche de Hailuo atteint presque deux fois sa taille initiale, les deux canards tombés de Grok Imagine grossissent tous deux de façon visible, et les canards renversés de Kling 3 Turbo comme de Veo 3.1 gagnent légèrement en taille. Seuls Seedance 2.0 Fast et Wan 2.7 ont conservé la même taille pour les trois canards, de la première à la dernière image.
La constance de taille ne se demande pas dans un prompt, puis passe inaperçue.
Cinq modèles sur six se regroupent entre 8.0 et 9.5 sur la scène statique, et ne se distinguent réellement que sur les nombres et les événements ordonnés, où Hailuo perd 2.5 points. Le choix du modèle change peu de choses pour un plan simple, mais beaucoup dès qu’un prompt contient un nombre.
Le classement tient-il lors d’une nouvelle exécution ?
Oui, pour les trois modèles que nous avons relancés. Chacun a reçu deux tentatives supplémentaires sur le prompt de stress, évaluées de la même manière, et leurs plages de scores ne se chevauchent pas.
| Modèle | Essai 1 | Essai 2 | Essai 3 | Médiane | Plage |
|---|---|---|---|---|---|
| Seedance 2.0 Fast | 10.0 | 9.5 | 10.0 | 10.0 | 9.5–10.0 |
| Kling 3 Turbo | 8.5 | 8.0 | 8.0 | 8.0 | 8.0–8.5 |
| Hailuo 02 Pro | 6.5 | 6.5 | — | 6.5 | n=2 |
Kling 3 Turbo a peint un mur bleu-gris au lieu du fond blanc uni demandé lors des trois essais : il s’agit d’une préférence stable, pas de bruit d’échantillonnage. Hailuo 02 Pro a reproduit exactement le même échec les deux fois : le canard central ne tombe jamais et celui de gauche atteint presque le double de sa taille. La troisième exécution de Hailuo a été bloquée par un plafond quotidien de crédits ; sa médiane repose donc sur deux échantillons.
Les relances ont révélé un comportement invisible sur une seule passe. Lors du deuxième essai de Kling 3 Turbo, le canard central est tombé puis s’est relevé avant la dernière image, soit la même réversion d’état observée sur l’unique exécution de Veo 3.1. Les événements se produisent ; les états ne tiennent pas toujours.
Le coût d’une nouvelle tentative quand le modèle vous ignore
Prix et vitesse ne vont pas de pair. Hailuo 02 Pro était le deuxième modèle le moins cher par clip, mais de très loin le plus lent avec 166–185 secondes, tandis que Kling 3 Turbo a livré son 18/20 en 45–54 secondes. Les prix par clip avantagent aussi les modèles aux clips courts : Veo 3.1 coûte $1.25 contre $0.83 pour Seedance 2.0 Fast, mais Veo renvoie 8 secondes et Seedance 5 ; à la seconde, les deux sont presque identiques, à $0.156 et $0.165.
Les 17 clips à l’origine de cet article ont coûté 1,387 crédits Kie auxquels s’ajoutent 250 crédits AIReiter, soit $9.44 avec des tarifs de 200 et 100 crédits par dollar ; les cinq soumissions échouées sur Sora 2 n’ont rien coûté. Générer est bon marché. Générer trois fois parce que le quatrième élément a disparu sans qu’aucune grille de contrôle ne le relève, beaucoup moins.
Comme l’écrit un utilisateur de r/SoraAi : « No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions. » Une évaluation élément par élément transforme ce constat en liste précise d’instructions défaillantes, sur laquelle il devient possible d’agir.
Appliquez ce test à votre propre liste de plans
- Réécrivez un prompt réel afin que chaque proposition soit vérifiable : remplacez « cinematic » par la hauteur de caméra, la direction de la lumière et le cadrage de fin du mouvement.
- Découpez-le en liste numérotée avant de générer. Dix éléments suffisent ; notez-les, sinon vous évaluerez de mémoire et serez trop généreux.
- Désactivez les réécrivains. Réglez
prompt_extendsurfalsedans Wan,prompt_optimizersurfalsedans Hailuo, et vérifiez si votre plateforme possède son propre système avant toute comparaison. - Envoyez exactement la même chaîne à deux ou trois modèles, avec durée et résolution comparables, puis notez les paramètres que chacun remplace silencieusement.
- Visionnez le clip dans son intégralité, en contrôlant la première image, le milieu et la dernière image : des ruptures d’état brèves peuvent passer entre deux échantillons. Relancez ensuite uniquement le modèle qui a manqué les éléments réellement importants pour vous. Une oreille noire absente n’a peut-être aucune importance ; un canard qui se relève, si.
Pour reproduire directement nos exécutions, les pages modèles de Veo 3.1, Seedance 2 Fast et Sora 2 indiquent les identifiants exacts des modèles et les prix en crédits par seconde utilisés ci-dessus.
FAQ
Quel générateur vidéo IA est le plus précis ?
Dans ce test, Seedance 2.0 Fast, avec 19 éléments vérifiables sur 20 et le seul sans-faute sur le comptage, l’ordre et la négation. Sur les scènes simples, la précision était quasiment identique pour cinq modèles sur six : le classement ne les départage donc réellement que sur les prompts séquencés.
Seedance est-il meilleur que Veo 3.1 ou Sora 2 ?
Seedance 2.0 Fast a devancé Veo 3.1 d’un point, 19 à 18, pour deux tiers du prix par clip, et les deux ont exécuté la séquence des canards dans le bon ordre. Nous ne pouvons pas classer Sora 2 : les cinq soumissions du 2026-07-30 ont toutes échoué en amont. Il n’a donc pas de score ici, et non un mauvais score.
Kling 3 Turbo vaut-il le coup pour les prompts chargés ?
Oui, lorsque la vitesse compte davantage que le séquençage. Kling 3 Turbo a obtenu le meilleur score des six sur le prompt littéral, avec 9.5/10, et a répondu en 45–54 secondes. Il a toutefois perdu un point sur le prompt de stress pour avoir généré un mur bleu-gris au lieu du fond blanc uni demandé.
Un prompt plus long améliore-t-il le respect des consignes ?
Pas à lui seul. Dans ce test, le prompt littéral est plus long que le prompt de stress et tous les modèles y ont obtenu un meilleur score, car ses propositions décrivent une disposition statique plutôt que des quantités et un ordre d’événements.
Ce que ce test ne permet pas de conclure
Trois exécutions suffisent pour montrer que ces scores ne relèvent pas du seul bruit d’échantillonnage, mais pas pour en faire un benchmark. Seuls Seedance, Kling et Hailuo ont été relancés ; Veo 3.1, Wan 2.7 et Grok Imagine reposent toujours sur une seule tentative chacun. Les deux prompts ne comportent en outre qu’un seul plan, aucun dialogue et durent moins de dix secondes. Les types d’instructions les plus susceptibles de faire échouer un véritable montage — continuité entre plusieurs plans, répliques parlées, retour d’un personnage nommé — restent donc entièrement non testés. Le classement ci-dessus indique qui suit un plan décrit. Savoir s’il résiste à une liste de plans est le prochain test, et c’en est un autre.
À lire aussi : Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · Prompts de mouvements de caméra IA, testés