Öffentliche Bestenlisten bescheinigen Veo 3.1 eine Prompttreue von 7,8 Punkten beziehungsweise 9,2 Punkten – ohne die verwendeten Prompts offenzulegen. Deshalb haben wir am 2026-07-30 zwei eigene Prompts mit jeweils zehn klar überprüfbaren Vorgaben durch sechs Modelle geschickt. Das Ergebnis: Die Modelle liegen enger zusammen, als diese Ranglisten vermuten lassen. Entscheidend ist weniger die Marke als die Art der Anweisung.
Welches AI-Videomodell hält sich am besten an Prompts?
Seedance 2.0 Fast setzte in unserem Test die meisten Vorgaben um: 19 von 20 überprüfbaren Elementen und beim anspruchsvolleren Prompt glatte 10/10. Kling 3 Turbo und Veo 3.1 lagen mit je 18 Punkten gleichauf, Wan 2.7 erreichte 17,5, Grok Imagine 16 und Hailuo 02 Pro landete mit 15,5 Punkten auf dem letzten Platz, nachdem es eine komplette Ereignisabfolge ignoriert hatte. Drei Wiederholungsläufe mit dem schwierigeren Prompt änderten an dieser Reihenfolge nichts. Sora 2 ließ sich gar nicht testen.
| Modell | Wörtlicher Prompt | Stress-Prompt | Gesamt /20 | Kosten pro Clip | Pro Sekunde | Wartezeit |
|---|---|---|---|---|---|---|
| Seedance 2.0 Fast | 9.0 | 10.0 | 19.0 | $0.83 | $0.165 | 121–132s |
| Kling 3 Turbo | 9.5 | 8.5 | 18.0 | $0.45 | $0.090 | 45–54s |
| Veo 3.1 | 9.0 | 9.0 | 18.0 | $1.25 | $0.156 | 88–95s |
| Wan 2.7 | 9.0 | 8.5 | 17.5 | $0.40 | $0.080 | 103–104s |
| Grok Imagine | 8.0 | 8.0 | 16.0 | $0.09 | $0.015 | 43–49s |
| Hailuo 02 Pro | 9.0 | 6.5 | 15.5 | $0.29 | $0.049 | 166–185s |
| Sora 2 | — | — | — | — | — | 5 fehlgeschlagene Anfragen |
Die Preise basieren auf veröffentlichten Credit-Tarifen: auf der Preistabelle von Kie für Kling, Seedance, Wan, Hailuo und Grok sowie auf den AIReiter-Modellseiten für Veo 3.1 und Sora 2. Für die Tabelle haben wir sie durch die tatsächlich zurückgelieferte Clipdauer jedes Modells geteilt.
Die Wahl hängt davon ab, was dein Shot können muss:
- Der Prompt enthält eine Anzahl, Reihenfolge oder ein „bewegt sich nie“ → Seedance 2.0 Fast. Es war das einzige Modell, das alle zehn dieser Elemente korrekt umsetzte. Dafür zahlst du den Aufpreis.
- Du iterierst am Look statt an einer Abfolge → Kling 3 Turbo. Fast dieselbe Prompttreue zum ungefähr halben Preis und mit nur einem Drittel der Wartezeit.
- Du willst zunächst prüfen, ob ein Prompt überhaupt funktioniert → Grok Imagine für $0.015 pro Sekunde. Seine 16/20 gehen überwiegend auf einen fehlenden Auftritt zurück.
- Abfolge von Aktionen → nicht Hailuo 02 Pro, das ein komplettes Ereignis übersprang.
Sora 2 gab bei allen fünf Anfragen zwischen 03:57 und 03:59 UTC am 2026-07-30 UPSTREAM_BUSY / Upstream service is busy or upgrading zurück – über beide Prompts und drei zeitlich getrennte Wiederholungen hinweg. Keine Kosten, kein Clip, kein Score.
So lief der Test: zwei Prompts, 20 überprüfbare Elemente
Jede Klausel in beiden Prompts beschreibt etwas, das sich im Frame eindeutig prüfen lässt. Begriffe wie „cinematic“, „8k“ oder „moody“ haben wir bewusst weggelassen, weil sie nicht bewertbar sind. Jedes der zehn Elemente pro Prompt erhielt ✓ (1 Punkt), ~ (0,5 Punkte, teilweise erfüllt) oder ✗ (0 Punkte). Bildqualität und zeitliche Konsistenz fließen nicht in die Wertung ein: Ein Clip kann schön und stabil aussehen, während er nebenbei die Hälfte deiner Anweisungen unterschlägt. Grok Imagine wirkte eher wie ein 3D-Render als wie Fotografie – das kostete keine Punkte.
Der wörtliche Prompt prüft, ob ein Modell eine konkret beschriebene Szene zusammensetzen kann. Seine zehn Elemente: ein einzelnes rotes Vintage-Fahrrad, an eine gelbe Ziegelwand gelehnt, eine weiße Katze mit einem schwarzen Ohr, die von rechts ins Bild kommt, am Vorderrad anhält und nach oben schaut, ein Schild mit der Aufschrift OPEN 7AM, eine Dolly-Fahrt von weit zu mittel, die Kamera auf Bodenhöhe, bewölktes Licht ohne Sonne und keine Personen im Bild.
A single red vintage bicycle leans against a yellow brick wall on an empty
a street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.
Der Stress-Prompt testet Zählen, Ereignisreihenfolge und Negationen. Seine zehn Elemente sind: genau drei Enten, alle drei gleich groß, in einer Reihe auf einem Holztisch, keine Hände oder Personen, zuerst fällt die mittlere Ente um, danach die linke, die rechte bewegt sich nie, die Kamera bleibt feststehend, ein schlichter weißer Hintergrund und hartes Licht von oben.
Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.
Der Schalter, der deinen Prompt vor dem Modell umschreibt
Zwei dieser Modelle liefern standardmäßig einen aktivierten Prompt-Rewriter mit: prompt_extend bei Wan 2.7 und prompt_optimizer bei Hailuo 02 Pro. Laut Dokumentation stehen beide standardmäßig auf true. Wer einen Prompt abschickt, ohne diese Optionen anzufassen, bewertet nicht den eigenen Text, sondern dessen umgeschriebene Version. Für diesen Test standen beide auf false; mit den Standardwerten würde der Test Rewriter und Modell zugleich messen.
Auch andere Parameter werden nicht immer eingehalten. Jeder Clip wurde mit 5 Sekunden, 720p und 16:9 angefordert, doch drei Modelle setzten sich darüber hinweg. Die Preise pro Sekunde oben beziehen sich daher auf das zurückgelieferte Ergebnis statt auf die Anfrage:
| Modell | Gesendet | Zurückgegeben | Abgerechnete Credits |
|---|---|---|---|
| Seedance 2.0 Fast | 5s, 720p, 16:9 | 5.0s, 1280×720 | 165 (33/s) |
| Kling 3 Turbo | 5s, 720p, 16:9 | 5.0s, 1280×720 | 90 (18/s) |
| Veo 3.1 | 5s, 16:9 | 8.0s, 1280×720 | 125 pro Aufruf |
| Wan 2.7 | 5s, 720p, 16:9 | 5.0s, 1280×720 | 80 (16/s) |
| Grok Imagine | 6s (Minimum), 720p, 16:9 | 6.0s, 1280×720 | 18 (3/s) |
| Hailuo 02 Pro | 5s, 720p, 16:9 | 5.9s, 1920×1080 | 57 |
Für Hailuo 02 Pro sind nur der Prompt und zwei Schalter dokumentiert; weitere Parameter lassen sich also nicht setzen. In beiden Fällen lieferte es 1080p zurück. Veo 3.1 gab unabhängig von unserer Anfrage 8 Sekunden aus, und Grok Imagine dokumentiert eine Mindestdauer von 6 Sekunden.
Was alle sechs Modelle richtig machten
An der groben Bildkomposition scheiterte keines der sechs Modelle. Alle platzierten genau ein rotes Vintage-Fahrrad an einer gelben Ziegelwand, und alle erzeugten den sichtbaren Text „OPEN 7AM“ ohne einen einzigen falschen Buchstaben. Auch die beiden negativen Anweisungen hielten alle ein: In keinem der sechs Straßenclips erschien eine Person, und in keinem der sechs Entenclips mit feststehender Kamera bewegte sich die Kamera.
Hier geraten die Modelle ins Straucheln: vier Arten von Anweisungen
Zählen und Attributdetails
„Eine weiße Katze mit einem schwarzen Ohr“ setzte nur eines von sechs Modellen exakt um. Hailuo 02 Pro erzeugte als einziges eine Katze mit genau einem schwarzen Ohr und sonst weißem Fell. Kling 3 Turbo und Veo 3.1 trafen das schwarze Ohr, fügten aber einen schwarzen Schwanz hinzu. Wan 2.7 verteilte einen schwarzen Fleck über beide Ohren, Grok Imagine malte eine vollständige Siam-Maske, und Seedance 2.0 Fast erzeugte eine fast komplett weiße Katze mit einem schwachen dunklen Fleck an einer Ohrspitze.
Alle Modelle verstanden „weiße Katze mit schwarzer Markierung“. Mit Ausnahme von Hailuo behandelte keines „eins“ tatsächlich als Zahl. In diesen sechs Ausgaben waren Mengenangaben bei Attributen deutlich unzuverlässiger als die grobe Bildkomposition.
Ereignisreihenfolge und Timing
Der Enten-Prompt verlangte eine klare Sequenz: Mitte fällt, dann links, rechts bewegt sich nie. Vier Modelle setzten sie korrekt um: Kling 3 Turbo bei 2.0s und 4.9s, Seedance 2.0 Fast bei 2.0s und 3.5s, Wan 2.7 bei 1.0s und 4.0s sowie Veo 3.1 bei 1.6s und 4.8s. Keines traf den verlangten Abstand von zwei Sekunden exakt, und die rechte Ente blieb in allen sechs Clips stehen.
Hailuo 02 Pro führte die Abfolge überhaupt nicht aus. Die mittlere Ente fiel nie um. Stattdessen drehte sich die linke Ente in eine Seitenansicht und wuchs auf fast die doppelte Größe, während alle drei aufrecht blieben.
Grok Imagine ließ die richtigen Enten in der richtigen Reihenfolge kippen, ließ sie jedoch nach vorn auf den Schnabel statt auf die Seite fallen. Veo 3.1 traf die Reihenfolge und ließ anschließend beide umgefallenen Enten bis zum letzten Frame wieder aufstehen – das Ereignis trat ein, aber der Zustand blieb nicht erhalten.
Kameradisziplin
Feststehende Kameras respektierten alle Modelle, beschriebene Kamerafahrten dagegen nicht. Wan 2.7 und Veo 3.1 begannen beide mit der geforderten Dolly-Fahrt von weit zu mittel, schoben dann aber weiter bis zur extremen Nahaufnahme. Wan endete bei einer bloßen Felge, die Katze war komplett aus dem Bild. Grok Imagine bewegte sich so wenig, dass die Fahrt kaum erkennbar ist. Hailuo 02 Pro war das einzige Modell, das „auf Bodenhöhe bleiben“ brach und ungefähr aus Hüfthöhe filmte, während die anderen fünf tief blieben.
Objektkonsistenz
Objekte verändern ihre Größe, sobald sie sich bewegen. Hailuos linke Ente wuchs auf beinahe das Doppelte ihrer Ausgangsgröße, bei Grok Imagine wurden beide umgefallenen Enten sichtbar größer, und die gekippten Enten von Kling 3 Turbo und Veo 3.1 legten leicht zu. Nur Seedance 2.0 Fast und Wan 2.7 hielten alle drei Enten vom ersten bis zum letzten Frame gleich groß.
Größenkonsistenz wird nicht ausdrücklich verlangt – und bleibt dann oft unbemerkt.
Fünf von sechs Modellen liegen bei der statischen Szene zwischen 8.0 und 9.5 und driften erst bei Mengenangaben und geordneten Ereignissen auseinander; dort verliert Hailuo 2,5 Punkte. Bei einem einfachen Shot bringt die Modellwahl wenig, aber sobald ein Prompt eine Zahl enthält, wird sie wichtig.
Bleibt die Rangfolge beim Wiederholungstest bestehen?
Ja – bei den drei Modellen, die wir erneut laufen ließen. Jedes erhielt zwei weitere Versuche mit dem Stress-Prompt, nach demselben Schema bewertet. Die Ergebnisbereiche überschneiden sich nicht.
| Modell | Lauf 1 | Lauf 2 | Lauf 3 | Median | Bereich |
|---|---|---|---|---|---|
| Seedance 2.0 Fast | 10.0 | 9.5 | 10.0 | 10.0 | 9.5–10.0 |
| Kling 3 Turbo | 8.5 | 8.0 | 8.0 | 8.0 | 8.0–8.5 |
| Hailuo 02 Pro | 6.5 | 6.5 | — | 6.5 | n=2 |
Kling 3 Turbo erzeugte in allen drei Läufen eine blaugraue Wand statt des geforderten schlichten weißen Hintergrunds. Das ist eine stabile Präferenz, kein Sampling-Zufall. Hailuo 02 Pro wiederholte seinen identischen Fehler zweimal: Die mittlere Ente fiel nie, die linke wuchs auf fast die doppelte Größe. Der dritte Hailuo-Lauf scheiterte an einem täglichen Credit-Limit, daher basiert sein Median auf zwei Samples.
Erst in den Wiederholungsläufen zeigte sich ein Verhalten, das einzelne Durchgänge verborgen hatten: Bei Kling 3 Turbo fiel die mittlere Ente und stand im zweiten Lauf vor dem letzten Frame wieder auf. Das entspricht der Zustandsumkehr, die Veo 3.1 in seinem einzigen Durchlauf zeigte. Ereignisse passieren, Zustände bleiben nicht immer bestehen.
Was ein erneuter Versuch kostet, wenn das Modell dich ignoriert
Preis und Geschwindigkeit laufen nicht parallel. Hailuo 02 Pro war pro Clip das zweitbilligste Modell und mit 166–185 Sekunden zugleich mit großem Abstand das langsamste. Kling 3 Turbo lieferte seine 18/20 dagegen in 45–54 Sekunden. Auch Preise pro Clip können bei kurzen Clips täuschen: Veo 3.1 kostet $1.25 gegenüber $0.83 für Seedance 2.0 Fast, liefert aber 8 statt 5 Sekunden. Pro Sekunde liegen beide mit $0.156 und $0.165 nahezu gleichauf.
Die 17 Clips hinter diesem Artikel kosteten 1,387 Kie-Credits plus 250 AIReiter-Credits. Bei 200 beziehungsweise 100 Credits pro Dollar sind das $9.44; die fünf fehlgeschlagenen Sora-2-Anfragen kosteten nichts. Generieren ist der günstige Teil. Dreimal zu generieren, weil Element vier fehlt und keine Checkliste es bemerkt, ist es nicht.
Wie es ein Nutzer in r/SoraAi formulierte: "No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions." Eine Bewertung auf Elementebene macht daraus eine Liste konkreter Anweisungen, mit der sich arbeiten lässt.
So testest du deine eigene Shotliste
- Schreibe einen echten Prompt so um, dass jede Klausel überprüfbar ist: Ersetze „cinematic“ durch Kamerahöhe, Lichtrichtung und den Frame, auf dem die Bewegung endet.
- Teile ihn vor dem Generieren in eine nummerierte Elementliste auf. Zehn Elemente reichen; notiere sie, sonst bewertest du aus dem Gedächtnis und zu großzügig.
- Deaktiviere die Rewriter. Setze
prompt_extendbei Wan auffalse,prompt_optimizerbei Hailuo auffalseund prüfe vor jedem Vergleich, ob deine Plattform einen eigenen Rewriter hat. - Schicke denselben String an zwei oder drei Modelle mit abgestimmter Dauer und Auflösung und notiere, welche Einstellungen jedes Modell stillschweigend überschreibt.
- Sieh dir den vollständigen Clip an und nutze ersten, mittleren und letzten Frame als Kontrollpunkte – kurze Zustandsfehler können zwischen den Samples auftreten. Wiederhole dann nur mit dem Modell, das die für dich wichtigen Elemente verfehlte. Ein fehlendes schwarzes Ohr ist egal; eine Ente, die wieder aufsteht, nicht.
Wenn du unsere Durchläufe direkt nachvollziehen möchtest: Die Modellseiten für Veo 3.1, Seedance 2 Fast und Sora 2 nennen die exakten Modell-IDs und Credit-Preise pro Sekunde, die wir oben verwendet haben.
FAQ
Welcher AI-Videogenerator ist am präzisesten?
In diesem Test war es Seedance 2.0 Fast mit 19 von 20 überprüfbaren Elementen und als einziges Modell mit einem fehlerfreien Durchlauf bei Zählen, Reihenfolge und Negation. Bei einfachen Szenen war die Genauigkeit bei fünf von sechs Modellen nahezu identisch; die Rangfolge trennt sie daher erst bei sequenziellen Prompts.
Ist Seedance besser als Veo 3.1 oder Sora 2?
Seedance 2.0 Fast übertraf Veo 3.1 um einen Punkt, 19 zu 18, und kostete pro Clip zwei Drittel so viel. Beide führten die Entenabfolge in der richtigen Reihenfolge aus. Sora 2 können wir nicht einordnen: Alle fünf Anfragen am 2026-07-30 scheiterten upstream. Es hat deshalb keinen Score, nicht etwa einen niedrigen.
Lohnt sich Kling 3 Turbo für promptlastige Arbeit?
Ja, wenn Geschwindigkeit wichtiger ist als Sequenzen. Kling 3 Turbo erzielte beim wörtlichen Prompt mit 9.5/10 den höchsten Wert aller sechs Modelle und lieferte in 45–54 Sekunden. Beim Stress-Prompt verlor es jedoch einen Punkt, weil es eine blaugraue Wand statt des geforderten schlichten weißen Hintergrunds erzeugte.
Verbessert ein längerer Prompt die Prompttreue?
Nicht automatisch. Der wörtliche Prompt dieses Tests ist länger als der Stress-Prompt, dennoch erzielte jedes Modell damit höhere Werte. Der Grund: Seine Klauseln beschreiben eine statische Anordnung statt Mengen und Ereignisreihenfolgen.
Was dieser Test nicht beantworten kann
Drei Durchläufe reichen aus, um zu zeigen, dass diese Werte kein reines Sampling-Rauschen sind, aber nicht, um daraus einen Benchmark zu machen. Nur Seedance, Kling und Hailuo wurden wiederholt; Veo 3.1, Wan 2.7 und Grok Imagine beruhen weiterhin auf jeweils einem Versuch. Beide Prompts bestehen außerdem aus einem einzelnen Shot, enthalten keinen Dialog und bleiben unter zehn Sekunden. Damit sind gerade die Anweisungstypen, an denen ein echter Schnitt vermutlich scheitert – Kontinuität über mehrere Shots, gesprochene Zeilen, eine wiederkehrende benannte Figur –, vollständig ungetestet. Die Rangfolge oben zeigt, wer einen beschriebenen Shot befolgt. Ob das auch für eine Shotliste gilt, ist der nächste und andere Test.
Weiterführend: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · AI-Kamerabewegungs-Prompts im Test