Ein Standbild wird zur Performance: Kling Motion Control überträgt die Bewegung aus einem kurzen Video auf ein Charakterbild. Pro Generierung unterstützt das Feature eine Person und eine Bewegungsvorlage mit bis zu 30 Sekunden Länge. Zur Auswahl stehen zwei Versionen: Kling VIDEO 2.6 für Körperbewegungen mit 5–8 Credits pro Sekunde sowie Kling VIDEO 3.0 mit Fokus auf Gesichtskonsistenz für 9–12 Credits pro Sekunde. Laut offiziellem Kling-Leitfaden hängt die Qualität stark von den Eingaben ab. Ein LinkedIn-Experiment zeigt zudem: Entscheidend für ein gutes Resultat ist, dass Geometrie und Kameraperspektive von Bild und Bewegungsvideo möglichst gut zusammenpassen.
So überträgt Kling Motion Control Bewegungen
Das Modell liest die Bewegungsdaten eines Bewegungsvideos aus und legt sie auf ein Referenzbild. Das Ergebnis ist ein Clip, in dem die abgebildete Figur die Aktion aus dem Referenzvideo ausführt. Nach dem offiziellen Kling-Leitfaden wird nur eine Figur unterstützt. Sind im Bewegungsvideo oder im ersten Frame mehrere Personen zu sehen, wählt Kling automatisch die Person aus, die den größten Bildbereich einnimmt.
Beide Eingaben müssen aus einer durchgehenden Einstellung bestehen: keine Schnitte, keine Perspektivwechsel und möglichst wenig Kamerabewegung. Kling empfiehlt deutliche Bewegungen bei moderatem Tempo und geringem Positionswechsel. Bei schnellen oder komplexen Aktionen kann das Modell nur einen verwertbaren zusammenhängenden Abschnitt extrahieren. Der erzeugte Clip fällt dann kürzer aus als der Upload – die dafür eingesetzten Credits werden ausdrücklich nicht erstattet.
Vorgaben für die Eingaben
| Parameter | Grenzwert |
|---|---|
| Länge des Bewegungsvideos | 3–30 Sekunden |
| Minimal extrahierbare zusammenhängende Bewegung | 3 Sekunden |
| Bildauflösung (kurze Kante) | Mindestens 340 px |
| Bildauflösung (lange Kante) | Höchstens 3.850 px |
| Bilddateigröße | Max. 10 MB |
| Videodateigröße | Max. 100 MB |
| Unterstützte Bildformate | JPG, PNG, WEBP, GIF, AVIF |
| Unterstützte Videoformate | MP4, MOV, WEBM, M4V, GIF |
| Anzahl der Figuren | Eine (größtes Motiv wird automatisch gewählt) |
Die ComfyUI-Dokumentation nennt eine strengere Mindestgröße von 720 px für Breite und Höhe. Außerdem sollte das Charakterbild Kopf, Schultern und Oberkörper vollständig zeigen.
Ausrichtungsmodi im Überblick
Kling bietet zwei Modi, die festlegen, wie Figur und Bildausschnitt im Ergebnis ausgerichtet werden:
| Modus | Bewegung folgt | Ausrichtung folgt | Kamerabewegung |
|---|---|---|---|
| Character Orientation Matches Video | Referenzvideo | Referenzvideo | Referenzvideo |
| Character Orientation Matches Image | Referenzvideo | Referenzbild | Über Prompts steuerbar |
Im Bildausrichtungsmodus lassen sich über Prompts fünf Kamerafahrten auslösen: Zoom In, Zoom Out, Camera Up, Camera Down und Fixed Position. Die ComfyUI-Dokumentation begrenzt diesen Modus auf maximal 10 Sekunden; im Videoausrichtungsmodus sind es dagegen 30 Sekunden.
Kling 3.0 oder 2.6: Funktionen, Preise und Auflösung
Die beiden Versionen setzen unterschiedliche Schwerpunkte. 2.6 ist die Basis für Körperbewegungen: Ganzkörpersynchronisierung, komplexe sportliche Aktionen, Handbewegungen, 30-sekündige One-Shots und per Textprompt steuerbare Szenen. 3.0 ergänzt dies um eine bessere Gesichtskonsistenz mittels Element Binding.
Mit Element Binding verknüpfst du mehrere Gesichtsreferenzen oder ein kurzes Gesichtsvideo mit der Figur. Das Modell nutzt diese Daten, um die Identität bei Drehungen, wechselnden Ausdrücken und Verdeckungen konsistent zu halten. Die Element Library speichert ausschließlich Gesichtsinformationen; Kleidung, Frisur, Make-up und Requisiten werden nicht erfasst. Element Binding funktioniert nur, wenn die Figur dieselbe Ausrichtung wie das Video übernimmt.
Direktvergleich der Versionen
| Funktion | Kling 3.0 | Kling 2.6 |
|---|---|---|
| Hauptstärke | Gesichtsidentität über Blickwinkel und Emotionen hinweg | Ganzkörper-Motion-Transfer |
| Element Binding | Ja (Gesichtsreferenzen aus mehreren Winkeln) | Nein |
| Wiederherstellung bei Verdeckungen | Ja (laut Anbieter mit hoher Genauigkeit) | Nein |
| Kamerasteuerung | Multi-Elements, Curve Dolly, Camera Shake | Zoom In/Out, Camera Up/Down, Fixed |
| Auflösung (Standard) | 720p | 720p |
| Auflösung (Professional) | 1080p | 1080p |
| Länge des Quellvideos | 3–30 Sekunden (offizieller Leitfaden) | 3–30 Sekunden (offizieller Leitfaden) |
Preise
Abgerechnet wird nach erzeugter Dauer in Sekunden und auf die nächste volle Sekunde gerundet, wie der offizielle Leitfaden erklärt.
| Modell | Modus | Preis |
|---|---|---|
| Kling VIDEO 3.0 Motion Control | Standard | 9 Credits/Sekunde |
| Kling VIDEO 3.0 Motion Control | Professional | 12 Credits/Sekunde |
| Kling VIDEO 2.6 Motion Control | Standard | 5 Credits/Sekunde |
| Kling VIDEO 2.6 Motion Control | Professional | 8 Credits/Sekunde |
Ein Clip mit 3,4 Sekunden wird auf 3 Sekunden abgerundet und kostet in 3.0 Standard 27 Credits. Bei 3,6 Sekunden wird auf 4 Sekunden aufgerundet, also auf 36 Credits. Details zu Abo-Stufen und Preisen für den Credit-Kauf findest du in unserem Kling 3 API pricing guide.
Motion-Control-Video erstellen: Schritt für Schritt
- Bewegungsvideo hochladen. Wähle einen Clip von deinem Gerät oder aus Klings integrierter Motion Library. Er muss eine durchgehende Aufnahme mit einer Person sein und zwischen 3 und 30 Sekunden dauern.
- Charakterbild hinzufügen. Lade das Standbild der Figur hoch, die animiert werden soll. Der Bildausschnitt sollte zur Bewegung passen: Ganzkörperbild für Ganzkörperbewegungen, Halbkörperbild für Halbkörperbewegungen. Gliedmaßen müssen sichtbar sein, und um das Motiv herum sollte ausreichend freier Raum liegen.
- Gesichtselement verknüpfen (nur 3.0). Aktiviere „Bind Facial Element to Enhance Facial Consistency“. Wähle dann ein vorhandenes Element aus oder erstelle eines mit Gesichtsbildern oder einem kurzen Video.
- Ausrichtungsmodus wählen. Für Ganzkörper-Choreografien eignet sich „Character Orientation Matches Video“. Für Porträtanimationen mit per Prompt gesteuerter Kamera wählst du „Character Orientation Matches Image“.
- Szenenprompt schreiben (optional). Im Bildausrichtungsmodus steuerst du damit Hintergrunddetails und die Kamerabehandlung.
- Generieren und gezielt iterieren. Ändere jeweils nur eine Variable: Referenzvideo, Charakterbild oder Binding-Daten. Wenn du alle drei gleichzeitig austauschst, lässt sich kaum nachvollziehen, welche Eingabe einen Fehler verursacht hat.
Element Binding vorbereiten: Diese Blickwinkel helfen
Damit Element Binding in 3.0 zuverlässig arbeitet, empfiehlt der offizielle Leitfaden, die Gesichtsreferenzen auf das gewünschte Ergebnis abzustimmen:
- Präzise Kopfdrehungen: eine frontale Aufnahme sowie eine linke und/oder rechte Seitenansicht.
- Treffsichere Gesichtsausdrücke: ein neutrales frontales Bild plus ein frontales Bild mit dem gewünschten Ausdruck, etwa einem Lächeln.
- Nahtlose 360°-Drehung mit Lächeln: fünf Referenzen – frontal, linkes Profil, rechtes Profil, von oben und von unten – alle lächelnd.
- Komplexe Emotionswechsel mit Kopfbewegung: Frontalaufnahme, lächelndes Bild, trauriges Bild und Seitenansichten.
Für möglichst umfassende Gesichtsdaten empfiehlt Kling ein kurzes Video hochzuladen statt einzelner Bilder. Laufende Aufnahmen erfassen mehr Übergänge zwischen Gesichtsausdrücken als voneinander getrennte Fotos.
Kling Motion Control über die API nutzen
Im Kling-Web-Playground werden Credits sekundengenau verbraucht, was sich schnell summieren kann. In r/klingO1 auf Reddit schrieb ein Nutzer nach Tests mit 3.0 Motion Control, die Bewegung wirke „finally starting to feel 'heavy'“; außerdem schienen die Füße besser am Boden verankert zu sein. Das wäre eine Verbesserung gegenüber dem bei 2.6 öfter auftretenden Gleiteffekt (Quelle). Derselbe Nutzer empfand die Kling 3.0 Motion Control API über Drittanbieter bei hohem Volumen als „noticeably cheaper“ als Playground-Credits. Das ist allerdings eine persönliche Einschätzung eines einzelnen Nutzers und kein quantifizierter Preisvergleich.
Für die programmatische Nutzung gibt es zwei Wege: die ComfyUI-Integration für visuelle Workflows und direkte API-Aufrufe für Batch-Pipelines.
ComfyUI-Integration
Die ComfyUI-Dokumentation enthält einen offiziellen Partner-Node, der sämtliche Motion-Control-Parameter als Workflow-Eingaben bereitstellt:
- LoadImage-Node: Charakter-Referenzbild (JPG, PNG, WEBP, GIF, AVIF; max. 10 MB)
- LoadVideo-Node: Bewegungs-Referenzvideo (MP4, MOV, WEBM, M4V, GIF; max. 100 MB)
- character_orientation:
videooderimage - Prompt-Text: Steuerung von Szene und Hintergrund
- Modellstufe: Standard (720p) oder Pro (1080p)
Eine Reddit-Ankündigung in r/comfyui bestätigt, dass das ComfyUI-Kie-API node pack experimentelle Unterstützung für Kling 3.0 Motion Control ergänzt. Verfügbar sind Referenzbild, Driving Video, Prompt und Ausrichtungseinstellungen.
Direkter API-Zugang
Außerhalb von ComfyUI kannst du Kling Motion Control über API-Anbieter ansprechen, die das zugrunde liegende Modell bereitstellen. Eine Anfrage enthält im Kern die Modellversionskennung, das als Base64 oder URL kodierte Charakterbild, das Bewegungsreferenzvideo, den Ausrichtungsparameter und optional einen Szenenprompt. Die Generierung läuft asynchron: Job absenden, Status bis zum Abschluss abfragen und anschließend die Video-URL abrufen.
Eine direkt nutzbare Schnittstelle für Kling 3.0 Motion Control findest du auf der Kling Motion Control model page mit API-Dokumentation und aktuellen Preisen.
Credit-Kosten pro Generierung berechnen
| Szenario | Dauer | Modell / Modus | Kosten |
|---|---|---|---|
| Schneller Entwurfstest | 5 s | 2.6 Standard | 25 Credits |
| Finaler Render mit Gesichtskonsistenz | 5 s | 3.0 Professional | 60 Credits |
| 30-Sekunden-One-Shot | 30 s | 2.6 Standard | 150 Credits |
| Batch aus 10 Clips (je 5 s) | 50 s gesamt | 3.0 Standard | 450 Credits |
Mit größerem Volumen wächst der Preisunterschied. Zehn fünfsekündige Clips in 3.0 Professional kosten 600 Credits; bei 2.6 Standard sind es für dieselben 50 Sekunden Output 250 Credits. Für Entwürfe ist 2.6 Standard der sinnvollere Startpunkt. 3.0 Professional lohnt sich für finale Renderings, bei denen die Gesichtsidentität zählt.
Hinweis: Credits werden nicht erstattet: Enthält dein Referenzvideo komplexe oder schnelle Bewegungen und extrahiert das Modell deshalb nur einen kürzeren verwertbaren Abschnitt, werden Credits trotzdem entsprechend der erzeugten Dauer berechnet. Kling weist ausdrücklich darauf hin, dass in diesem Fall keine Erstattung erfolgt.
Wie viele kostenlose Credits zum Testen verfügbar sind, erfährst du in unserem Kling AI free tier guide.
Typische Probleme – und was dagegen hilft
| Symptom | Ursache | Lösung | Quelle |
|---|---|---|---|
| Gesicht driftet oder verändert sich während der Bewegung | Element Binding wurde übersprungen oder enthält nur einen Blickwinkel | Neu binden: Frontalansicht plus linke/rechte Seitenansichten; Bilder mit Zielausdruck ergänzen | Offizieller Leitfaden |
| Output ist kürzer als die Referenz | Aktion ist zu schnell oder zu komplex für eine durchgehende Bewegungsextraktion | Langsameren Clip verwenden; Schlüsselbewegung in ein Zeitfenster von 3–10 Sekunden legen | Offizieller Leitfaden |
| Gliedmaßen wirken matschig oder verschlungen | Körperteile sind im Charakterbild abgeschnitten oder verdeckt | Charakterbild mit vollständigem Körper sowie getrennten, sichtbaren Gliedmaßen wählen | Offizieller Leitfaden |
| Ringe oder Artefakte an den Händen | Negative Prompts fehlen | Handpositionen in der Referenz vereinfachen; ringähnliche Posen vermeiden | |
| Personen im Hintergrund bleiben eingefroren | Das Modell animiert nur die Hauptfigur | Referenz auf eine Aufnahme mit nur einer Person beschränken | |
| Identität wirkt falsch oder verzerrt | Schwaches oder unpassendes Charakterbild | Ein schärferes, gut ausgeleuchtetes Frontalbild verwenden; Ausschnitt an die Bewegungsart anpassen | |
| Bewegung wirkt wie „sliding on ice“ | Referenzvideo mit instabilem Stand (2.6) | Referenz stabilisieren; 3.0 verankert die Füße Berichten zufolge besser | |
| Flache 2D-Cartoons haben Probleme mit Rückansichten | Stilisierte Proportionen sind schwerer nachzuverfolgen | Für Drehungen realistische oder 3D-artige Figuren verwenden | ComfyUI-Dokumentation |
Ein LinkedIn-Experiment von César Augusto Cabrera Boggio kam zu dem Ergebnis, dass Kamerawinkel, Bewegungsrichtung und Geometrie von Eingabebild und Driving Video eng übereinstimmen müssen, damit das Tracking zuverlässig funktioniert. Nicht passende Eingaben sind die häufigste Ursache für verzerrte Gesichter und ruckelige Bewegungen.
FAQ
Kann ich Kling Motion Control mit mehreren Figuren nutzen?
Nein. Das Feature unterstützt pro Generierung nur eine Figur. Befinden sich im Referenzvideo oder im ersten Frame mehrere Personen, wählt Kling automatisch diejenige aus, die den größten Anteil des Bildes einnimmt. Für Szenen mit mehreren Figuren musst du die Clips je Figur einzeln erzeugen und anschließend in der Postproduktion zusammensetzen.
Kann ich den Originalton des Referenzvideos beibehalten?
Der offizielle Kling-Leitfaden nennt keine Unterstützung für die Übernahme von Audio. Das generierte Video wird auf Grundlage des Charakterbildes und der extrahierten Bewegungsdaten neu gerendert. Audio sollte daher in der Postproduktion synchronisiert werden.
Was unterscheidet Standard und Professional?
Der Standard-Modus erzeugt 720p, verbraucht weniger Credits und eignet sich für einfache Animationen sowie schnelle Tests. Professional liefert 1080p zu höheren Kosten pro Sekunde und ist laut den ComfyUI-Beschreibungen der Tarifstufen besser für detaillierte Choreografien und handlastige Szenen geeignet. Professional kostet je nach Version pro Sekunde 33–60 % mehr: 33 % bei 3.0 und 60 % bei 2.6.
Ist Kling Motion Control per API oder mit ComfyUI verfügbar?
Ja. Der ComfyUI-Partner-Node stellt alle Motion-Control-Parameter in einem Workflow bereit. Drittanbieter bieten zudem programmatischen API-Zugang an. Mindestens ein Reddit-Nutzer empfand die API für Batch-Jobs als günstiger, doch dabei handelt es sich um eine einzelne persönliche Einschätzung und keinen bestätigten Preisvergleich.
Wie lang darf ein Motion-Control-Clip sein?
Quellvideos dürfen 3–30 Sekunden lang sein; der Output soll diese Länge grundsätzlich übernehmen. Im Bildausrichtungsmodus begrenzt die ComfyUI-Dokumentation die maximale Länge auf 10 Sekunden. Die kürzeste extrahierbare zusammenhängende Bewegung beträgt 3 Sekunden. Findet das Modell keine 3 Sekunden gültige Bewegung, schlägt die Generierung fehl.
Welche Version passt zu deinem Einsatz?
| Szenario | Version | Modus | Zugang |
|---|---|---|---|
| Schneller Test oder Social-Meme | 2.6 | Standard | Web-Playground |
| Kurze frontale Aktion mit Identitätserhalt | 3.0 | Standard | Web-Playground |
| Entwurf für Ganzkörpertanz oder Choreografie | 2.6 | Professional | Playground oder API |
| Finales Rendering mit Gesichtskonsistenz aus mehreren Winkeln | 3.0 | Professional | API (Kostenvorteile bei Batches) |
| Batch-Generierung (10+ Varianten) | 3.0 | Standard | API |
| Kinematischer Orbit oder Handheld-Energie | 3.0 | Standard + Curve Dolly / Camera Shake | Web-Playground |
Nimm 2.6 für körperbetonte Bewegungen, günstige Entwürfe und einfache frontale Aktionen. 3.0 ist die bessere Wahl, wenn Gesichtskonsistenz, Ausdrücke, Wiederherstellung bei Verdeckungen oder die exklusiven 3.0-Kamerasteuerungen Curve Dolly, Camera Shake und Multi-Elements wichtig sind. Die Qualität der Referenz entscheidet stärker über das Ergebnis als Prompt-Know-how: Verwende stabiles, durchgehendes Material mit einer gut sichtbaren Person und moderatem Bewegungstempo.