AIREITER

Kling Motion Control: API, Preise & Workflow (2026)

Zuletzt aktualisiert: 2026-08-13 01:23:37

Offizieller Kling-Motion-Control-Leitfaden mit Preisen und Versionsdetails

Ein Standbild wird zur Performance: Kling Motion Control überträgt die Bewegung aus einem kurzen Video auf ein Charakterbild. Pro Generierung unterstützt das Feature eine Person und eine Bewegungsvorlage mit bis zu 30 Sekunden Länge. Zur Auswahl stehen zwei Versionen: Kling VIDEO 2.6 für Körperbewegungen mit 5–8 Credits pro Sekunde sowie Kling VIDEO 3.0 mit Fokus auf Gesichtskonsistenz für 9–12 Credits pro Sekunde. Laut offiziellem Kling-Leitfaden hängt die Qualität stark von den Eingaben ab. Ein LinkedIn-Experiment zeigt zudem: Entscheidend für ein gutes Resultat ist, dass Geometrie und Kameraperspektive von Bild und Bewegungsvideo möglichst gut zusammenpassen.

So überträgt Kling Motion Control Bewegungen

Das Modell liest die Bewegungsdaten eines Bewegungsvideos aus und legt sie auf ein Referenzbild. Das Ergebnis ist ein Clip, in dem die abgebildete Figur die Aktion aus dem Referenzvideo ausführt. Nach dem offiziellen Kling-Leitfaden wird nur eine Figur unterstützt. Sind im Bewegungsvideo oder im ersten Frame mehrere Personen zu sehen, wählt Kling automatisch die Person aus, die den größten Bildbereich einnimmt.

Beide Eingaben müssen aus einer durchgehenden Einstellung bestehen: keine Schnitte, keine Perspektivwechsel und möglichst wenig Kamerabewegung. Kling empfiehlt deutliche Bewegungen bei moderatem Tempo und geringem Positionswechsel. Bei schnellen oder komplexen Aktionen kann das Modell nur einen verwertbaren zusammenhängenden Abschnitt extrahieren. Der erzeugte Clip fällt dann kürzer aus als der Upload – die dafür eingesetzten Credits werden ausdrücklich nicht erstattet.

Vorgaben für die Eingaben

ParameterGrenzwert
Länge des Bewegungsvideos3–30 Sekunden
Minimal extrahierbare zusammenhängende Bewegung3 Sekunden
Bildauflösung (kurze Kante)Mindestens 340 px
Bildauflösung (lange Kante)Höchstens 3.850 px
BilddateigrößeMax. 10 MB
VideodateigrößeMax. 100 MB
Unterstützte BildformateJPG, PNG, WEBP, GIF, AVIF
Unterstützte VideoformateMP4, MOV, WEBM, M4V, GIF
Anzahl der FigurenEine (größtes Motiv wird automatisch gewählt)

Die ComfyUI-Dokumentation nennt eine strengere Mindestgröße von 720 px für Breite und Höhe. Außerdem sollte das Charakterbild Kopf, Schultern und Oberkörper vollständig zeigen.

Ausrichtungsmodi im Überblick

Kling bietet zwei Modi, die festlegen, wie Figur und Bildausschnitt im Ergebnis ausgerichtet werden:

ModusBewegung folgtAusrichtung folgtKamerabewegung
Character Orientation Matches VideoReferenzvideoReferenzvideoReferenzvideo
Character Orientation Matches ImageReferenzvideoReferenzbildÜber Prompts steuerbar

Im Bildausrichtungsmodus lassen sich über Prompts fünf Kamerafahrten auslösen: Zoom In, Zoom Out, Camera Up, Camera Down und Fixed Position. Die ComfyUI-Dokumentation begrenzt diesen Modus auf maximal 10 Sekunden; im Videoausrichtungsmodus sind es dagegen 30 Sekunden.

Kling 3.0 oder 2.6: Funktionen, Preise und Auflösung

Die beiden Versionen setzen unterschiedliche Schwerpunkte. 2.6 ist die Basis für Körperbewegungen: Ganzkörpersynchronisierung, komplexe sportliche Aktionen, Handbewegungen, 30-sekündige One-Shots und per Textprompt steuerbare Szenen. 3.0 ergänzt dies um eine bessere Gesichtskonsistenz mittels Element Binding.

Mit Element Binding verknüpfst du mehrere Gesichtsreferenzen oder ein kurzes Gesichtsvideo mit der Figur. Das Modell nutzt diese Daten, um die Identität bei Drehungen, wechselnden Ausdrücken und Verdeckungen konsistent zu halten. Die Element Library speichert ausschließlich Gesichtsinformationen; Kleidung, Frisur, Make-up und Requisiten werden nicht erfasst. Element Binding funktioniert nur, wenn die Figur dieselbe Ausrichtung wie das Video übernimmt.

Direktvergleich der Versionen

FunktionKling 3.0Kling 2.6
HauptstärkeGesichtsidentität über Blickwinkel und Emotionen hinwegGanzkörper-Motion-Transfer
Element BindingJa (Gesichtsreferenzen aus mehreren Winkeln)Nein
Wiederherstellung bei VerdeckungenJa (laut Anbieter mit hoher Genauigkeit)Nein
KamerasteuerungMulti-Elements, Curve Dolly, Camera ShakeZoom In/Out, Camera Up/Down, Fixed
Auflösung (Standard)720p720p
Auflösung (Professional)1080p1080p
Länge des Quellvideos3–30 Sekunden (offizieller Leitfaden)3–30 Sekunden (offizieller Leitfaden)

Preise

Abgerechnet wird nach erzeugter Dauer in Sekunden und auf die nächste volle Sekunde gerundet, wie der offizielle Leitfaden erklärt.

ModellModusPreis
Kling VIDEO 3.0 Motion ControlStandard9 Credits/Sekunde
Kling VIDEO 3.0 Motion ControlProfessional12 Credits/Sekunde
Kling VIDEO 2.6 Motion ControlStandard5 Credits/Sekunde
Kling VIDEO 2.6 Motion ControlProfessional8 Credits/Sekunde

Ein Clip mit 3,4 Sekunden wird auf 3 Sekunden abgerundet und kostet in 3.0 Standard 27 Credits. Bei 3,6 Sekunden wird auf 4 Sekunden aufgerundet, also auf 36 Credits. Details zu Abo-Stufen und Preisen für den Credit-Kauf findest du in unserem Kling 3 API pricing guide.

Motion-Control-Video erstellen: Schritt für Schritt

  1. Bewegungsvideo hochladen. Wähle einen Clip von deinem Gerät oder aus Klings integrierter Motion Library. Er muss eine durchgehende Aufnahme mit einer Person sein und zwischen 3 und 30 Sekunden dauern.
  2. Charakterbild hinzufügen. Lade das Standbild der Figur hoch, die animiert werden soll. Der Bildausschnitt sollte zur Bewegung passen: Ganzkörperbild für Ganzkörperbewegungen, Halbkörperbild für Halbkörperbewegungen. Gliedmaßen müssen sichtbar sein, und um das Motiv herum sollte ausreichend freier Raum liegen.
  3. Gesichtselement verknüpfen (nur 3.0). Aktiviere „Bind Facial Element to Enhance Facial Consistency“. Wähle dann ein vorhandenes Element aus oder erstelle eines mit Gesichtsbildern oder einem kurzen Video.
  4. Ausrichtungsmodus wählen. Für Ganzkörper-Choreografien eignet sich „Character Orientation Matches Video“. Für Porträtanimationen mit per Prompt gesteuerter Kamera wählst du „Character Orientation Matches Image“.
  5. Szenenprompt schreiben (optional). Im Bildausrichtungsmodus steuerst du damit Hintergrunddetails und die Kamerabehandlung.
  6. Generieren und gezielt iterieren. Ändere jeweils nur eine Variable: Referenzvideo, Charakterbild oder Binding-Daten. Wenn du alle drei gleichzeitig austauschst, lässt sich kaum nachvollziehen, welche Eingabe einen Fehler verursacht hat.

Element Binding vorbereiten: Diese Blickwinkel helfen

Damit Element Binding in 3.0 zuverlässig arbeitet, empfiehlt der offizielle Leitfaden, die Gesichtsreferenzen auf das gewünschte Ergebnis abzustimmen:

  • Präzise Kopfdrehungen: eine frontale Aufnahme sowie eine linke und/oder rechte Seitenansicht.
  • Treffsichere Gesichtsausdrücke: ein neutrales frontales Bild plus ein frontales Bild mit dem gewünschten Ausdruck, etwa einem Lächeln.
  • Nahtlose 360°-Drehung mit Lächeln: fünf Referenzen – frontal, linkes Profil, rechtes Profil, von oben und von unten – alle lächelnd.
  • Komplexe Emotionswechsel mit Kopfbewegung: Frontalaufnahme, lächelndes Bild, trauriges Bild und Seitenansichten.

Für möglichst umfassende Gesichtsdaten empfiehlt Kling ein kurzes Video hochzuladen statt einzelner Bilder. Laufende Aufnahmen erfassen mehr Übergänge zwischen Gesichtsausdrücken als voneinander getrennte Fotos.

Kling Motion Control über die API nutzen

Im Kling-Web-Playground werden Credits sekundengenau verbraucht, was sich schnell summieren kann. In r/klingO1 auf Reddit schrieb ein Nutzer nach Tests mit 3.0 Motion Control, die Bewegung wirke „finally starting to feel 'heavy'“; außerdem schienen die Füße besser am Boden verankert zu sein. Das wäre eine Verbesserung gegenüber dem bei 2.6 öfter auftretenden Gleiteffekt (Quelle). Derselbe Nutzer empfand die Kling 3.0 Motion Control API über Drittanbieter bei hohem Volumen als „noticeably cheaper“ als Playground-Credits. Das ist allerdings eine persönliche Einschätzung eines einzelnen Nutzers und kein quantifizierter Preisvergleich.

Für die programmatische Nutzung gibt es zwei Wege: die ComfyUI-Integration für visuelle Workflows und direkte API-Aufrufe für Batch-Pipelines.

ComfyUI-Integration

Die ComfyUI-Dokumentation enthält einen offiziellen Partner-Node, der sämtliche Motion-Control-Parameter als Workflow-Eingaben bereitstellt:

  • LoadImage-Node: Charakter-Referenzbild (JPG, PNG, WEBP, GIF, AVIF; max. 10 MB)
  • LoadVideo-Node: Bewegungs-Referenzvideo (MP4, MOV, WEBM, M4V, GIF; max. 100 MB)
  • character_orientation: video oder image
  • Prompt-Text: Steuerung von Szene und Hintergrund
  • Modellstufe: Standard (720p) oder Pro (1080p)

Eine Reddit-Ankündigung in r/comfyui bestätigt, dass das ComfyUI-Kie-API node pack experimentelle Unterstützung für Kling 3.0 Motion Control ergänzt. Verfügbar sind Referenzbild, Driving Video, Prompt und Ausrichtungseinstellungen.

Direkter API-Zugang

Außerhalb von ComfyUI kannst du Kling Motion Control über API-Anbieter ansprechen, die das zugrunde liegende Modell bereitstellen. Eine Anfrage enthält im Kern die Modellversionskennung, das als Base64 oder URL kodierte Charakterbild, das Bewegungsreferenzvideo, den Ausrichtungsparameter und optional einen Szenenprompt. Die Generierung läuft asynchron: Job absenden, Status bis zum Abschluss abfragen und anschließend die Video-URL abrufen.

Eine direkt nutzbare Schnittstelle für Kling 3.0 Motion Control findest du auf der Kling Motion Control model page mit API-Dokumentation und aktuellen Preisen.

Credit-Kosten pro Generierung berechnen

SzenarioDauerModell / ModusKosten
Schneller Entwurfstest5 s2.6 Standard25 Credits
Finaler Render mit Gesichtskonsistenz5 s3.0 Professional60 Credits
30-Sekunden-One-Shot30 s2.6 Standard150 Credits
Batch aus 10 Clips (je 5 s)50 s gesamt3.0 Standard450 Credits

Mit größerem Volumen wächst der Preisunterschied. Zehn fünfsekündige Clips in 3.0 Professional kosten 600 Credits; bei 2.6 Standard sind es für dieselben 50 Sekunden Output 250 Credits. Für Entwürfe ist 2.6 Standard der sinnvollere Startpunkt. 3.0 Professional lohnt sich für finale Renderings, bei denen die Gesichtsidentität zählt.

Hinweis: Credits werden nicht erstattet: Enthält dein Referenzvideo komplexe oder schnelle Bewegungen und extrahiert das Modell deshalb nur einen kürzeren verwertbaren Abschnitt, werden Credits trotzdem entsprechend der erzeugten Dauer berechnet. Kling weist ausdrücklich darauf hin, dass in diesem Fall keine Erstattung erfolgt.

Wie viele kostenlose Credits zum Testen verfügbar sind, erfährst du in unserem Kling AI free tier guide.

Typische Probleme – und was dagegen hilft

SymptomUrsacheLösungQuelle
Gesicht driftet oder verändert sich während der BewegungElement Binding wurde übersprungen oder enthält nur einen BlickwinkelNeu binden: Frontalansicht plus linke/rechte Seitenansichten; Bilder mit Zielausdruck ergänzenOffizieller Leitfaden
Output ist kürzer als die ReferenzAktion ist zu schnell oder zu komplex für eine durchgehende BewegungsextraktionLangsameren Clip verwenden; Schlüsselbewegung in ein Zeitfenster von 3–10 Sekunden legenOffizieller Leitfaden
Gliedmaßen wirken matschig oder verschlungenKörperteile sind im Charakterbild abgeschnitten oder verdecktCharakterbild mit vollständigem Körper sowie getrennten, sichtbaren Gliedmaßen wählenOffizieller Leitfaden
Ringe oder Artefakte an den HändenNegative Prompts fehlenHandpositionen in der Referenz vereinfachen; ringähnliche Posen vermeidenReddit
Personen im Hintergrund bleiben eingefrorenDas Modell animiert nur die HauptfigurReferenz auf eine Aufnahme mit nur einer Person beschränkenReddit
Identität wirkt falsch oder verzerrtSchwaches oder unpassendes CharakterbildEin schärferes, gut ausgeleuchtetes Frontalbild verwenden; Ausschnitt an die Bewegungsart anpassenLinkedIn
Bewegung wirkt wie „sliding on ice“Referenzvideo mit instabilem Stand (2.6)Referenz stabilisieren; 3.0 verankert die Füße Berichten zufolge besserReddit
Flache 2D-Cartoons haben Probleme mit RückansichtenStilisierte Proportionen sind schwerer nachzuverfolgenFür Drehungen realistische oder 3D-artige Figuren verwendenComfyUI-Dokumentation

Ein LinkedIn-Experiment von César Augusto Cabrera Boggio kam zu dem Ergebnis, dass Kamerawinkel, Bewegungsrichtung und Geometrie von Eingabebild und Driving Video eng übereinstimmen müssen, damit das Tracking zuverlässig funktioniert. Nicht passende Eingaben sind die häufigste Ursache für verzerrte Gesichter und ruckelige Bewegungen.

FAQ

Kann ich Kling Motion Control mit mehreren Figuren nutzen?

Nein. Das Feature unterstützt pro Generierung nur eine Figur. Befinden sich im Referenzvideo oder im ersten Frame mehrere Personen, wählt Kling automatisch diejenige aus, die den größten Anteil des Bildes einnimmt. Für Szenen mit mehreren Figuren musst du die Clips je Figur einzeln erzeugen und anschließend in der Postproduktion zusammensetzen.

Kann ich den Originalton des Referenzvideos beibehalten?

Der offizielle Kling-Leitfaden nennt keine Unterstützung für die Übernahme von Audio. Das generierte Video wird auf Grundlage des Charakterbildes und der extrahierten Bewegungsdaten neu gerendert. Audio sollte daher in der Postproduktion synchronisiert werden.

Was unterscheidet Standard und Professional?

Der Standard-Modus erzeugt 720p, verbraucht weniger Credits und eignet sich für einfache Animationen sowie schnelle Tests. Professional liefert 1080p zu höheren Kosten pro Sekunde und ist laut den ComfyUI-Beschreibungen der Tarifstufen besser für detaillierte Choreografien und handlastige Szenen geeignet. Professional kostet je nach Version pro Sekunde 33–60 % mehr: 33 % bei 3.0 und 60 % bei 2.6.

Ist Kling Motion Control per API oder mit ComfyUI verfügbar?

Ja. Der ComfyUI-Partner-Node stellt alle Motion-Control-Parameter in einem Workflow bereit. Drittanbieter bieten zudem programmatischen API-Zugang an. Mindestens ein Reddit-Nutzer empfand die API für Batch-Jobs als günstiger, doch dabei handelt es sich um eine einzelne persönliche Einschätzung und keinen bestätigten Preisvergleich.

Wie lang darf ein Motion-Control-Clip sein?

Quellvideos dürfen 3–30 Sekunden lang sein; der Output soll diese Länge grundsätzlich übernehmen. Im Bildausrichtungsmodus begrenzt die ComfyUI-Dokumentation die maximale Länge auf 10 Sekunden. Die kürzeste extrahierbare zusammenhängende Bewegung beträgt 3 Sekunden. Findet das Modell keine 3 Sekunden gültige Bewegung, schlägt die Generierung fehl.

Welche Version passt zu deinem Einsatz?

SzenarioVersionModusZugang
Schneller Test oder Social-Meme2.6StandardWeb-Playground
Kurze frontale Aktion mit Identitätserhalt3.0StandardWeb-Playground
Entwurf für Ganzkörpertanz oder Choreografie2.6ProfessionalPlayground oder API
Finales Rendering mit Gesichtskonsistenz aus mehreren Winkeln3.0ProfessionalAPI (Kostenvorteile bei Batches)
Batch-Generierung (10+ Varianten)3.0StandardAPI
Kinematischer Orbit oder Handheld-Energie3.0Standard + Curve Dolly / Camera ShakeWeb-Playground

Nimm 2.6 für körperbetonte Bewegungen, günstige Entwürfe und einfache frontale Aktionen. 3.0 ist die bessere Wahl, wenn Gesichtskonsistenz, Ausdrücke, Wiederherstellung bei Verdeckungen oder die exklusiven 3.0-Kamerasteuerungen Curve Dolly, Camera Shake und Multi-Elements wichtig sind. Die Qualität der Referenz entscheidet stärker über das Ergebnis als Prompt-Know-how: Verwende stabiles, durchgehendes Material mit einer gut sichtbaren Person und moderatem Bewegungstempo.