Animer une image fixe à partir de la performance d’une personne filmée : c’est précisément le rôle de Kling Motion Control. L’outil transfère les mouvements d’une vidéo courte vers un personnage, avec une limite d’un sujet et d’une performance de 30 secondes maximum. Deux versions sont proposées : Kling VIDEO 2.6, centrée sur les mouvements du corps et facturée 5 à 8 crédits par seconde, et Kling VIDEO 3.0, davantage axée sur la conservation de l’identité faciale, à 9 à 12 crédits par seconde. Le guide officiel de Kling rappelle que le résultat dépend avant tout des fichiers fournis ; une expérience publiée sur LinkedIn identifie d’ailleurs l’alignement géométrique entre l’image et la vidéo de mouvement comme le principal facteur de qualité.
Le principe de Kling Motion Control
Le modèle analyse une vidéo de mouvement, puis reporte ces données sur une image de référence afin que le personnage de l’image reproduise l’action filmée. D’après le guide utilisateur officiel de Kling, le système ne gère qu’un seul personnage. Si la vidéo de mouvement ou la première image contient plusieurs personnes, Kling retient automatiquement celle qui occupe la plus grande surface à l’écran.
Les deux entrées doivent montrer un plan unique et continu : pas de coupe, pas de changement de plan et aussi peu de mouvements de caméra que possible. Kling recommande des gestes amples, d’une vitesse modérée et avec peu de déplacements. Une action trop rapide ou complexe peut amener le modèle à n’extraire qu’un segment continu exploitable : la vidéo générée sera alors plus courte que le fichier envoyé, et les crédits consommés ne sont explicitement pas remboursables.
Contraintes pour les fichiers source
| Paramètre | Limite |
|---|---|
| Durée de la vidéo de mouvement | 3 à 30 secondes |
| Mouvement continu minimal extrait | 3 secondes |
| Résolution de l’image (petit côté) | Au moins 340 px |
| Résolution de l’image (grand côté) | Au plus 3 850 px |
| Taille du fichier image | 10 Mo max. |
| Taille du fichier vidéo | 100 Mo max. |
| Formats image pris en charge | JPG, PNG, WEBP, GIF, AVIF |
| Formats vidéo pris en charge | MP4, MOV, WEBM, M4V, GIF |
| Nombre de personnages | Un seul (le sujet principal est sélectionné automatiquement) |
La documentation ComfyUI impose un minimum plus strict de 720 px à la fois en largeur et en hauteur. Elle recommande aussi une image où la tête, les épaules et le torse du personnage sont entièrement visibles.
Les modes d’orientation
Kling propose deux comportements d’orientation, qui déterminent la manière dont le personnage est cadré dans le rendu :
| Mode | Le mouvement suit | L’orientation suit | Mouvement de caméra |
|---|---|---|---|
| Character Orientation Matches Video | La vidéo de référence | La vidéo de référence | La vidéo de référence |
| Character Orientation Matches Image | La vidéo de référence | L’image de référence | Contrôlé par les prompts |
En mode orientation de l’image, les prompts peuvent déclencher cinq traitements de caméra : Zoom In, Zoom Out, Camera Up, Camera Down et Fixed Position. La documentation ComfyUI limite ce mode à 10 secondes, contre 30 secondes pour le mode orientation de la vidéo.
Kling 3.0 ou 2.6 : fonctions, définition et prix
Kling positionne clairement les deux versions sur des usages différents. 2.6 sert de base pour le mouvement corporel : synchronisation du corps entier, actions sportives complexes, articulation des mains, plans-séquences de 30 secondes et contrôle de la scène par prompt texte. 3.0 ajoute des améliorations liées à l’identité faciale grâce à une fonction baptisée Element Binding.
Element Binding permet d’associer au personnage plusieurs images de référence du visage, ou une courte vidéo faciale. Le modèle les exploite pour conserver une identité cohérente lors des rotations, changements d’expression et occultations. L’Element Library ne mémorise que les informations faciales : elle n’encode ni les vêtements, ni la coiffure, le maquillage ou les accessoires. Element Binding fonctionne uniquement lorsque l’orientation du personnage correspond à celle de la vidéo.
Comparatif des versions
| Fonction | Kling 3.0 | Kling 2.6 |
|---|---|---|
| Atout principal | Identité faciale préservée selon les angles et les émotions | Transfert des mouvements du corps entier |
| Element Binding | Oui (références faciales multi-angles) | Non |
| Récupération après occultation | Oui (haute fidélité annoncée) | Non |
| Traitements de caméra | Multi-Elements, Curve Dolly, Camera Shake | Zoom In/Out, Camera Up/Down, Fixed |
| Résolution (Standard) | 720p | 720p |
| Résolution (Professional) | 1080p | 1080p |
| Plage de durée de la vidéo source | 3 à 30 secondes (guide officiel) | 3 à 30 secondes (guide officiel) |
Tarification
La facturation dépend de la durée générée, arrondie à la seconde entière la plus proche, selon le guide officiel.
| Modèle | Mode | Tarif |
|---|---|---|
| Kling VIDEO 3.0 Motion Control | Standard | 9 crédits/seconde |
| Kling VIDEO 3.0 Motion Control | Professional | 12 crédits/seconde |
| Kling VIDEO 2.6 Motion Control | Standard | 5 crédits/seconde |
| Kling VIDEO 2.6 Motion Control | Professional | 8 crédits/seconde |
Un clip de 3,4 secondes est arrondi à 3 secondes, soit 27 crédits en 3.0 Standard. À 3,6 secondes, il est arrondi à 4 secondes, pour 36 crédits. Pour le détail des formules d’abonnement et des tarifs d’achat de crédits, consultez notre guide des tarifs de l’API Kling 3.
Créer une vidéo avec Motion Control, étape par étape
- Importez la vidéo de mouvement. Choisissez un fichier local ou un clip de la Motion Library intégrée à Kling. Il doit s’agir d’un plan continu avec une seule personne, d’une durée comprise entre 3 et 30 secondes.
- Ajoutez l’image du personnage. Importez l’image fixe du personnage à animer. Faites correspondre le cadrage : une image en pied pour un mouvement en pied, un plan poitrine ou mi-corps pour un mouvement équivalent. Les membres doivent être visibles et le sujet doit disposer d’espace autour de lui.
- Liez un élément facial, avec 3.0 uniquement. Activez « Bind Facial Element to Enhance Facial Consistency », puis sélectionnez un élément existant ou créez-en un en important des images du visage ou une courte vidéo.
- Choisissez le mode d’orientation. Sélectionnez « Character Orientation Matches Video » pour une chorégraphie en pied, ou « Character Orientation Matches Image » pour animer un portrait avec des mouvements de caméra définis par prompt.
- Rédigez un prompt de scène, si nécessaire. En mode orientation de l’image, le prompt permet de piloter les détails de l’arrière-plan et le traitement de caméra.
- Générez, puis itérez. Modifiez une variable à la fois : vidéo de référence, image du personnage ou données de liaison. Changer les trois simultanément empêche d’identifier l’entrée responsable d’un défaut.
Element Binding : combien de vues du visage prévoir ?
Pour exploiter correctement Element Binding dans 3.0, le guide officiel recommande d’adapter les références faciales au résultat attendu :
- Rotations de tête précises : une vue de face, complétée par une vue de profil gauche et/ou droit.
- Expressions fidèles : une image neutre de face et une image de face avec l’expression cible, par exemple un sourire.
- Rotation à 360° fluide avec un sourire : cinq références — face, profil gauche, profil droit, vue du dessus et vue du dessous — toutes souriantes.
- Changements émotionnels complexes avec mouvement de tête : une image de face, une image souriante, une image triste et des vues de profil.
Pour disposer des données faciales les plus riches, Kling recommande d’importer une courte vidéo plutôt que des images fixes : une séquence continue enregistre davantage d’informations sur les transitions d’expression que des photos isolées.
Utiliser Kling Motion Control via une API
Le playground web de Kling facture à la seconde, ce qui peut vite peser dans un workflow intensif. Sur r/klingO1, un utilisateur ayant testé 3.0 Motion Control a observé que les mouvements commençaient enfin à paraître « lourds » et que les pieds semblaient mieux ancrés au sol, une amélioration par rapport à la tendance de 2.6 à donner une impression de glissement (source). Le même utilisateur estime que l’API Kling 3.0 Motion Control, proposée par des fournisseurs tiers, lui semblait « sensiblement moins chère » pour la production en volume que les crédits du playground. Il s’agit toutefois d’un avis personnel isolé, et non d’une comparaison tarifaire chiffrée.
L’accès programmatique se fait de deux manières : via l’intégration ComfyUI pour les workflows visuels, ou par appels API directs pour les pipelines par lots.
Intégration ComfyUI
La documentation ComfyUI propose un node partenaire officiel qui expose tous les paramètres de Motion Control dans le workflow :
- Node LoadImage : image de référence du personnage (JPG, PNG, WEBP, GIF, AVIF ; 10 Mo max.)
- Node LoadVideo : vidéo de référence des mouvements (MP4, MOV, WEBM, M4V, GIF ; 100 Mo max.)
- character_orientation :
videoouimage - Texte du prompt : contrôle de la scène et de l’arrière-plan
- Niveau de modèle : Standard (720p) ou Pro (1080p)
Une annonce Reddit sur r/comfyui confirme que le pack de nodes ComfyUI-Kie-API ajoute une prise en charge expérimentale de Kling 3.0 Motion Control, avec accès à l’image de référence, à la vidéo pilote, au prompt et aux réglages d’orientation.
Accès API direct
Hors de ComfyUI, il est possible d’appeler Kling Motion Control via des fournisseurs d’API exposant le modèle sous-jacent. La requête inclut essentiellement l’identifiant de version du modèle, l’image du personnage encodée en base64 ou sous forme d’URL, la vidéo de référence des mouvements, le paramètre d’orientation et, en option, un prompt de scène. La génération est asynchrone : vous soumettez la tâche, interrogez son avancement, puis récupérez l’URL de la vidéo.
Pour un endpoint prêt à l’emploi avec Kling 3.0 Motion Control, essayez la page du modèle Kling Motion Control, qui fournit la documentation API et les tarifs en direct.
Calculer le coût en crédits d’une génération
| Scénario | Durée | Modèle / mode | Coût |
|---|---|---|---|
| Test de brouillon rapide | 5 s | 2.6 Standard | 25 crédits |
| Rendu final avec cohérence faciale | 5 s | 3.0 Professional | 60 crédits |
| Plan-séquence de 30 secondes | 30 s | 2.6 Standard | 150 crédits |
| Lot de 10 clips de 5 secondes | 50 s au total | 3.0 Standard | 450 crédits |
L’écart de coût se creuse avec le volume. Dix clips de 5 secondes en 3.0 Professional coûtent 600 crédits, contre 250 crédits en 2.6 Standard pour les mêmes 50 secondes de sortie. Commencez en 2.6 Standard pour les brouillons, et réservez 3.0 Professional aux rendus finaux où l’identité faciale compte réellement.
Attention : crédits non remboursables. Si une vidéo de référence comporte des mouvements rapides ou complexes et que le modèle n’en extrait qu’un segment valide plus court, la durée générée vous est facturée malgré tout. Kling précise explicitement que les crédits ne sont pas remboursables dans ce cas.
Pour connaître les montants de crédits offerts par le niveau gratuit, qui peuvent réduire le coût des essais, consultez notre guide de l’offre gratuite Kling AI.
Problèmes fréquents : causes et correctifs
| Symptôme | Cause | Correctif | Source |
|---|---|---|---|
| Le visage dérive ou se transforme pendant le mouvement | Element Binding n’a pas été utilisé, ou une seule vue a été fournie | Créez une nouvelle liaison avec une vue de face et des profils gauche/droit ; ajoutez des images de l’expression cible | Guide officiel |
| La sortie est plus courte que la référence | Action trop rapide ou trop complexe pour extraire un mouvement continu | Utilisez un clip plus lent ; placez le mouvement clé dans une fenêtre de 3 à 10 secondes | Guide officiel |
| Les membres sont flous ou emmêlés | Parties du corps recadrées ou masquées dans l’image du personnage | Choisissez une image montrant le corps entier, avec des membres distincts et visibles | Guide officiel |
| Anneaux ou artefacts sur les mains | Disparition des prompts négatifs | Simplifiez les positions des mains dans la référence ; évitez les poses formant un anneau | |
| Les personnes à l’arrière-plan restent figées | Le modèle n’anime que le personnage principal | Gardez une référence avec une seule personne | |
| L’identité paraît incorrecte ou déformée | Image du personnage faible ou mal adaptée | Utilisez une image plus nette, bien éclairée et de face ; adaptez le cadrage au type de mouvement | |
| Le mouvement donne l’impression de « glisser sur la glace » | Appuis instables dans la vidéo de référence (2.6) | Stabilisez la référence ; 3.0 ancrerait mieux les pieds selon les retours | |
| Les dessins animés 2D plats gèrent mal les vues de dos | Les proportions stylisées sont plus difficiles à suivre | Préférez des personnages réalistes ou de style 3D pour les rotations | Documentation ComfyUI |
Une expérience LinkedIn menée par César Augusto Cabrera Boggio conclut que les angles de caméra, la direction et la géométrie de l’image d’entrée et de la vidéo pilote doivent être étroitement alignés pour obtenir un suivi fiable. Les écarts entre ces éléments constituent la principale cause des visages déformés et des mouvements saccadés.
FAQ
Puis-je utiliser Kling Motion Control avec plusieurs personnages ?
Non. La fonction prend en charge un seul personnage par génération. Si votre vidéo de référence ou sa première image contient plusieurs personnes, Kling sélectionne automatiquement celle qui occupe la plus grande partie du cadre. Pour une scène à plusieurs personnages, générez chaque clip séparément puis composez-les en postproduction.
Puis-je conserver l’audio original de la vidéo de référence ?
Le guide officiel de Kling ne mentionne pas la conservation de l’audio parmi les fonctions prises en charge. La vidéo générée est un nouveau rendu fondé sur l’image du personnage et les données de mouvement extraites. Prévoyez donc de synchroniser l’audio en postproduction.
Quelle différence entre les modes Standard et Professional ?
Le mode Standard produit en 720p, consomme moins de crédits et convient aux animations simples comme aux essais rapides. Le mode Professional sort en 1080p pour un coût supérieur à la seconde ; il est mieux adapté aux chorégraphies détaillées et aux séquences très axées sur les mains, selon les descriptions des niveaux dans ComfyUI. Professional coûte 33 à 60 % de plus par seconde selon la version : 33 % pour 3.0 et 60 % pour 2.6.
Puis-je accéder à Kling Motion Control via une API ou ComfyUI ?
Oui. Le node partenaire ComfyUI expose tous les paramètres de Motion Control dans un workflow. Des fournisseurs d’API tiers proposent également un accès programmatique. Au moins un utilisateur Reddit a indiqué que l’API lui semblait moins chère pour le travail en lots, mais il s’agit d’une appréciation personnelle isolée, pas d’une comparaison tarifaire vérifiée.
Quelle peut être la durée d’un clip Motion Control ?
Les vidéos source peuvent durer de 3 à 30 secondes, et la sortie est conçue pour correspondre à cette durée. En mode orientation de l’image, la documentation ComfyUI fixe une limite de 10 secondes. Le mouvement continu minimal extractible est de 3 secondes : si le modèle ne trouve pas 3 secondes de mouvement valide, la génération échoue.
Quelle version choisir ?
| Scénario | Version | Mode | Accès |
|---|---|---|---|
| Test rapide ou mème pour les réseaux sociaux | 2.6 | Standard | Playground web |
| Action courte de face avec préservation de l’identité | 3.0 | Standard | Playground web |
| Brouillon de danse ou chorégraphie en pied | 2.6 | Professional | Playground ou API |
| Rendu final avec cohérence faciale multi-angle | 3.0 | Professional | API (économies en production par lots) |
| Génération en lots, 10 variantes ou plus | 3.0 | Standard | API |
| Travelling circulaire cinématographique ou énergie caméra portée | 3.0 | Standard + Curve Dolly / Camera Shake | Playground web |
Choisissez 2.6 pour les mouvements dominés par le corps, les brouillons à moindre coût et les actions simples de face. Préférez 3.0 lorsque l’identité faciale, les expressions, la récupération après occultation ou les contrôles de caméra exclusifs à 3.0 — Curve Dolly, Camera Shake et Multi-Elements — sont importants. La qualité des références influence davantage le résultat que votre maîtrise des prompts : privilégiez une séquence stable, continue, au rythme modéré, avec un seul sujet bien visible.