Con Kling Motion Control basta un breve filmato di una persona in movimento e un'immagine statica del personaggio da animare: il sistema trasferisce quella performance a un singolo soggetto, per clip fino a 30 secondi. La funzione è disponibile in due versioni: Kling VIDEO 2.6, orientata al movimento del corpo e con un costo di 5–8 crediti al secondo, e Kling VIDEO 3.0, pensata soprattutto per preservare l'identità facciale, a 9–12 crediti al secondo. La guida ufficiale di Kling sottolinea che il risultato dipende molto dagli input; inoltre, un test pubblicato su LinkedIn indica nell'allineamento geometrico tra immagine e video guida il fattore che incide più di ogni altro sulla qualità finale.
Il meccanismo di Kling Motion Control
Il modello ricava i dati del movimento da un motion video e li applica a una reference image, generando un video in cui il personaggio dell'immagine esegue l'azione del filmato. Stando alla guida ufficiale di Kling, è supportato un solo personaggio: se il video di movimento o il primo fotogramma mostrano più persone, Kling sceglie automaticamente quella che occupa l'area maggiore sullo schermo.
Entrambi gli input devono essere costituiti da un'unica ripresa continua, senza stacchi, cambi di inquadratura e con movimenti di camera ridotti al minimo. Kling consiglia movimenti ampi, a velocità moderata e con spostamenti limitati. Azioni troppo rapide o complesse possono portare il modello a estrarre soltanto un segmento continuo valido: il video generato risulterà quindi più corto dell'upload e i crediti utilizzati non sono rimborsabili.
Requisiti per immagini e video
| Parametro | Limite |
|---|---|
| Durata del motion video | 3–30 secondi |
| Movimento continuo minimo estratto | 3 secondi |
| Risoluzione dell'immagine (lato corto) | Almeno 340 px |
| Risoluzione dell'immagine (lato lungo) | Massimo 3.850 px |
| Dimensione file immagine | Massimo 10 MB |
| Dimensione file video | Massimo 100 MB |
| Formati immagine supportati | JPG, PNG, WEBP, GIF, AVIF |
| Formati video supportati | MP4, MOV, WEBM, M4V, GIF |
| Numero di personaggi | Uno (selezionato automaticamente il soggetto più grande) |
La documentazione ComfyUI impone un minimo più severo, pari a 720 px sia in larghezza sia in altezza, e raccomanda un'immagine del personaggio con testa, spalle e busto interamente visibili.
Modalità di orientamento
Kling propone due comportamenti di orientamento, che stabiliscono come viene inquadrato il personaggio nel risultato:
| Modalità | Il movimento segue | L'orientamento segue | Movimento di camera |
|---|---|---|---|
| Character Orientation Matches Video | Video di riferimento | Video di riferimento | Video di riferimento |
| Character Orientation Matches Image | Video di riferimento | Immagine di riferimento | Controllato tramite prompt |
Nella modalità con orientamento dell'immagine, i prompt possono attivare cinque movimenti di camera: Zoom In, Zoom Out, Camera Up, Camera Down e Fixed Position. La documentazione ComfyUI fissa inoltre un massimo più breve di 10 secondi per questa modalità, contro i 30 secondi della modalità con orientamento del video.
Kling 3.0 e 2.6 a confronto: funzioni, prezzi e risoluzione
Kling presenta le due versioni come strumenti con priorità differenti. 2.6 è il riferimento per il body motion: sincronizzazione dell'intero corpo, azioni atletiche complesse, articolazione delle mani, riprese singole fino a 30 secondi e controllo della scena tramite prompt testuale. 3.0 aggiunge miglioramenti per l'identità facciale con una funzione chiamata Element Binding.
Element Binding permette di associare al personaggio un set di immagini di riferimento del viso oppure un breve video facciale, così da mantenere più coerente l'identità durante rotazioni, cambi di espressione e occlusioni. La Element Library conserva solo informazioni facciali: non memorizza abiti, acconciatura, trucco o oggetti di scena. Element Binding funziona esclusivamente quando l'orientamento del personaggio corrisponde a quello del video.
Confronto tra le versioni
| Funzione | Kling 3.0 | Kling 2.6 |
|---|---|---|
| Punto di forza principale | იდენტità facciale tra angolazioni ed emozioni | Trasferimento del movimento dell'intero corpo |
| Element Binding | Sì (riferimenti facciali da più angolazioni) | No |
| Recupero dopo occlusioni | Sì (alta fedeltà dichiarata) | No |
| Movimenti di camera | Multi-Elements, Curve Dolly, Camera Shake | Zoom In/Out, Camera Up/Down, Fixed |
| Risoluzione (Standard) | 720p | 720p |
| Risoluzione (Professional) | 1080p | 1080p |
| Intervallo di durata del video sorgente | 3–30 secondi (guida ufficiale) | 3–30 secondi (guida ufficiale) |
Prezzi
Il prezzo viene calcolato sulla durata generata in secondi, arrotondata al secondo intero più vicino, come indicato nella guida ufficiale.
| Modello | Modalità | Tariffa |
|---|---|---|
| Kling VIDEO 3.0 Motion Control | Standard | 9 crediti/secondo |
| Kling VIDEO 3.0 Motion Control | Professional | 12 crediti/secondo |
| Kling VIDEO 2.6 Motion Control | Standard | 5 crediti/secondo |
| Kling VIDEO 2.6 Motion Control | Professional | 8 crediti/secondo |
Una clip di 3,4 secondi viene arrotondata per difetto a 3 secondi, ovvero 27 crediti con 3.0 Standard. Una clip di 3,6 secondi viene invece arrotondata a 4 secondi, per 36 crediti. Per i prezzi dettagliati dei piani in abbonamento e delle ricariche di crediti, consulta la nostra guida ai prezzi dell'API Kling 3.
Come generare un video con Motion Control
- Carica il video guida. Seleziona una clip dai file locali oppure dalla Motion Library integrata di Kling. Deve essere una ripresa continua di una sola persona, lunga 3–30 secondi.
- Aggiungi l'immagine del personaggio. Carica l'immagine statica del soggetto da animare. L'inquadratura deve corrispondere: corpo intero per il movimento a corpo intero, mezzo busto per un movimento di mezzo busto. Arti visibili e spazio libero attorno al soggetto aiutano il modello.
- Collega un elemento facciale, solo con 3.0. Attiva "Bind Facial Element to Enhance Facial Consistency", quindi seleziona un elemento esistente oppure creane uno caricando immagini del viso o un breve video.
- Scegli la modalità di orientamento. Usa "Character Orientation Matches Video" per coreografie a corpo intero oppure "Character Orientation Matches Image" per animare un ritratto con movimenti di camera definiti dal prompt.
- Scrivi un prompt per la scena, se serve. Nella modalità con orientamento dell'immagine, il prompt controlla i dettagli dello sfondo e il trattamento della camera.
- Genera e procedi per iterazioni. Modifica una sola variabile per volta: video di riferimento, immagine del personaggio o dati di binding. Cambiarle tutte insieme rende impossibile capire quale input ha prodotto un difetto.
Element Binding: quante angolazioni preparare
Per ottenere buoni risultati con Element Binding in 3.0, la guida ufficiale raccomanda di preparare riferimenti facciali coerenti con il tipo di output desiderato:
- Rotazioni della testa accurate: una vista frontale più viste laterali a sinistra e/o destra.
- Espressioni accurate: un'immagine frontale neutra e una frontale con l'espressione da ottenere, ad esempio un sorriso.
- Rotazione a 360° fluida con sorriso: cinque riferimenti: fronte, profilo sinistro, profilo destro, dall'alto e dal basso, tutti sorridenti.
- Cambi emotivi complessi con movimento della testa: immagine frontale, immagine sorridente, immagine triste e viste laterali.
Per fornire al modello i dati facciali più ricchi possibile, Kling consiglia di caricare un breve video invece di immagini statiche: una ripresa continua contiene più informazioni sulle transizioni espressive rispetto a foto separate.
Usare Kling Motion Control via API
Nel playground web di Kling, i crediti vengono scalati al secondo e il costo può salire rapidamente. Su r/klingO1 di Reddit, un utente che ha testato 3.0 Motion Control ha osservato che il movimento "finally starting to feel 'heavy'" e che i piedi sembrano ancorati al pavimento, un miglioramento rispetto alla tendenza di 2.6 a dare un effetto di scivolamento (fonte). Lo stesso utente ha riferito che, per lavorazioni ad alto volume, la Kling 3.0 Motion Control API tramite fornitori terzi gli è sembrata "noticeably cheaper" rispetto al consumo di crediti nel playground. Si tratta però di una valutazione personale singola, non di un confronto di prezzo quantificato.
L'accesso programmatico segue due strade: l'integrazione ComfyUI per workflow visuali e le chiamate API dirette per pipeline batch.
Integrazione con ComfyUI
La documentazione ComfyUI include un node partner ufficiale che espone tutti i parametri di Motion Control come input del workflow:
- Node LoadImage: immagine di riferimento del personaggio (JPG, PNG, WEBP, GIF, AVIF; massimo 10 MB)
- Node LoadVideo: video di riferimento del movimento (MP4, MOV, WEBM, M4V, GIF; massimo 100 MB)
- character_orientation:
videooppureimage - Testo del prompt: controllo della scena e dello sfondo
- Tier del modello: Standard (720p) oppure Pro (1080p)
Un annuncio su r/comfyui di Reddit conferma che il node pack ComfyUI-Kie-API aggiunge supporto sperimentale per Kling 3.0 Motion Control, con impostazioni per immagine di riferimento, driving video, prompt e orientamento.
Accesso API diretto
Per l'accesso programmatico al di fuori di ComfyUI, puoi richiamare Kling Motion Control tramite provider API che espongono il modello sottostante. La richiesta essenziale include l'identificatore della versione del modello, l'immagine del personaggio in base64 o codificata come URL, il video di riferimento del movimento, il parametro di orientamento e un prompt facoltativo per la scena. La generazione è asincrona: invii il job, ne controlli il completamento e poi recuperi l'URL del video.
Per un endpoint pronto all'uso con Kling 3.0 Motion Control, prova la pagina del modello Kling Motion Control, che include documentazione API e prezzi aggiornati in tempo reale.
Quanto costa una generazione: calcolo dei crediti
| Scenario | Durata | Modello / Modalità | Costo |
|---|---|---|---|
| Test rapido in bozza | 5s | 2.6 Standard | 25 crediti |
| Render finale con coerenza facciale | 5s | 3.0 Professional | 60 crediti |
| Ripresa singola da 30 secondi | 30s | 2.6 Standard | 150 crediti |
| Batch di 10 clip, 5s ciascuna | 50s totali | 3.0 Standard | 450 crediti |
Con l'aumentare del volume, la differenza di costo diventa marcata. Dieci clip da cinque secondi in 3.0 Professional costano 600 crediti, contro i 250 crediti di 2.6 Standard per gli stessi 50 secondi di output. Per le bozze conviene iniziare con 2.6 Standard e riservare 3.0 Professional ai render finali in cui l'identità facciale è importante.
Attenzione: crediti non rimborsabili. Se il video di riferimento contiene movimenti rapidi o complessi e il modello riesce a estrarre soltanto un segmento valido più breve, verrà comunque addebitata la durata generata. Kling dichiara esplicitamente che in questo caso i crediti non sono rimborsabili.
Per conoscere la quantità di crediti del piano gratuito, utile per ridurre il costo dei test, consulta la nostra guida al piano gratuito di Kling AI.
Problemi frequenti e soluzioni pratiche
| Sintomo | Causa | Soluzione | Fonte |
|---|---|---|---|
| Il viso cambia o si deforma durante il movimento | Element Binding non usato oppure un'unica angolazione disponibile | Ripeti il binding con vista frontale e laterali sinistra/destra; aggiungi immagini con l'espressione desiderata | Guida ufficiale |
| L'output è più corto del riferimento | Azione troppo veloce o complessa per estrarre un movimento continuo | Usa una clip più lenta; colloca il movimento chiave in una finestra di 3–10 secondi | Guida ufficiale |
| Gli arti risultano sfocati o intrecciati | Parti del corpo tagliate o nascoste nell'immagine del personaggio | Scegli un'immagine con il corpo intero e arti separati e ben visibili | Guida ufficiale |
| Anelli o artefatti sulle mani | Assenza dei negative prompt | Semplifica le posizioni delle mani nel riferimento; evita pose simili a un anello | |
| Le persone sullo sfondo restano immobili | Il modello anima soltanto il personaggio principale | Usa un riferimento con una sola persona in scena | |
| L'identità è errata o distorta | Immagine del personaggio debole o non coerente | Usa un'immagine più nitida, ben illuminata e frontale; fai corrispondere l'inquadratura al tipo di movimento | |
| Il movimento sembra "scivolare sul ghiaccio" | Appoggio instabile nel video di riferimento (2.6) | Stabilizza il riferimento; secondo alcune segnalazioni 3.0 ancora meglio i piedi | |
| I cartoni 2D piatti faticano con le viste posteriori | Le proporzioni stilizzate sono più difficili da tracciare | Per le rotazioni, usa personaggi realistici o in stile 3D | Documentazione ComfyUI |
Un esperimento LinkedIn di César Augusto Cabrera Boggio ha rilevato che angoli di camera, direzione e geometria dell'immagine di input e del driving video devono essere strettamente allineati per un tracking affidabile. Le discrepanze sono la causa principale di visi deformati e movimenti tremolanti.
FAQ
Posso usare Kling Motion Control con più personaggi?
No. La funzione supporta un solo personaggio per generazione. Se il video di riferimento o il primo fotogramma contiene più persone, Kling seleziona automaticamente quella che occupa la porzione maggiore dell'inquadratura. Per una scena con più personaggi, genera ogni clip separatamente e componile in post-produzione.
Posso mantenere l'audio originale del video di riferimento?
La guida ufficiale di Kling non indica la conservazione dell'audio tra le funzioni supportate. Il video generato è un nuovo render basato sull'immagine del personaggio e sui dati di movimento estratti. Prevedi quindi la sincronizzazione dell'audio in post-produzione.
Che differenza c'è tra Standard e Professional?
La modalità Standard produce video a 720p, usa i crediti in modo più efficiente ed è adatta alle animazioni semplici e ai test rapidi. Professional genera a 1080p, con un costo maggiore al secondo, ed è più indicata per coreografie dettagliate e lavori con molte mani in scena, secondo le descrizioni dei tier di ComfyUI. Professional costa dal 33% al 60% in più al secondo, a seconda della versione: 33% per 3.0 e 60% per 2.6.
Posso accedere a Kling Motion Control tramite API o ComfyUI?
Sì. Il partner node di ComfyUI espone tutti i parametri di Motion Control all'interno di un workflow. Esistono inoltre provider API terzi per l'accesso programmatico; almeno un utente Reddit ha riferito che l'API gli è sembrata meno costosa per il lavoro batch, ma è una sola valutazione personale e non un confronto verificato dei prezzi.
Quanto può durare una clip Motion Control?
I video sorgente possono durare 3–30 secondi e l'output è pensato per eguagliarne la durata. Nella modalità con orientamento dell'immagine, la documentazione ComfyUI limita la durata massima a 10 secondi. Il movimento continuo minimo estraibile è di 3 secondi: se il modello non riesce a individuarne almeno 3 validi, la generazione fallisce.
Quale versione scegliere?
| Scenario | Versione | Modalità | Accesso |
|---|---|---|---|
| Test rapido o meme per i social | 2.6 | Standard | Web playground |
| Azione breve e frontale con preservazione dell'identità | 3.0 | Standard | Web playground |
| Bozza di danza o coreografia a corpo intero | 2.6 | Professional | Playground o API |
| Render finale con coerenza facciale da più angolazioni | 3.0 | Professional | API (risparmio sui costi batch) |
| Generazione batch, 10+ varianti | 3.0 | Standard | API |
| Orbite cinematografiche o energia da camera a mano | 3.0 | Standard + Curve Dolly / Camera Shake | Web playground |
Scegli 2.6 per movimenti centrati sul corpo, bozze meno costose e azioni frontali semplici. Passa a 3.0 quando sono importanti identità facciale, espressioni, recupero dalle occlusioni o i controlli di camera esclusivi di 3.0, come Curve Dolly, Camera Shake e Multi-Elements. La qualità del riferimento incide sul risultato più dell'abilità nello scrivere prompt: servono riprese stabili, continue, a velocità moderata, con un solo soggetto ben visibile.