AIREITER

Kling Motion Control: API, prezzi e workflow (2026)

Ultimo Aggiornamento: 2026-08-13 01:23:40

Guida utente ufficiale di Kling Motion Control con prezzi e dettagli sulle versioni

Con Kling Motion Control basta un breve filmato di una persona in movimento e un'immagine statica del personaggio da animare: il sistema trasferisce quella performance a un singolo soggetto, per clip fino a 30 secondi. La funzione è disponibile in due versioni: Kling VIDEO 2.6, orientata al movimento del corpo e con un costo di 5–8 crediti al secondo, e Kling VIDEO 3.0, pensata soprattutto per preservare l'identità facciale, a 9–12 crediti al secondo. La guida ufficiale di Kling sottolinea che il risultato dipende molto dagli input; inoltre, un test pubblicato su LinkedIn indica nell'allineamento geometrico tra immagine e video guida il fattore che incide più di ogni altro sulla qualità finale.

Il meccanismo di Kling Motion Control

Il modello ricava i dati del movimento da un motion video e li applica a una reference image, generando un video in cui il personaggio dell'immagine esegue l'azione del filmato. Stando alla guida ufficiale di Kling, è supportato un solo personaggio: se il video di movimento o il primo fotogramma mostrano più persone, Kling sceglie automaticamente quella che occupa l'area maggiore sullo schermo.

Entrambi gli input devono essere costituiti da un'unica ripresa continua, senza stacchi, cambi di inquadratura e con movimenti di camera ridotti al minimo. Kling consiglia movimenti ampi, a velocità moderata e con spostamenti limitati. Azioni troppo rapide o complesse possono portare il modello a estrarre soltanto un segmento continuo valido: il video generato risulterà quindi più corto dell'upload e i crediti utilizzati non sono rimborsabili.

Requisiti per immagini e video

ParametroLimite
Durata del motion video3–30 secondi
Movimento continuo minimo estratto3 secondi
Risoluzione dell'immagine (lato corto)Almeno 340 px
Risoluzione dell'immagine (lato lungo)Massimo 3.850 px
Dimensione file immagineMassimo 10 MB
Dimensione file videoMassimo 100 MB
Formati immagine supportatiJPG, PNG, WEBP, GIF, AVIF
Formati video supportatiMP4, MOV, WEBM, M4V, GIF
Numero di personaggiUno (selezionato automaticamente il soggetto più grande)

La documentazione ComfyUI impone un minimo più severo, pari a 720 px sia in larghezza sia in altezza, e raccomanda un'immagine del personaggio con testa, spalle e busto interamente visibili.

Modalità di orientamento

Kling propone due comportamenti di orientamento, che stabiliscono come viene inquadrato il personaggio nel risultato:

ModalitàIl movimento segueL'orientamento segueMovimento di camera
Character Orientation Matches VideoVideo di riferimentoVideo di riferimentoVideo di riferimento
Character Orientation Matches ImageVideo di riferimentoImmagine di riferimentoControllato tramite prompt

Nella modalità con orientamento dell'immagine, i prompt possono attivare cinque movimenti di camera: Zoom In, Zoom Out, Camera Up, Camera Down e Fixed Position. La documentazione ComfyUI fissa inoltre un massimo più breve di 10 secondi per questa modalità, contro i 30 secondi della modalità con orientamento del video.

Kling 3.0 e 2.6 a confronto: funzioni, prezzi e risoluzione

Kling presenta le due versioni come strumenti con priorità differenti. 2.6 è il riferimento per il body motion: sincronizzazione dell'intero corpo, azioni atletiche complesse, articolazione delle mani, riprese singole fino a 30 secondi e controllo della scena tramite prompt testuale. 3.0 aggiunge miglioramenti per l'identità facciale con una funzione chiamata Element Binding.

Element Binding permette di associare al personaggio un set di immagini di riferimento del viso oppure un breve video facciale, così da mantenere più coerente l'identità durante rotazioni, cambi di espressione e occlusioni. La Element Library conserva solo informazioni facciali: non memorizza abiti, acconciatura, trucco o oggetti di scena. Element Binding funziona esclusivamente quando l'orientamento del personaggio corrisponde a quello del video.

Confronto tra le versioni

FunzioneKling 3.0Kling 2.6
Punto di forza principaleიდენტità facciale tra angolazioni ed emozioniTrasferimento del movimento dell'intero corpo
Element BindingSì (riferimenti facciali da più angolazioni)No
Recupero dopo occlusioniSì (alta fedeltà dichiarata)No
Movimenti di cameraMulti-Elements, Curve Dolly, Camera ShakeZoom In/Out, Camera Up/Down, Fixed
Risoluzione (Standard)720p720p
Risoluzione (Professional)1080p1080p
Intervallo di durata del video sorgente3–30 secondi (guida ufficiale)3–30 secondi (guida ufficiale)

Prezzi

Il prezzo viene calcolato sulla durata generata in secondi, arrotondata al secondo intero più vicino, come indicato nella guida ufficiale.

ModelloModalitàTariffa
Kling VIDEO 3.0 Motion ControlStandard9 crediti/secondo
Kling VIDEO 3.0 Motion ControlProfessional12 crediti/secondo
Kling VIDEO 2.6 Motion ControlStandard5 crediti/secondo
Kling VIDEO 2.6 Motion ControlProfessional8 crediti/secondo

Una clip di 3,4 secondi viene arrotondata per difetto a 3 secondi, ovvero 27 crediti con 3.0 Standard. Una clip di 3,6 secondi viene invece arrotondata a 4 secondi, per 36 crediti. Per i prezzi dettagliati dei piani in abbonamento e delle ricariche di crediti, consulta la nostra guida ai prezzi dell'API Kling 3.

Come generare un video con Motion Control

  1. Carica il video guida. Seleziona una clip dai file locali oppure dalla Motion Library integrata di Kling. Deve essere una ripresa continua di una sola persona, lunga 3–30 secondi.
  2. Aggiungi l'immagine del personaggio. Carica l'immagine statica del soggetto da animare. L'inquadratura deve corrispondere: corpo intero per il movimento a corpo intero, mezzo busto per un movimento di mezzo busto. Arti visibili e spazio libero attorno al soggetto aiutano il modello.
  3. Collega un elemento facciale, solo con 3.0. Attiva "Bind Facial Element to Enhance Facial Consistency", quindi seleziona un elemento esistente oppure creane uno caricando immagini del viso o un breve video.
  4. Scegli la modalità di orientamento. Usa "Character Orientation Matches Video" per coreografie a corpo intero oppure "Character Orientation Matches Image" per animare un ritratto con movimenti di camera definiti dal prompt.
  5. Scrivi un prompt per la scena, se serve. Nella modalità con orientamento dell'immagine, il prompt controlla i dettagli dello sfondo e il trattamento della camera.
  6. Genera e procedi per iterazioni. Modifica una sola variabile per volta: video di riferimento, immagine del personaggio o dati di binding. Cambiarle tutte insieme rende impossibile capire quale input ha prodotto un difetto.

Element Binding: quante angolazioni preparare

Per ottenere buoni risultati con Element Binding in 3.0, la guida ufficiale raccomanda di preparare riferimenti facciali coerenti con il tipo di output desiderato:

  • Rotazioni della testa accurate: una vista frontale più viste laterali a sinistra e/o destra.
  • Espressioni accurate: un'immagine frontale neutra e una frontale con l'espressione da ottenere, ad esempio un sorriso.
  • Rotazione a 360° fluida con sorriso: cinque riferimenti: fronte, profilo sinistro, profilo destro, dall'alto e dal basso, tutti sorridenti.
  • Cambi emotivi complessi con movimento della testa: immagine frontale, immagine sorridente, immagine triste e viste laterali.

Per fornire al modello i dati facciali più ricchi possibile, Kling consiglia di caricare un breve video invece di immagini statiche: una ripresa continua contiene più informazioni sulle transizioni espressive rispetto a foto separate.

Usare Kling Motion Control via API

Nel playground web di Kling, i crediti vengono scalati al secondo e il costo può salire rapidamente. Su r/klingO1 di Reddit, un utente che ha testato 3.0 Motion Control ha osservato che il movimento "finally starting to feel 'heavy'" e che i piedi sembrano ancorati al pavimento, un miglioramento rispetto alla tendenza di 2.6 a dare un effetto di scivolamento (fonte). Lo stesso utente ha riferito che, per lavorazioni ad alto volume, la Kling 3.0 Motion Control API tramite fornitori terzi gli è sembrata "noticeably cheaper" rispetto al consumo di crediti nel playground. Si tratta però di una valutazione personale singola, non di un confronto di prezzo quantificato.

L'accesso programmatico segue due strade: l'integrazione ComfyUI per workflow visuali e le chiamate API dirette per pipeline batch.

Integrazione con ComfyUI

La documentazione ComfyUI include un node partner ufficiale che espone tutti i parametri di Motion Control come input del workflow:

  • Node LoadImage: immagine di riferimento del personaggio (JPG, PNG, WEBP, GIF, AVIF; massimo 10 MB)
  • Node LoadVideo: video di riferimento del movimento (MP4, MOV, WEBM, M4V, GIF; massimo 100 MB)
  • character_orientation: video oppure image
  • Testo del prompt: controllo della scena e dello sfondo
  • Tier del modello: Standard (720p) oppure Pro (1080p)

Un annuncio su r/comfyui di Reddit conferma che il node pack ComfyUI-Kie-API aggiunge supporto sperimentale per Kling 3.0 Motion Control, con impostazioni per immagine di riferimento, driving video, prompt e orientamento.

Accesso API diretto

Per l'accesso programmatico al di fuori di ComfyUI, puoi richiamare Kling Motion Control tramite provider API che espongono il modello sottostante. La richiesta essenziale include l'identificatore della versione del modello, l'immagine del personaggio in base64 o codificata come URL, il video di riferimento del movimento, il parametro di orientamento e un prompt facoltativo per la scena. La generazione è asincrona: invii il job, ne controlli il completamento e poi recuperi l'URL del video.

Per un endpoint pronto all'uso con Kling 3.0 Motion Control, prova la pagina del modello Kling Motion Control, che include documentazione API e prezzi aggiornati in tempo reale.

Quanto costa una generazione: calcolo dei crediti

ScenarioDurataModello / ModalitàCosto
Test rapido in bozza5s2.6 Standard25 crediti
Render finale con coerenza facciale5s3.0 Professional60 crediti
Ripresa singola da 30 secondi30s2.6 Standard150 crediti
Batch di 10 clip, 5s ciascuna50s totali3.0 Standard450 crediti

Con l'aumentare del volume, la differenza di costo diventa marcata. Dieci clip da cinque secondi in 3.0 Professional costano 600 crediti, contro i 250 crediti di 2.6 Standard per gli stessi 50 secondi di output. Per le bozze conviene iniziare con 2.6 Standard e riservare 3.0 Professional ai render finali in cui l'identità facciale è importante.

Attenzione: crediti non rimborsabili. Se il video di riferimento contiene movimenti rapidi o complessi e il modello riesce a estrarre soltanto un segmento valido più breve, verrà comunque addebitata la durata generata. Kling dichiara esplicitamente che in questo caso i crediti non sono rimborsabili.

Per conoscere la quantità di crediti del piano gratuito, utile per ridurre il costo dei test, consulta la nostra guida al piano gratuito di Kling AI.

Problemi frequenti e soluzioni pratiche

SintomoCausaSoluzioneFonte
Il viso cambia o si deforma durante il movimentoElement Binding non usato oppure un'unica angolazione disponibileRipeti il binding con vista frontale e laterali sinistra/destra; aggiungi immagini con l'espressione desiderataGuida ufficiale
L'output è più corto del riferimentoAzione troppo veloce o complessa per estrarre un movimento continuoUsa una clip più lenta; colloca il movimento chiave in una finestra di 3–10 secondiGuida ufficiale
Gli arti risultano sfocati o intrecciatiParti del corpo tagliate o nascoste nell'immagine del personaggioScegli un'immagine con il corpo intero e arti separati e ben visibiliGuida ufficiale
Anelli o artefatti sulle maniAssenza dei negative promptSemplifica le posizioni delle mani nel riferimento; evita pose simili a un anelloReddit
Le persone sullo sfondo restano immobiliIl modello anima soltanto il personaggio principaleUsa un riferimento con una sola persona in scenaReddit
L'identità è errata o distortaImmagine del personaggio debole o non coerenteUsa un'immagine più nitida, ben illuminata e frontale; fai corrispondere l'inquadratura al tipo di movimentoLinkedIn
Il movimento sembra "scivolare sul ghiaccio"Appoggio instabile nel video di riferimento (2.6)Stabilizza il riferimento; secondo alcune segnalazioni 3.0 ancora meglio i piediReddit
I cartoni 2D piatti faticano con le viste posterioriLe proporzioni stilizzate sono più difficili da tracciarePer le rotazioni, usa personaggi realistici o in stile 3DDocumentazione ComfyUI

Un esperimento LinkedIn di César Augusto Cabrera Boggio ha rilevato che angoli di camera, direzione e geometria dell'immagine di input e del driving video devono essere strettamente allineati per un tracking affidabile. Le discrepanze sono la causa principale di visi deformati e movimenti tremolanti.

FAQ

Posso usare Kling Motion Control con più personaggi?

No. La funzione supporta un solo personaggio per generazione. Se il video di riferimento o il primo fotogramma contiene più persone, Kling seleziona automaticamente quella che occupa la porzione maggiore dell'inquadratura. Per una scena con più personaggi, genera ogni clip separatamente e componile in post-produzione.

Posso mantenere l'audio originale del video di riferimento?

La guida ufficiale di Kling non indica la conservazione dell'audio tra le funzioni supportate. Il video generato è un nuovo render basato sull'immagine del personaggio e sui dati di movimento estratti. Prevedi quindi la sincronizzazione dell'audio in post-produzione.

Che differenza c'è tra Standard e Professional?

La modalità Standard produce video a 720p, usa i crediti in modo più efficiente ed è adatta alle animazioni semplici e ai test rapidi. Professional genera a 1080p, con un costo maggiore al secondo, ed è più indicata per coreografie dettagliate e lavori con molte mani in scena, secondo le descrizioni dei tier di ComfyUI. Professional costa dal 33% al 60% in più al secondo, a seconda della versione: 33% per 3.0 e 60% per 2.6.

Posso accedere a Kling Motion Control tramite API o ComfyUI?

Sì. Il partner node di ComfyUI espone tutti i parametri di Motion Control all'interno di un workflow. Esistono inoltre provider API terzi per l'accesso programmatico; almeno un utente Reddit ha riferito che l'API gli è sembrata meno costosa per il lavoro batch, ma è una sola valutazione personale e non un confronto verificato dei prezzi.

Quanto può durare una clip Motion Control?

I video sorgente possono durare 3–30 secondi e l'output è pensato per eguagliarne la durata. Nella modalità con orientamento dell'immagine, la documentazione ComfyUI limita la durata massima a 10 secondi. Il movimento continuo minimo estraibile è di 3 secondi: se il modello non riesce a individuarne almeno 3 validi, la generazione fallisce.

Quale versione scegliere?

ScenarioVersioneModalitàAccesso
Test rapido o meme per i social2.6StandardWeb playground
Azione breve e frontale con preservazione dell'identità3.0StandardWeb playground
Bozza di danza o coreografia a corpo intero2.6ProfessionalPlayground o API
Render finale con coerenza facciale da più angolazioni3.0ProfessionalAPI (risparmio sui costi batch)
Generazione batch, 10+ varianti3.0StandardAPI
Orbite cinematografiche o energia da camera a mano3.0Standard + Curve Dolly / Camera ShakeWeb playground

Scegli 2.6 per movimenti centrati sul corpo, bozze meno costose e azioni frontali semplici. Passa a 3.0 quando sono importanti identità facciale, espressioni, recupero dalle occlusioni o i controlli di camera esclusivi di 3.0, come Curve Dolly, Camera Shake e Multi-Elements. La qualità del riferimento incide sul risultato più dell'abilità nello scrivere prompt: servono riprese stabili, continue, a velocità moderata, con un solo soggetto ben visibile.