Con Kling Motion Control puedes trasladar el movimiento de una persona en un vídeo corto a una imagen estática de un personaje: una sola persona, una interpretación y clips de hasta 30 segundos. La función está disponible en dos versiones: Kling VIDEO 2.6, orientada al movimiento corporal y con un coste de 5–8 créditos por segundo, y Kling VIDEO 3.0, centrada en conservar la identidad facial, por 9–12 créditos por segundo. La guía oficial de Kling deja claro que el resultado depende de los materiales de entrada; además, un experimento en LinkedIn concluyó que alinear la geometría de la imagen y del vídeo que guía el movimiento es el factor que más influye en la calidad final.
Así funciona Kling Motion Control
El modelo extrae la información de movimiento de un vídeo de movimiento y la aplica a una imagen de referencia. El resultado es un clip en el que el personaje de la imagen reproduce la acción del vídeo. Según la guía oficial de Kling, el sistema admite un solo personaje: si el vídeo de movimiento o el primer fotograma incluyen varias personas, Kling elige automáticamente a quien ocupa la mayor superficie en pantalla.
Los dos recursos deben ser un plano continuo, sin cortes ni cambios de plano y con el mínimo movimiento de cámara posible. Kling recomienda movimientos amplios, a velocidad moderada y con poco desplazamiento. Las acciones rápidas o complejas pueden hacer que el modelo extraiga únicamente un tramo continuo válido; el vídeo generado será entonces más corto que el archivo subido, y esos créditos no son reembolsables.
Requisitos de los archivos
| Parámetro | Límite |
|---|---|
| Duración del vídeo de movimiento | 3–30 segundos |
| Movimiento continuo mínimo extraído | 3 segundos |
| Resolución de imagen (lado corto) | Al menos 340 px |
| Resolución de imagen (lado largo) | Como máximo 3.850 px |
| Tamaño del archivo de imagen | 10 MB máx. |
| Tamaño del archivo de vídeo | 100 MB máx. |
| Formatos de imagen compatibles | JPG, PNG, WEBP, GIF, AVIF |
| Formatos de vídeo compatibles | MP4, MOV, WEBM, M4V, GIF |
| Número de personajes | Uno (selección automática del sujeto más grande) |
La documentación de ComfyUI establece un mínimo más exigente: 720 px tanto de ancho como de alto. También recomienda que en la imagen del personaje se vean por completo la cabeza, los hombros y el torso.
Modos de orientación
Kling ofrece dos comportamientos de orientación que determinan cómo se encuadra al personaje en el resultado:
| Modo | El movimiento sigue | La orientación sigue | Movimiento de cámara |
|---|---|---|---|
| La orientación del personaje coincide con el vídeo | Vídeo de referencia | Vídeo de referencia | Vídeo de referencia |
| La orientación del personaje coincide con la imagen | Vídeo de referencia | Imagen de referencia | Se controla mediante prompts |
En el modo de orientación según la imagen, los prompts pueden activar cinco tratamientos de cámara: Zoom In, Zoom Out, Camera Up, Camera Down y Fixed Position. La documentación de ComfyUI fija un máximo más corto, de 10 segundos, para este modo, frente a los 30 segundos del modo de orientación según el vídeo.
Kling 3.0 frente a 2.6: funciones, precios y resoluciones
Kling plantea ambas versiones para necesidades distintas. 2.6 es la base para movimiento corporal: sincronización de cuerpo entero, acciones atléticas complejas, articulación de manos, planos únicos de 30 segundos y control de escena mediante texto. 3.0 añade mejoras en la identidad facial mediante una función llamada Element Binding.
Element Binding permite vincular al personaje un conjunto de imágenes faciales de referencia o un vídeo facial corto. El modelo usa ese material para mantener una identidad consistente durante giros, cambios de expresión y oclusiones. La Element Library almacena únicamente información facial: no codifica ropa, peinado, maquillaje ni accesorios. Element Binding solo funciona cuando la orientación del personaje coincide con la del vídeo.
Comparativa entre versiones
| Función | Kling 3.0 | Kling 2.6 |
|---|---|---|
| Ventaja principal | Identidad facial entre ángulos y emociones | Transferencia de movimiento de cuerpo entero |
| Element Binding | Sí (referencias faciales desde varios ángulos) | No |
| Recuperación tras oclusiones | Sí (alta fidelidad, según la marca) | No |
| Tratamientos de cámara | Multi-Elements, Curve Dolly, Camera Shake | Zoom In/Out, Camera Up/Down, Fixed |
| Resolución (Standard) | 720p | 720p |
| Resolución (Professional) | 1080p | 1080p |
| Rango de duración del vídeo fuente | 3–30 segundos (guía oficial) | 3–30 segundos (guía oficial) |
Precios
La facturación se calcula por segundos generados y se redondea al segundo entero más cercano, según la guía oficial.
| Modelo | Modo | Tarifa |
|---|---|---|
| Kling VIDEO 3.0 Motion Control | Standard | 9 créditos/segundo |
| Kling VIDEO 3.0 Motion Control | Professional | 12 créditos/segundo |
| Kling VIDEO 2.6 Motion Control | Standard | 5 créditos/segundo |
| Kling VIDEO 2.6 Motion Control | Professional | 8 créditos/segundo |
Un clip de 3,4 segundos se redondea a 3 segundos: 27 créditos en 3.0 Standard. Uno de 3,6 segundos se redondea a 4 segundos: 36 créditos. Para consultar los precios detallados de las suscripciones y las tarifas de compra de créditos, revisa nuestra guía de precios de la API de Kling 3.
Cómo generar un vídeo con Motion Control, paso a paso
- Sube el vídeo de movimiento. Elige un clip de tus archivos locales o selecciónalo en la Motion Library integrada de Kling. Debe ser un plano continuo de una sola persona y durar entre 3 y 30 segundos.
- Añade la imagen del personaje. Sube una imagen fija del personaje que quieres animar. Haz coincidir el encuadre: imagen de cuerpo entero para movimiento de cuerpo entero, plano medio para movimiento de medio cuerpo. Comprueba que las extremidades estén visibles y que el sujeto tenga espacio libre a su alrededor.
- Vincula un elemento facial, solo en 3.0. Activa "Bind Facial Element to Enhance Facial Consistency" y selecciona un elemento existente o crea uno subiendo imágenes faciales o un vídeo corto.
- Define el modo de orientación. Elige "Character Orientation Matches Video" para coreografías de cuerpo entero, o "Character Orientation Matches Image" para animar retratos con movimiento de cámara definido por prompt.
- Escribe un prompt de escena, si lo necesitas. En el modo de orientación según la imagen, el prompt permite controlar detalles del fondo y el tratamiento de cámara.
- Genera e itera. Modifica una sola variable cada vez: el vídeo de referencia, la imagen del personaje o los datos de vinculación. Si cambias las tres a la vez, no podrás saber qué recurso provocó un defecto.
Preparar Element Binding: cuántos ángulos necesitas
Para que Element Binding de 3.0 funcione bien, la guía oficial recomienda adaptar las referencias faciales al resultado que buscas:
- Giros de cabeza precisos: una vista frontal y perfiles izquierdo y/o derecho.
- Expresiones precisas: una imagen frontal neutra y otra frontal con la expresión objetivo, por ejemplo, una sonrisa.
- Rotación de 360° fluida con sonrisa: cinco referencias: frontal, perfil izquierdo, perfil derecho, desde arriba y desde abajo; todas sonriendo.
- Cambios emocionales complejos con movimiento de cabeza: imagen frontal, imagen sonriendo, imagen triste y vistas laterales.
Para obtener los datos faciales más completos, Kling recomienda subir un vídeo corto en lugar de imágenes fijas, ya que una secuencia continua capta más información sobre las transiciones entre expresiones que fotos independientes.
Cómo usar Kling Motion Control mediante API
El playground web de Kling cobra créditos por segundo, un coste que puede crecer rápido. En r/klingO1 de Reddit, un usuario que probó 3.0 Motion Control comentó que el movimiento "finally starting to feel 'heavy'" y que los pies parecen anclados al suelo, una mejora respecto a la tendencia de 2.6 a dar una sensación de deslizamiento (fuente). El mismo usuario indicó que, para trabajo de gran volumen, la API de Kling 3.0 Motion Control a través de proveedores externos le resultó "noticeably cheaper" que gastar créditos en el playground. Es una valoración personal de un único usuario, no una comparación de precios cuantificada.
El acceso programático se divide en dos vías: integración con ComfyUI para flujos visuales y llamadas directas a API para procesos por lotes.
Integración con ComfyUI
La documentación de ComfyUI incluye un nodo oficial de partner que expone todos los parámetros de Motion Control como entradas del flujo:
- Nodo LoadImage: imagen de referencia del personaje (JPG, PNG, WEBP, GIF, AVIF; máximo 10 MB)
- Nodo LoadVideo: vídeo de referencia de movimiento (MP4, MOV, WEBM, M4V, GIF; máximo 100 MB)
- character_orientation:
videooimage - Texto del prompt: control de escena y fondo
- Gama del modelo: Standard (720p) o Pro (1080p)
Un anuncio en r/comfyui de Reddit confirma que el paquete de nodos ComfyUI-Kie-API incorpora soporte experimental para Kling 3.0 Motion Control, con ajustes para imagen de referencia, vídeo conductor, prompt y orientación.
Acceso directo por API
Para acceder de forma programática fuera de ComfyUI, puedes llamar a Kling Motion Control mediante proveedores de API que exponen el modelo subyacente. La petición básica incluye el identificador de versión del modelo, la imagen del personaje codificada en base64 o mediante URL, el vídeo de referencia de movimiento, el parámetro de orientación y un prompt de escena opcional. La generación es asíncrona: envías el trabajo, consultas su estado hasta que termina y recuperas la URL del vídeo.
Si buscas un endpoint listo para usar con Kling 3.0 Motion Control, prueba la página del modelo Kling Motion Control, que ofrece documentación de API y precios en tiempo real.
Coste en créditos: cuánto cuesta cada generación
| Escenario | Duración | Modelo / modo | Coste |
|---|---|---|---|
| Prueba rápida de borrador | 5 s | 2.6 Standard | 25 créditos |
| Render final con consistencia facial | 5 s | 3.0 Professional | 60 créditos |
| Plano único de 30 segundos | 30 s | 2.6 Standard | 150 créditos |
| Lote de 10 clips, de 5 s cada uno | 50 s en total | 3.0 Standard | 450 créditos |
La diferencia de coste se amplía al trabajar por volumen. Diez clips de 5 segundos en 3.0 Professional cuestan 600 créditos, frente a los 250 créditos de 2.6 Standard para los mismos 50 segundos de resultado. Empieza con 2.6 Standard para borradores y reserva 3.0 Professional para renders finales en los que la identidad facial sea importante.
Aviso sobre créditos no reembolsables: si tu vídeo de referencia contiene movimientos rápidos o complejos y el modelo solo puede extraer un segmento válido más corto, se te cobrará igualmente por la duración generada. Kling indica de forma explícita que los créditos no se reembolsan en este caso.
Para conocer las cantidades de créditos del plan gratuito que pueden ayudar a cubrir pruebas, consulta nuestra guía del plan gratuito de Kling AI.
Fallos habituales y cómo solucionarlos
| Síntoma | Causa | Solución | Fuente |
|---|---|---|---|
| La cara deriva o se deforma durante el movimiento | No se usó Element Binding o solo se aportó un ángulo | Vuelve a vincular usando una vista frontal y perfiles izquierdo/derecho; añade imágenes con la expresión objetivo | Guía oficial |
| El resultado es más corto que la referencia | La acción es demasiado rápida o compleja para extraer movimiento continuo | Usa un clip más lento; coloca el movimiento clave en una ventana de 3–10 segundos | Guía oficial |
| Las extremidades se ven borrosas o enredadas | Partes del cuerpo recortadas u ocultas en la imagen del personaje | Elige de nuevo una imagen con el cuerpo completo y las extremidades separadas y visibles | Guía oficial |
| Aparecen anillos o artefactos en las manos | Pérdida de prompts negativos | Simplifica las posiciones de las manos en la referencia; evita poses que parezcan anillos | |
| Las personas del fondo quedan congeladas | El modelo solo anima al personaje principal | Mantén la referencia como un plano de una sola persona | |
| La identidad parece incorrecta o deformada | Imagen de personaje débil o mal emparejada | Usa una imagen más nítida, bien iluminada y frontal; adapta el encuadre al tipo de movimiento | |
| El movimiento parece un "deslizamiento sobre hielo" | El vídeo de referencia tiene apoyos inestables, en 2.6 | Estabiliza la referencia; según informes, 3.0 ancla mejor los pies | |
| Los dibujos animados 2D planos tienen problemas con las vistas traseras | Las proporciones estilizadas son más difíciles de seguir | Usa personajes realistas o de estilo 3D para las rotaciones | Documentación de ComfyUI |
Un experimento en LinkedIn de César Augusto Cabrera Boggio concluyó que los ángulos de cámara, la dirección y la geometría de la imagen de entrada y del vídeo conductor deben encajar estrechamente para lograr un seguimiento fiable. Las discrepancias son la causa principal de caras deformadas y movimiento tembloroso.
Preguntas frecuentes
¿Puedo usar Kling Motion Control con varios personajes?
No. La función admite un personaje por generación. Si el vídeo de referencia o el primer fotograma contienen varias personas, Kling selecciona automáticamente a quien ocupa la mayor parte del encuadre. Para escenas con varios personajes, genera el clip de cada uno por separado y compónlos en posproducción.
¿Puedo conservar el audio original del vídeo de referencia?
La guía oficial de Kling no menciona la conservación de audio como una función compatible. El vídeo generado es un render nuevo basado en la imagen del personaje y en los datos de movimiento extraídos. Prevé sincronizar el audio en posproducción.
¿Qué diferencia hay entre los modos Standard y Professional?
El modo Standard genera a 720p, consume créditos de forma más eficiente y es adecuado para animaciones sencillas y pruebas rápidas. Professional genera a 1080p con un coste mayor por segundo, y encaja mejor con coreografías detalladas y trabajos intensivos de manos, según las descripciones de niveles de ComfyUI. Professional cuesta entre un 33 % y un 60 % más por segundo según la versión: 33 % en 3.0 y 60 % en 2.6.
¿Puedo acceder a Kling Motion Control mediante API o ComfyUI?
Sí. El nodo partner de ComfyUI expone todos los parámetros de Motion Control dentro de un flujo de trabajo. Los proveedores externos de API también ofrecen acceso programático, y al menos un usuario de Reddit afirmó que la vía API le resultaba más barata para trabajo por lotes, aunque se trata de una valoración personal, no de una comparación de precios verificada.
¿Cuál es la duración máxima de un clip de Motion Control?
Los vídeos fuente pueden durar entre 3 y 30 segundos, y el resultado está pensado para igualar esa duración. En el modo de orientación según la imagen, la documentación de ComfyUI limita el máximo a 10 segundos. El movimiento continuo mínimo que puede extraerse es de 3 segundos: si el modelo no encuentra 3 segundos de movimiento válido, la generación falla.
Qué versión deberías usar
| Escenario | Versión | Modo | Acceso |
|---|---|---|---|
| Prueba rápida o meme para redes | 2.6 | Standard | Playground web |
| Acción corta y frontal con preservación de identidad | 3.0 | Standard | Playground web |
| Borrador de baile o coreografía de cuerpo entero | 2.6 | Professional | Playground o API |
| Render final con consistencia facial desde varios ángulos | 3.0 | Professional | API (ahorro de costes por lotes) |
| Generación por lotes, más de 10 variantes | 3.0 | Standard | API |
| Órbita cinematográfica o energía de cámara en mano | 3.0 | Standard + Curve Dolly / Camera Shake | Playground web |
Usa 2.6 para movimientos centrados en el cuerpo, borradores de menor coste y acciones frontales sencillas. Elige 3.0 cuando importen la identidad facial, las expresiones, la recuperación tras oclusiones o los controles de cámara exclusivos de 3.0, como Curve Dolly, Camera Shake y Multi-Elements. La calidad de la referencia pesa más que la habilidad para escribir prompts: usa material estable, de un solo sujeto, visible, continuo y con un ritmo moderado.