AIREITER

Kling Motion Control: API, Preços e Fluxo de Trabalho (2026)

Última Atualização: 2026-08-13 01:25:28

Guia oficial do Kling Motion Control com preços e detalhes das versões

Com o Kling Motion Control, um personagem estático pode reproduzir o movimento de uma pessoa em vídeo: basta combinar uma imagem do personagem com uma performance gravada, de até 30 segundos. O recurso tem duas versões. O Kling VIDEO 2.6 prioriza movimento corporal e custa 5–8 créditos por segundo; o Kling VIDEO 3.0 foca na preservação da identidade facial, por 9–12 créditos por segundo. O guia oficial do Kling deixa claro que o resultado depende dos materiais enviados, e um experimento no LinkedIn apontou o alinhamento de geometria entre a imagem e o vídeo condutor como o principal fator de qualidade.

Como o Kling Motion Control transforma imagem em movimento

O modelo extrai os dados de movimento de um vídeo de movimento e os transfere para uma imagem de referência. O resultado é um clipe no qual o personagem da imagem executa a ação presente no vídeo. Segundo o guia oficial do Kling, o sistema aceita apenas um personagem: se o vídeo de movimento ou o primeiro quadro tiver mais de uma pessoa, o Kling escolhe automaticamente quem ocupa a maior área da tela.

Os dois arquivos devem mostrar um único take contínuo, sem cortes, mudanças de enquadramento ou câmera se movimentando demais. O Kling recomenda gestos amplos, em velocidade moderada e com pouco deslocamento. Ações muito rápidas ou complexas podem fazer o modelo aproveitar somente um trecho contínuo válido, gerando um vídeo menor do que o enviado. Nessa situação, os créditos não são reembolsáveis.

Requisitos dos arquivos de entrada

ParâmetroLimite
Duração do vídeo de movimento3–30 segundos
Movimento contínuo mínimo extraído3 segundos
Resolução da imagem (lado menor)No mínimo 340 px
Resolução da imagem (lado maior)No máximo 3.850 px
Tamanho do arquivo de imagemMáximo de 10 MB
Tamanho do arquivo de vídeoMáximo de 100 MB
Formatos de imagem aceitosJPG, PNG, WEBP, GIF, AVIF
Formatos de vídeo aceitosMP4, MOV, WEBM, M4V, GIF
Quantidade de personagensUm (o maior sujeito é selecionado automaticamente)

A documentação do ComfyUI impõe um mínimo mais rigoroso de 720 px tanto na largura quanto na altura. Ela também recomenda que a imagem do personagem mostre claramente cabeça, ombros e tronco.

Modos de orientação do personagem

O Kling oferece dois comportamentos de orientação, que definem como o personagem será enquadrado no resultado:

ModoMovimento segueOrientação segueMovimento de câmera
Character Orientation Matches VideoVídeo de referênciaVídeo de referênciaVídeo de referência
Character Orientation Matches ImageVídeo de referênciaImagem de referênciaControlado por prompts

No modo de orientação pela imagem, os prompts podem acionar cinco tratamentos de câmera: Zoom In, Zoom Out, Camera Up, Camera Down e Fixed Position. A documentação do ComfyUI estabelece um teto menor nesse modo: 10 segundos, contra 30 segundos no modo de orientação pelo vídeo.

Kling 3.0 ou 2.6: recursos, preços e resoluções

As duas versões foram posicionadas para usos diferentes. O 2.6 é a base para movimento corporal, com sincronização de corpo inteiro, ações atléticas complexas, articulação das mãos, takes únicos de 30 segundos e controle de cena via prompt de texto. O 3.0 adiciona melhorias de identidade facial por meio do recurso Element Binding.

Com o Element Binding, você vincula ao personagem um conjunto de imagens faciais de referência ou um vídeo facial curto. O modelo usa esse material para manter a identidade durante viradas de cabeça, mudanças de expressão e oclusões. A Element Library armazena somente informações faciais; roupas, penteado, maquiagem e acessórios não entram nesses dados. O Element Binding funciona apenas quando a orientação do personagem acompanha a orientação do vídeo.

Comparativo entre as versões

RecursoKling 3.0Kling 2.6
Ponto forte principalIdentidade facial em diferentes ângulos e emoçõesTransferência de movimento de corpo inteiro
Element BindingSim (referências faciais em múltiplos ângulos)Não
Recuperação após oclusãoSim (alegada alta fidelidade)Não
Tratamentos de câmeraMulti-Elements, Curve Dolly, Camera ShakeZoom In/Out, Camera Up/Down, Fixed
Resolução (Standard)720p720p
Resolução (Professional)1080p1080p
Faixa de duração do vídeo-fonte3–30 segundos (guia oficial)3–30 segundos (guia oficial)

Preços

A cobrança considera os segundos gerados, arredondados para o segundo inteiro mais próximo, conforme o guia oficial.

ModeloModoValor
Kling VIDEO 3.0 Motion ControlStandard9 créditos/segundo
Kling VIDEO 3.0 Motion ControlProfessional12 créditos/segundo
Kling VIDEO 2.6 Motion ControlStandard5 créditos/segundo
Kling VIDEO 2.6 Motion ControlProfessional8 créditos/segundo

Um clipe de 3,4 segundos é arredondado para 3 segundos, custando 27 créditos no 3.0 Standard. Já um vídeo de 3,6 segundos sobe para 4 segundos e custa 36 créditos. Para consultar preços detalhados dos planos e valores de compra de créditos, veja nosso guia de preços da API do Kling 3.

Passo a passo para criar um vídeo com Motion Control

  1. Envie o vídeo de movimento. Escolha um clipe dos seus arquivos locais ou use a Motion Library integrada ao Kling. Ele precisa ser um take contínuo de uma pessoa, com 3–30 segundos.
  2. Adicione a imagem do personagem. Envie a imagem estática que será animada. Faça o enquadramento corresponder: corpo inteiro para movimento de corpo inteiro; meio corpo para ações de meio corpo. Os membros devem estar visíveis, e o sujeito precisa ter espaço livre ao redor.
  3. Vincule um elemento facial (somente no 3.0). Ative "Bind Facial Element to Enhance Facial Consistency" e selecione um elemento existente ou crie um novo enviando imagens faciais ou um vídeo curto.
  4. Defina o modo de orientação. Use "Character Orientation Matches Video" para coreografias de corpo inteiro ou "Character Orientation Matches Image" para animar retratos com movimento de câmera via prompt.
  5. Escreva um prompt de cena (opcional). No modo de orientação pela imagem, o prompt controla detalhes do fundo e o tratamento de câmera.
  6. Gere e faça iterações. Altere uma variável por vez: vídeo de referência, imagem do personagem ou dados de binding. Mudar os três ao mesmo tempo impede identificar qual entrada causou um defeito.

Element Binding: quantos ângulos preparar

Para obter bons resultados com o Element Binding do 3.0, o guia oficial recomenda preparar as referências faciais de acordo com o resultado desejado:

  • Viradas de cabeça precisas: uma visão frontal e uma ou ambas as visões laterais, esquerda e direita.
  • Expressões precisas: uma imagem frontal neutra e outra frontal com a expressão desejada, como um sorriso.
  • Rotação de 360° suave com sorriso: cinco referências — frente, perfil esquerdo, perfil direito, de cima e de baixo — todas sorrindo.
  • Mudanças emocionais complexas com movimento de cabeça: imagem frontal, imagem sorrindo, imagem triste e visões laterais.

Para reunir dados faciais mais completos, o Kling recomenda enviar um vídeo curto em vez de imagens estáticas. Uma gravação contínua captura mais informações sobre as transições entre expressões do que fotos isoladas.

Como usar o Kling Motion Control via API

O playground web do Kling cobra créditos por segundo, e o valor pode subir rapidamente. No r/klingO1 do Reddit, um usuário que testou o 3.0 Motion Control observou que o movimento "finalmente começou a parecer 'pesado'" e que os pés parecem ficar presos ao chão — uma evolução em relação à aparência de deslizamento recorrente no 2.6 (fonte). O mesmo usuário relatou que, para trabalho em alto volume, a API do Kling 3.0 Motion Control por provedores terceirizados pareceu "visivelmente mais barata" do que gastar créditos no playground. Ainda assim, trata-se da avaliação pessoal de um único usuário, não de uma comparação de preços quantificada.

O acesso programático pode seguir dois caminhos: integração com ComfyUI em fluxos visuais ou chamadas diretas de API para pipelines em lote.

Integração com ComfyUI

A documentação do ComfyUI inclui um node oficial de parceiro que expõe todos os parâmetros do Motion Control como entradas do workflow:

  • Node LoadImage: imagem de referência do personagem (JPG, PNG, WEBP, GIF, AVIF; máximo de 10 MB)
  • Node LoadVideo: vídeo de referência de movimento (MP4, MOV, WEBM, M4V, GIF; máximo de 100 MB)
  • character_orientation: video ou image
  • Texto do prompt: controle de cena e fundo
  • Camada do modelo: Standard (720p) ou Pro (1080p)

Um anúncio no r/comfyui do Reddit confirma que o pacote de nodes ComfyUI-Kie-API adiciona suporte experimental ao Kling 3.0 Motion Control, expondo configurações de imagem de referência, vídeo condutor, prompt e orientação.

Acesso direto pela API

Fora do ComfyUI, é possível chamar o Kling Motion Control por meio de provedores de API que expõem o modelo subjacente. A solicitação básica inclui o identificador da versão do modelo, a imagem do personagem codificada em base64 ou por URL, o vídeo de referência de movimento, o parâmetro de orientação e um prompt de cena opcional. A geração é assíncrona: você envia o trabalho, consulta o status até a conclusão e então recupera a URL do vídeo.

Para um endpoint pronto para uso com Kling 3.0 Motion Control, experimente a página do modelo Kling Motion Control, que oferece documentação da API e preços atualizados.

Quanto custa cada geração em créditos

CenárioDuraçãoModelo / ModoCusto
Teste rápido de rascunho5s2.6 Standard25 créditos
Renderização final com consistência facial5s3.0 Professional60 créditos
Take único de 30 segundos30s2.6 Standard150 créditos
Lote de 10 clipes (5s cada)50s no total3.0 Standard450 créditos

A diferença de custo aumenta em escala. Dez clipes de 5 segundos no 3.0 Professional custam 600 créditos, contra 250 créditos no 2.6 Standard pelos mesmos 50 segundos de resultado. Comece os rascunhos no 2.6 Standard e deixe o 3.0 Professional para renderizações finais nas quais a identidade facial seja importante.

Atenção: não há reembolso. Se o vídeo de referência tiver movimentos rápidos ou complexos e o modelo extrair apenas um trecho válido menor, a cobrança será feita pela duração gerada de qualquer forma. O Kling declara explicitamente que os créditos não são reembolsáveis nesse cenário.

Para saber os valores de créditos do plano gratuito que podem ajudar a reduzir o custo dos testes, consulte nosso guia do plano gratuito do Kling AI.

Erros mais comuns e como corrigir

SintomaCausaComo resolverFonte
O rosto se altera ou perde identidade durante o movimentoElement Binding não foi usado ou recebeu apenas um ânguloFaça o binding novamente com visão frontal e laterais esquerda/direita; inclua imagens com a expressão desejadaGuia oficial
O resultado fica menor que o vídeo de referênciaA ação é rápida ou complexa demais para extrair movimento contínuoUse um clipe mais lento; concentre o movimento principal em uma janela de 3–10 segundosGuia oficial
Membros ficam borrados ou emboladosPartes do corpo estão cortadas ou ocultas na imagem do personagemEscolha outra imagem, com corpo inteiro e membros separados e visíveisGuia oficial
Anéis ou artefatos aparecem nas mãosPerda de prompts negativosSimplifique as posições das mãos na referência; evite poses que lembrem anéisReddit
Pessoas ao fundo ficam congeladasO modelo anima apenas o personagem principalMantenha a referência em um take com uma única pessoaReddit
A identidade parece errada ou deformadaImagem do personagem fraca ou incompatívelUse uma imagem mais nítida, bem iluminada e frontal; faça o enquadramento combinar com o tipo de movimentoLinkedIn
O movimento parece "deslizar no gelo"O vídeo de referência tem apoio instável dos pés (2.6)Estabilize a referência; o 3.0 supostamente ancora melhor os pésReddit
Desenhos 2D planos têm dificuldade em vistas traseirasProporções estilizadas são mais difíceis de rastrearPara rotações, use personagens realistas ou com estilo 3DDocs do ComfyUI

Um experimento no LinkedIn de César Augusto Cabrera Boggio concluiu que os ângulos de câmera, a direção e a geometria da imagem de entrada e do vídeo condutor precisam estar muito alinhados para um rastreamento confiável. Incompatibilidades são a principal causa de rostos deformados e movimento instável.

Perguntas frequentes

Posso usar o Kling Motion Control com vários personagens?

Não. O recurso aceita um personagem por geração. Se o vídeo de referência ou o primeiro quadro tiver várias pessoas, o Kling seleciona automaticamente quem ocupa a maior parte do quadro. Para cenas com múltiplos personagens, gere o clipe de cada um separadamente e faça a composição na pós-produção.

Posso manter o áudio original do vídeo de referência?

O guia oficial do Kling não menciona a retenção de áudio como um recurso compatível. O vídeo gerado é uma nova renderização baseada na imagem do personagem e nos dados de movimento extraídos. Planeje sincronizar o áudio na pós-produção.

Qual é a diferença entre os modos Standard e Professional?

O modo Standard gera em 720p, consome créditos de forma mais eficiente e atende bem a animações simples e testes rápidos. O modo Professional gera em 1080p, tem custo maior por segundo e é mais indicado para coreografias detalhadas e trabalhos com muitas ações de mãos, conforme as descrições de camadas do ComfyUI. O Professional custa 33–60% mais por segundo, dependendo da versão: 33% no 3.0 e 60% no 2.6.

Consigo acessar o Kling Motion Control pela API ou pelo ComfyUI?

Sim. O node parceiro do ComfyUI disponibiliza todos os parâmetros do Motion Control em um workflow. Provedores terceirizados de API também oferecem acesso programático, e pelo menos um usuário do Reddit relatou que a rota pela API pareceu mais barata para trabalho em lote — mas essa é uma avaliação pessoal isolada, não uma comparação de preços verificada.

Qual é a duração máxima de um clipe de Motion Control?

Os vídeos-fonte podem ter de 3–30 segundos, e a intenção é que a saída acompanhe essa duração. No modo de orientação pela imagem, a documentação do ComfyUI limita o máximo a 10 segundos. O mínimo de movimento contínuo extraível é de 3 segundos; se o modelo não encontrar 3 segundos de movimento válido, a geração falha.

Qual versão do Kling Motion Control escolher?

CenárioVersãoModoAcesso
Teste rápido ou meme para redes sociais2.6StandardPlayground web
Ação curta e frontal com preservação de identidade3.0StandardPlayground web
Rascunho de dança ou coreografia de corpo inteiro2.6ProfessionalPlayground ou API
Renderização final com consistência facial em múltiplos ângulos3.0ProfessionalAPI (economia em lotes)
Geração em lote (10+ variações)3.0StandardAPI
Órbita cinematográfica ou energia de câmera na mão3.0Standard + Curve Dolly / Camera ShakePlayground web

Use o 2.6 para movimentos centrados no corpo, rascunhos mais baratos e ações frontais simples. Prefira o 3.0 quando identidade facial, expressões, recuperação de oclusões ou os controles de câmera exclusivos do 3.0 — Curve Dolly, Camera Shake e Multi-Elements — forem importantes. A qualidade da referência influencia o resultado mais do que a habilidade com prompts: use imagens e vídeos estáveis, contínuos, moderadamente ritmados, com um único sujeito bem visível.