Um ranking público dá nota 7,8 para a fidelidade aos prompts do Veo 3.1; outro dá 9,2. Nenhum dos dois revela qual prompt usou. Por isso, em 2026-07-30, criamos dois prompts com 20 elementos que podiam ser conferidos individualmente e os enviamos a seis modelos. Na prática, eles ficaram mais próximos entre si do que esses rankings indicam. O que realmente separa os modelos é o tipo de instrução, não a marca.
Qual modelo de vídeo com IA segue melhor os prompts?
O Seedance 2.0 Fast foi o que mais seguiu instruções: acertou 19 dos 20 elementos verificáveis e tirou 10/10 no prompt mais difícil. Kling 3 Turbo e Veo 3.1 empataram com 18, Wan 2.7 ficou com 17,5, Grok Imagine com 16 e Hailuo 02 Pro terminou em último, com 15,5, depois de ignorar uma sequência inteira de eventos. Três execuções adicionais do prompt mais difícil mantiveram essa ordem. O Sora 2 não pôde ser testado.
| Modelo | Prompt literal | Prompt de estresse | Total /20 | Custo por clipe | Por segundo | Espera |
|---|---|---|---|---|---|---|
| Seedance 2.0 Fast | 9.0 | 10.0 | 19.0 | $0.83 | $0.165 | 121–132s |
| Kling 3 Turbo | 9.5 | 8.5 | 18.0 | $0.45 | $0.090 | 45–54s |
| Veo 3.1 | 9.0 | 9.0 | 18.0 | $1.25 | $0.156 | 88–95s |
| Wan 2.7 | 9.0 | 8.5 | 17.5 | $0.40 | $0.080 | 103–104s |
| Grok Imagine | 8.0 | 8.0 | 16.0 | $0.09 | $0.015 | 43–49s |
| Hailuo 02 Pro | 9.0 | 6.5 | 15.5 | $0.29 | $0.049 | 166–185s |
| Sora 2 | — | — | — | — | — | 5 envios com falha |
Os preços foram calculados com base nas tarifas públicas de créditos — a tabela de preços da Kie para Kling, Seedance, Wan, Hailuo e Grok, e as páginas de modelos da AIReiter para Veo 3.1 e Sora 2 — divididas pela duração que cada modelo de fato retornou, detalhada abaixo.
Escolha conforme a necessidade do seu plano:
- O prompt inclui uma contagem, uma ordem ou algo que “nunca se move” → Seedance 2.0 Fast. Foi o único a acertar todos os dez elementos desse tipo, e é isso que justifica seu preço mais alto.
- Você está iterando o visual, não uma sequência → Kling 3 Turbo. Entrega obediência quase igual por cerca de metade do preço e um terço do tempo de espera.
- Você só quer verificar se um prompt funciona → Grok Imagine, por $0.015 por segundo. Seus 16/20 vêm, em grande parte, de uma única entrada que faltou.
- Ação sequenciada → não use o Hailuo 02 Pro, que pulou um evento inteiro.
O Sora 2 retornou UPSTREAM_BUSY / Upstream service is busy or upgrading nos cinco envios feitos entre 03:57 e 03:59 UTC em 2026-07-30, abrangendo os dois prompts e três tentativas espaçadas — sem cobrança, sem clipe e sem nota.
Como testamos: dois prompts e 20 elementos verificáveis
Cada trecho dos dois prompts corresponde a algo que pode ser apontado no quadro. Nada de “cinematic”, “8k” ou “moody”: isso não é mensurável. Cada um dos dez elementos de cada prompt recebe ✓ (1 ponto), ~ (0,5 ponto, parcialmente presente) ou ✗ (0). O teste não avalia qualidade de imagem nem consistência temporal: um clipe pode ser bonito e estável enquanto deixa de fora silenciosamente metade das suas instruções. A saída do Grok Imagine parece uma renderização 3D, e isso não lhe custou pontos.
O prompt literal verifica se o modelo consegue montar uma cena descrita. Seus dez elementos são os dez itens nomeados: uma bicicleta vintage vermelha, encostada em uma parede de tijolos amarelos, um gato branco com uma orelha preta, entrando pela direita do quadro, parando junto à roda dianteira e olhando para cima, a placa com o texto OPEN 7AM, um dolly de plano aberto para plano médio, câmera no nível do chão, luz nublada sem sol e ninguém em cena.
A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.
O prompt de estresse testa contagem, ordem de eventos e negação. Seus dez elementos são: exatamente três patos, todos os três mantendo o mesmo tamanho, alinhados sobre uma mesa de madeira, sem mãos ou pessoas, o pato do meio caindo primeiro, o da esquerda caindo depois, o pato da direita sem nunca se mover, câmera fixa, fundo branco liso e luz dura vinda de cima.
Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.
O ajuste que reescreve seu prompt antes de ele chegar ao modelo
Dois desses modelos têm um reescritor de prompt ativado por padrão: prompt_extend no Wan 2.7 e prompt_optimizer no Hailuo 02 Pro. A documentação de ambos informa que o padrão é true. Se você enviar um prompt sem alterar essas opções, o texto avaliado não será o que você escreveu. Neste teste, ambas foram definidas como false; com os padrões ativados, o teste mede o reescritor junto com o modelo.
Outros parâmetros simplesmente não são respeitados. Todos os clipes foram solicitados com 5 segundos, 720p e 16:9, mas três modelos substituíram essas configurações. Por isso, os preços por segundo acima usam o que foi entregue, e não o que foi pedido:
| Modelo | Enviado | Retornado | Créditos cobrados |
|---|---|---|---|
| Seedance 2.0 Fast | 5s, 720p, 16:9 | 5.0s, 1280×720 | 165 (33/s) |
| Kling 3 Turbo | 5s, 720p, 16:9 | 5.0s, 1280×720 | 90 (18/s) |
| Veo 3.1 | 5s, 16:9 | 8.0s, 1280×720 | 125 por chamada |
| Wan 2.7 | 5s, 720p, 16:9 | 5.0s, 1280×720 | 80 (16/s) |
| Grok Imagine | 6s (mínimo), 720p, 16:9 | 6.0s, 1280×720 | 18 (3/s) |
| Hailuo 02 Pro | 5s, 720p, 16:9 | 5.9s, 1920×1080 | 57 |
Os únicos parâmetros documentados do Hailuo 02 Pro são o prompt e duas opções, então não há nada para configurar; ele retornou 1080p nas duas vezes. O Veo 3.1 devolveu 8 segundos independentemente do que enviamos, e o Grok Imagine documenta um mínimo de 6 segundos.
O que os seis modelos acertaram
A composição geral não foi o ponto fraco de nenhum dos seis resultados. Todos colocaram exatamente uma bicicleta vintage vermelha diante de uma parede de tijolos amarelos, e todos renderizaram o texto “OPEN 7AM” na tela sem errar um único caractere. Os seis também respeitaram as duas instruções negativas: nenhuma pessoa apareceu nos seis clipes da rua e nenhuma câmera se moveu nos seis clipes dos patos com câmera fixa.
Onde eles falham: quatro tipos de instrução
Contagem e detalhes de atributos
“Um gato branco com uma orelha preta” foi seguido à risca apenas uma vez em seis. O Hailuo 02 Pro gerou o único gato com uma só orelha preta em um corpo que, fora isso, era branco. Kling 3 Turbo e Veo 3.1 acertaram a orelha preta, mas adicionaram uma cauda preta; Wan 2.7 espalhou uma mancha preta pelas duas orelhas; Grok Imagine pintou uma máscara siamesa completa; Seedance 2.0 Fast produziu um gato quase todo branco, com uma leve mancha escura na ponta de uma orelha.
Todos os modelos entenderam “gato branco com uma marca preta”. Nenhum, exceto o Hailuo, tratou “uma” como número. Nesses seis resultados, a contagem de atributos foi bem menos confiável que a composição geral.
Ordem e tempo dos eventos
O prompt dos patos pedia uma sequência específica: o do meio cai, depois o da esquerda, enquanto o da direita nunca se move. Quatro modelos executaram isso corretamente: Kling 3 Turbo aos 2.0s e 4.9s, Seedance 2.0 Fast aos 2.0s e 3.5s, Wan 2.7 aos 1.0s e 4.0s, Veo 3.1 aos 1.6s e 4.8s. Nenhum acertou exatamente o intervalo solicitado de dois segundos, e o pato da direita permaneceu parado nos seis clipes.
O Hailuo 02 Pro não executou a sequência. O pato do meio nunca caiu. Em vez disso, o pato da esquerda girou para uma vista de perfil e cresceu para quase o dobro do tamanho, enquanto os três continuaram de pé.
O Grok Imagine derrubou os patos na ordem correta, mas eles caíram para a frente, sobre os bicos, em vez de tombarem de lado. O Veo 3.1 acertou a ordem e depois deixou os dois patos caídos se levantarem de novo até o quadro final — o evento aconteceu, mas o estado não se manteve.
Disciplina de câmera
As câmeras fixas foram respeitadas por todos; os movimentos de câmera descritos, não. Wan 2.7 e Veo 3.1 começaram o dolly solicitado, de plano aberto para médio, mas continuaram avançando até um close extremo. O Wan terminou em um aro de roda vazio, com o gato completamente fora do quadro. O Grok Imagine moveu-se tão pouco que o avanço quase não é perceptível. O Hailuo 02 Pro foi o único a desrespeitar “mantendo-se no nível do chão”, filmando aproximadamente à altura do quadril, enquanto os outros cinco mantiveram a câmera baixa.
Consistência dos objetos
Os objetos mudam de tamanho quando se movem. O pato da esquerda no Hailuo cresceu para quase duas vezes seu tamanho inicial, os dois patos caídos do Grok Imagine também aumentaram visivelmente, e os patos tombados do Kling 3 Turbo e do Veo 3.1 cresceram um pouco. Apenas Seedance 2.0 Fast e Wan 2.7 mantiveram os três patos no mesmo tamanho do primeiro ao último quadro.
A consistência de tamanho não costuma ser pedida — e, depois, passa despercebida.
Cinco dos seis modelos ficam entre 8.0 e 9.5 na cena estática e só se distanciam em contagens e eventos ordenados, cenário em que o Hailuo perde 2.5 pontos. Em uma tomada simples, a escolha do modelo muda pouco; basta um número no prompt para ela passar a fazer muita diferença.
O ranking se mantém em novas execuções?
Sim, para os três modelos que rodamos novamente. Cada um recebeu mais duas tentativas com o prompt de estresse, avaliadas da mesma forma, e as faixas de pontuação não se sobrepõem.
| Modelo | Execução 1 | Execução 2 | Execução 3 | Mediana | Faixa |
|---|---|---|---|---|---|
| Seedance 2.0 Fast | 10.0 | 9.5 | 10.0 | 10.0 | 9.5–10.0 |
| Kling 3 Turbo | 8.5 | 8.0 | 8.0 | 8.0 | 8.0–8.5 |
| Hailuo 02 Pro | 6.5 | 6.5 | — | 6.5 | n=2 |
O Kling 3 Turbo produziu uma parede azul-acinzentada em vez do fundo branco liso solicitado nas três execuções. Isso indica uma preferência estável, e não ruído de amostragem. O Hailuo 02 Pro repetiu exatamente a mesma falha nas duas vezes: o pato do meio nunca caiu e o da esquerda cresceu para quase o dobro do tamanho. A terceira execução do Hailuo foi bloqueada por um limite diário de créditos, portanto sua mediana se baseia em duas amostras.
As repetições revelaram um comportamento que uma única rodada havia escondido. Na execução 2, o pato do meio do Kling 3 Turbo caiu e depois se levantou antes do quadro final — a mesma reversão de estado que o Veo 3.1 mostrou em sua única execução. Os eventos acontecem; os estados nem sempre permanecem.
Quanto custa tentar de novo quando o modelo ignora você
Preço e velocidade não caminham juntos. O Hailuo 02 Pro foi o segundo modelo mais barato por clipe e, de longe, o mais lento, com 166–185 segundos. Já o Kling 3 Turbo entregou seus 18/20 em 45–54 segundos. Os preços por clipe também favorecem os modelos de clipes curtos: o Veo 3.1 custa $1.25, ante $0.83 do Seedance 2.0 Fast, mas o Veo entrega 8 segundos e o Seedance 5. Por segundo, os dois são quase idênticos: $0.156 e $0.165.
Os 17 clipes por trás deste artigo custaram 1,387 créditos Kie mais 250 créditos AIReiter, que, a 200 e 100 créditos por dólar, somam $9.44; os cinco envios com falha ao Sora 2 não custaram nada. Gerar é a parte barata. Gerar três vezes porque o quarto elemento sumiu e nenhum checklist percebeu não é.
Como resumiu um usuário do r/SoraAi: "No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions." Uma avaliação elemento por elemento transforma isso em uma lista de quais instruções falharam — algo sobre o qual você pode agir.
Faça esse teste com a sua própria lista de planos
- Reescreva um prompt real para que cada trecho possa ser verificado — troque “cinematic” pela altura da câmera, direção da luz e pelo enquadramento em que o movimento termina.
- Antes de gerar, divida o texto em uma lista numerada de elementos. Dez itens bastam; anote-os, ou você vai avaliar de memória e dar uma nota generosa demais.
- Desative os reescritores. Defina
prompt_extendcomofalseno Wan,prompt_optimizercomofalseno Hailuo e, antes de comparar qualquer coisa, confira se sua plataforma tem um recurso próprio. - Envie exatamente a mesma string para dois ou três modelos, com duração e resolução equivalentes, e registre o que cada um substitui silenciosamente.
- Assista ao clipe inteiro e use os quadros inicial, central e final como pontos de checagem — falhas breves de estado podem acontecer entre as amostras. Depois, rode novamente apenas o modelo que errou os elementos que realmente importam para você. Uma orelha preta ausente pode não importar; um pato que se levanta de novo, sim.
Para reproduzir diretamente nossos testes, as páginas dos modelos Veo 3.1, Seedance 2 Fast e Sora 2 trazem os IDs exatos dos modelos e os preços por segundo em créditos usados acima.
Perguntas frequentes
Qual gerador de vídeo com IA é mais preciso?
Neste teste, o Seedance 2.0 Fast: 19 dos 20 elementos verificáveis e a única aprovação perfeita em contagem, ordenação e negação. Em cenas simples, a precisão foi quase idêntica entre cinco dos seis modelos; o ranking só os separa nos prompts sequenciados.
Seedance é melhor que Veo 3.1 ou Sora 2?
O Seedance 2.0 Fast superou o Veo 3.1 por um ponto, 19 a 18, custando dois terços do preço por clipe, e ambos executaram a sequência dos patos na ordem correta. Não é possível classificar o Sora 2: os cinco envios em 2026-07-30 falharam no upstream, então ele não tem nota aqui — não uma nota baixa.
O Kling 3 Turbo vale a pena para trabalhos com prompts complexos?
Sim, quando velocidade é mais importante que sequenciamento. O Kling 3 Turbo teve a maior nota dos seis no prompt literal, 9.5/10, e retornou em 45–54 segundos, mas perdeu um ponto no prompt de estresse por gerar uma parede azul-acinzentada onde o prompt pedia branco liso.
Um prompt mais longo melhora a fidelidade?
Não por si só. O prompt literal deste teste é mais longo que o prompt de estresse, e todos os modelos tiveram nota maior nele porque suas instruções descrevem uma disposição estática, não contagens e ordem de eventos.
O que este teste não consegue responder
Três execuções bastam para mostrar que essas notas não são ruído de amostragem, mas não bastam para transformá-las em benchmark. Apenas Seedance, Kling e Hailuo foram rodados novamente; Veo 3.1, Wan 2.7 e Grok Imagine ainda se apoiam em uma tentativa cada. Os dois prompts também são de plano único, sem diálogos e com menos de dez segundos, deixando completamente sem teste os tipos de instrução mais propensos a falhar em uma edição real: continuidade entre múltiplos planos, falas e o retorno de um personagem nomeado. O ranking acima mostra quem segue um plano descrito. Saber se ele aguenta uma lista de planos é o próximo teste — e é um teste diferente.
Leitura relacionada: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · Prompts de movimento de câmera com IA, testados