AIREITER

MiniMax H3 vs. LTX 2.3: duelo entre modelos de vídeo com pesos abertos

Última Atualização: 2026-08-07 03:49:55

Com uma RTX 3060 de 12 GB de VRAM, a dúvida não é simplesmente qual modelo colocar na fila: MiniMax H3 ou LTX 2.3? Os dois são modelos de vídeo com pesos abertos, áudio nativo e execução local via ComfyUI. Só que um produz um clipe de 5 segundos em 1080p em menos de 40 segundos, enquanto o outro leva 11 minutos para gerar 10 segundos em 480p — e é justamente o mais lento que a comunidade no Reddit considera incomparável em física. Na prática, a escolha depende da tomada, do seu hardware e do prazo de entrega.

MiniMax H3 e LTX 2.3: comparação rápida

EspecificaçãoMiniMax H3LTX 2.3
Arquitetura33B DiT + encoder Qwen3-VL-32BBaseado em DiT, novo VAE
Resolução máxima2K4K
Duração máxima15 segundos20 segundos (10s em 4K/1440p)
ÁudioSom estéreo nativoÁudio nativo, vocoder mais limpo, endpoint de áudio para vídeo
Suporte a LoRAAinda nãoLoRAs de estilo, HDR IC-LoRA, LoRAs de personagem
Modo retratoPor controle de proporção9:16 nativo, treinado com dados em retrato
VRAM mínima (local)8 GB (quantizado em INT8)~12 GB na prática (relatos de OOM em placas menores)
LicençaMiniMax Community LicensePesos sob Apache 2.0; LTX Model License para uso comercial acima de $10M de receita
LançamentoAPI em 31 de julho de 2026; pesos em 3 de agosto de 2026Março de 2026

Os dois chegaram ao mercado de pesos abertos com poucos meses de diferença. O LTX 2.3 tem cinco meses de vantagem e um pipeline de LoRA maduro; no momento da publicação, os pesos do H3 têm apenas oito dias.

Velocidade e hardware: onde está o gargalo de verdade

Para certos pipelines, a diferença de velocidade inviabiliza o uso — e o tamanho bruto do modelo pode enganar. No papel, o H3 é maior, com 21 GB de pesos de difusão e 16 GB no encoder de texto. Ainda assim, vários usuários relatam que ele roda com mais estabilidade que o LTX 2.3 em hardware de consumo:

"Mesmo sendo tecnicamente maior que o LTX 2.3, ele roda mais rápido e tem menos problemas de memória. Recentemente testei o 2.3 de novo e fiquei incomodado com o consumo de memória." - Usuário dobomex761604 no Reddit, r/StableDiffusion

Mas estabilidade não é sinônimo de rapidez. Estes são os tempos reais de geração publicados na mesma discussão comparativa no Reddit:

HardwareModeloDuração / resoluçãoTempo real
RTX 3060 12 GBH3 (INT8)10s / 480p~11 min
RTX 3060 12 GBH3 (INT8)5s / ~480p~3-4 min
RTX 5090 24 GBH3 (completo)15s / 720p / 20 passos48 min
RTX 4080LTX 2.315s / 1080p15-20 min
RTX 4090LTX 2.35s / 1080p25-40s
RTX 4090Wan 2.2 (14B FP8)5s / 1080p90-120s

Uma dica prática do usuário srikantpatnaik: entrar no subgraph do ComfyUI e reduzir o número de passos de 20 para 10 corta cerca de 40% do tempo de geração do H3, com uma perda de qualidade administrável. Hoje, a relação entre segundos gerados e resolução é a maior fraqueza do H3.

Na VRAM, o H3 surpreende. A versão podada em INT8 distribuída pelo próprio ComfyUI funciona em placas com apenas 8 GB de VRAM e 16 GB de RAM do sistema. Segundo as anotações de teste do usuário Aadi_880, porém, isso limita o uso a resoluções pequenas, entre 0,3 e 0,4 megapixels — cerca de 480-600p — e clipes de 5 segundos. Já usuários do LTX 2.3 relatam erros frequentes de OOM em placas de 8 GB; um deles descreveu a experiência com memória como "um desastre".

Física e entendimento do prompt: vantagem clara para o H3

Se velocidade é território do LTX, compreensão de prompt é onde o H3 abre uma vantagem expressiva. Vários participantes da discussão comparativa no Reddit preferiram o H3 pela aderência ao texto e pela física:

"O MiniMax H3 é significativamente mais fácil de usar. Dá para gerar cenas bastante decentes sem escrever prompts complicados e excessivamente descritivos. Só isso já resolve a questão para mim." - Usuário nvidiot no Reddit, r/StableDiffusion

"Pelos meus testes, o Minimax entende muito bem física e segue o prompt muito bem. Ele não evita cenas explícitas, como ação ou sangue. Consigo meu resultado com 4 frases, enquanto o LTX precisava de 2 parágrafos." - Usuário Fit_Satisfaction2953 no Reddit

A diferença de física aparece especialmente na permanência dos objetos. No LTX 2.3, objetos frequentemente atravessam uns aos outros ou desaparecem no meio da cena. O H3 usa um DiT de 33B com os estados ocultos da 50ª camada do Qwen3-VL-32B como encoder de texto, e testadores da comunidade atribuem seu rastreamento espacial mais consistente a essa arquitetura maior. O usuário SX2k7 resumiu: "Com o LTX, coisas simplesmente desaparecem ou atravessam umas às outras sem motivo, vezes demais."

Usuários da mesma discussão no Reddit também afirmam que o H3 é menos censurado que LTX e Wan, permitindo cenas de ação, sangue e momentos fisicamente intensos que esses modelos filtram por padrão.

Consistência de identidade no image-to-video

O Ref2Vid (reference-to-video) do H3 se destaca na preservação de identidade. Ao fornecer uma imagem de personagem, testadores da comunidade relatam que o modelo mantém a identidade facial durante todo o clipe, mesmo quando o personagem sai do quadro e volta depois.

O modo image-to-video do LTX 2.3 melhorou nesta versão, com menos congelamentos e menos artefatos de movimento falso no estilo Ken Burns. Ainda assim, a deriva de identidade continua sendo um problema conhecido:

"Sim, testei um I2V em que o personagem ficou fora do quadro por 10 segundos e olhou de volta no final; o rosto era idêntico. O LTX seria tipo: 'quem é esse?'" - Usuário kemb0 no Reddit

Para tomadas de produto, consistência de personagens e trabalhos de marca em que o mesmo rosto precisa se manter por um clipe de 10 segundos, o Ref2Vid do H3 é a opção mais forte entre os modelos de pesos abertos.

Fluxos com LoRA reativos a áudio: o trunfo de personalização do LTX

É aqui que o LTX 2.3 ainda mantém uma vantagem estrutural que o H3 não consegue igualar. O ecossistema LTX teve meses para acumular ferramentas personalizadas:

  • LoRAs de estilo: Ajuste fino do modelo para uma estética visual específica, como stop-motion, artesanal ou miniatura, com troca por tomada
  • HDR IC-LoRA: Geração direta em HDR com alcance dinâmico ampliado ou conversão de material SDR para EXR em pipelines de finalização
  • Endpoint de áudio para vídeo: Você fornece um clipe de áudio e o LTX gera imagens correspondentes — útil para conteúdo guiado por música e clipes sociais em que a sincronia entre som e movimento importa
  • Fluxos seedhunter e director no ComfyUI: Pipelines de múltiplas passagens criados pela comunidade, que iteram sementes para encontrar a melhor saída e depois refinam a composição
  • 9:16 nativo para retrato: Treinado em dados de orientação vertical, não recortado de paisagem — algo crítico para conteúdo social vertical
  • Opções de 24/48 FPS: Flexibilidade de taxa de quadros para atender às especificações de entrega

O fluxo do H3 é comparativamente enxuto: texto para vídeo, imagem para vídeo e referência para vídeo com áudio. Não há pipeline de treinamento de LoRA, adaptadores de estilo nem saída HDR. Como o modelo tem apenas oito dias no momento da publicação, essas lacunas podem ser preenchidas — mas, hoje, criadores com bibliotecas de LoRAs do LTX e graphs de ComfyUI já ajustados enfrentam um custo real para migrar.

O usuário l2ddit resumiu bem essa tensão: "Estou muito feliz por agora poder apagar todos aqueles loras do LTX que não faziam nada para corrigir os problemas. A única coisa que o LTX fazia melhor era sincronizar vozes que não são em inglês."

Quanto custa: execução local versus API

Rodar qualquer um dos dois localmente não tem custo de licença, mas tempo é o custo real. Em APIs hospedadas, a diferença de preço é grande:

EndpointLTX 2.3 (fal.ai)MiniMax H3 (hospedado)
Texto para vídeo em 1080p$0.06/sAinda não publicado via API
Texto para vídeo em 4K/2K$0.24/s (4K)Ainda não publicado via API
Variante Fast em 1080p$0.04/sN/A
Áudio para vídeo$0.10/sIncluído com o vídeo
Imagem para vídeo$0.06-0.24/sIncluído com o vídeo
Extend / Retake$0.10/sAinda não disponível

Em um orçamento concreto, um clipe de 5 segundos em 1080p com LTX 2.3 via fal.ai custa $0.30. A variante Fast reduz esse valor para $0.20. O preço da API hospedada do MiniMax H3 ainda não havia sido publicado publicamente no momento da publicação. Localmente, ambos são gratuitos para rodar, mas os 11 minutos de renderização do H3 em uma 3060 acrescentam um custo real de iteração.

Os pesos do LTX 2.3 estão disponíveis no HuggingFace sob Apache 2.0; a LTX Model License rege a incorporação comercial para empresas com receita anual acima de $10M. Os pesos do H3 estão no HuggingFace sob a MiniMax Community License. Ambos permitem uso local e offline. Os preços de API do LTX 2.3 foram obtidos na página do modelo no fal.ai.

Como direcionar cada tomada na produção

A maioria dos criadores não precisa escolher um único modelo. Um pipeline híbrido aproveita os pontos fortes de cada um:

Use o H3 quando:

  • A tomada exige física complexa — colisões, movimentos rápidos ou interações físicas
  • A identidade do personagem precisa se manter ao longo de um clipe extenso, como em revelações de produto e cenas narrativas
  • Você quer áudio estéreo nativo sem uma etapa separada de som
  • Prompts mais simples são importantes, com 4 frases em vez de 2 parágrafos
  • Sua GPU está na faixa mais baixa, com 8-12 GB de VRAM, e você pode aceitar renderizações mais longas

Use o LTX 2.3 quando:

  • Você precisa iterar rapidamente em storyboards, testes de timing ou prévias
  • Uma LoRA personalizada define seu estilo visual
  • A entrega é conteúdo social vertical em 9:16
  • Resolução 4K é obrigatória, já que o H3 para em 2K
  • Você precisa sincronizar vídeo a um áudio existente que conduza os visuais
  • Velocidade importa mais que a máxima qualidade por quadro

Um fluxo prático é usar o LTX Fast para validar blocking e timing, depois colocar a tomada aprovada na fila do H3 para a renderização final, com física, identidade e áudio. Faça o upscale apenas depois de aprovar a tomada. Como refazer um render no H3 custa tempo, vale acertar a cena antes.

Perguntas frequentes

MiniMax H3 é melhor que LTX 2.3?

O H3 vence em qualidade, aderência ao prompt e preservação de identidade. O LTX 2.3 ganha em velocidade, personalização com LoRA e saída em 4K. Direcione pelo tipo de tomada, não pela marca.

O MiniMax H3 roda em GPUs de consumo?

Sim. A versão podada em INT8 roda com 8 GB de VRAM + 16 GB de RAM em cerca de 480-600p e 5 segundos. A versão em precisão total se beneficia de 24 GB de VRAM.

O H3 suporta ajuste fino com LoRA?

Ainda não. Desde o lançamento dos pesos em 3 de agosto de 2026, o H3 não tem pipeline de LoRA. O LTX 2.3 suporta LoRAs de estilo, HDR IC-LoRAs e LoRAs de personagem.

Qual modelo tem o melhor áudio?

Os dois geram áudio nativo. O H3 produz som estéreo com detalhes ambientes mais ricos. O LTX 2.3 melhorou seu vocoder para uma saída mais limpa e oferece um endpoint de áudio para vídeo, que gera imagens a partir de um clipe de áudio de entrada.

Quanta VRAM preciso para cada modelo?

H3 INT8: mínimo de 8 GB de VRAM + 16 GB de RAM para 480p. O H3 em precisão total se beneficia de 24 GB de VRAM. LTX 2.3: mínimo prático de ~12 GB de VRAM, com relatos de OOM em placas de 8 GB.