O MiniMax H3 aposta em uma combinação que ainda não é comum: vídeo em 2K nativo, áudio gerado junto com a imagem e amplo controle por referências, por US$ 0,13 a cada segundo produzido. Apresentado pela MiniMax na WAIC 2026, o modelo aceita texto, imagens, vídeo e áudio como entrada e gera clipes de até 15 segundos. Não confunda com o M3, modelo de linguagem que aparece repetidamente nos resultados de busca. A proposta não é entregar os frames mais nítidos do mercado — o Kling já oferece 4K nativo —, mas reunir 2K, áudio e controle avançado de referências por cerca de um quarto da tarifa do Sora 2 Pro.
Há uma ressalva importante. Os pesos foram disponibilizados publicamente em 28 de julho de 2026, mas o download é do H3-Base, limitado a 768p. A etapa em 2K e a camada de processamento de entrada, que a MiniMax considera essencial para a qualidade final, continuam nos servidores da empresa. Na prática, hospedar o modelo por conta própria dá acesso à maior parte do H3, mas não à versão descrita no marketing.
MiniMax H3: modelo de vídeo, não M3
O MiniMax H3 é da MiniMax (稀宇科技), empresa sediada em Xangai e responsável pela linha de vídeo Hailuo. No site oficial, ele aparece com o selo "Next-Generation Open-Weights" e data de julho de 2026.
A confusão recorrente é com o M3, um modelo de linguagem e programação de cerca de 428 bilhões de parâmetros (23B ativados), com contexto de 1 milhão de tokens. Os pesos dele estão no HuggingFace, ao lado dos do H3. M3 é texto; H3 é vídeo. Ambos foram lançados na mesma WAIC 2026, o que ajuda a explicar por que o recurso "People Also Ask" do Google responde a uma busca por H3, como "Is MiniMax 3 free?", usando informações do M3. "Hailuo 3.0" é um nome usado por terceiros: o site da MiniMax chama o produto apenas de "MiniMax H3", na mesma linhagem de Hailuo 02 e Hailuo 2.3.
A MiniMax também não é uma novata: seu IPO em Hong Kong, em janeiro de 2026, levantou cerca de US$ 619 milhões, com avaliação próxima de US$ 4 bilhões e apoio de investidores como Alibaba e Tencent.
Especificações confirmadas: 2K, até 15 segundos e áudio sincronizado
No papel, o H3 gera clipes de 4 a 15 segundos, apenas em durações inteiras, em 2K nativo e 24 quadros por segundo fixos. O áudio estéreo — diálogos, efeitos e ambientação — sai na mesma geração, sem ser adicionado depois. Também há uma modalidade de 768P. Os dados vêm da documentação da API da MiniMax, verificada em 4 de agosto de 2026.
| Especificação | Valor |
|---|---|
| Resolução nativa | 2K (modalidade 768P disponível) |
| Duração do clipe | 4–15 segundos |
| Taxa de quadros | 24 FPS |
| Áudio | estéreo nativo, na mesma geração |
| Primeiro/último quadro | 0, 1 ou 2 imagens |
| Omni-reference | ≤9 imagens, ≤3 vídeos, ≤3 áudios; máximo de 12 arquivos |
| Proporções | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, além de adaptativa |
| Limites de arquivo | vídeo ≤50MB, imagem ≤30MB, áudio ≤15MB |
| Tamanho do prompt | até 7.000 caracteres |
É no recurso "omni-reference" que o H3 concentra sua complexidade. Ele aceita simultaneamente até nove imagens, três clipes de vídeo e três clipes de áudio, usados como guias de estilo, personagem, movimento ou voz, em vez de keyframes obrigatórios. O mesmo modelo faz sincronização labial, transferência de timbre de voz e edição por instruções: é possível trocar personagem, objeto, fundo ou elemento de VFX descrevendo a alteração, sem recomeçar a geração do zero.
Quanto custa o H3: valores oficiais, não rumores
A MiniMax divulga preços por segundo em sua página de preços: em 2K, o H3 custa US$ 0,13 por segundo gerado; em 768P, US$ 0,08. A entrada de áudio não custa nada, as primeiras cinco imagens de referência são gratuitas e cada imagem extra custa US$ 0,04. Há dois custos fora dessa tarifa principal: regenerar um clipe finalizado em 768P para 2K é cobrado separadamente a US$ 0,05/s e refatura as entradas originais; já o H3-Context-IR, etapa de processamento de entrada que a MiniMax recomenda executar, é cobrado por tokens, a US$ 0,90/M na entrada e US$ 3,60/M na saída. Portanto, o orçamento deve ficar acima de US$ 0,13/s, e não exatamente nesse valor. Dados verificados em 4 de agosto de 2026.
Em relação ao antecessor, a modalidade 2K custa mais por segundo que o Hailuo 2.3 em 1080P, cerca de US$ 0,082/s, enquanto a de 768P agora sai ligeiramente mais barata. Nenhuma dessas comparações é direta: o Hailuo 2.3 não tinha áudio nativo nem omni-reference. No mercado mais amplo, é na tarifa por segundo que o argumento de valor do H3 se sustenta.
"Em 2K, o preço por segundo do H3 é menos de um terço do praticado pelos modelos convencionais e, em 768p, custa menos da metade do preço dos modelos convencionais em 720p." — discussão no r/LocalLLaMA
Os números confirmam essa leitura. Os US$ 0,13/s do H3 em 2K equivalem a aproximadamente um quarto dos cerca de US$ 0,50/s que agregadores de terceiros informam para o Sora 2 Pro em 1080P. O rival mais barato, Veo 3.1 Lite, custa cerca de US$ 0,03/s, mas não inclui áudio; portanto, é um produto diferente. Na faixa de 2K com áudio, o H3 é a opção confiável mais barata.
H3 contra Veo 3.1, Kling 3.0, Seedance 2.0, Sora 2 Pro e Hailuo 2.3
O H3 não lidera em fidelidade bruta, e a MiniMax não finge que lidera. A oferta é a combinação de 2K, áudio nativo, controle generoso por referências e preço. É uma proposta centrada em controle e áudio, não em resolução, já que vários concorrentes oferecem 4K nativo.
| Modelo | Resolução | Clipe máximo | Áudio | Controle por referências | US$/s na API |
|---|---|---|---|---|---|
| MiniMax H3 | 2K nativo | 15s | nativo, na mesma geração | 9 img + 3 vid + 3 áud | US$ 0,13 (2K) |
| Veo 3.1 | até 4K | ~8s | diálogo em 48kHz | limitado | a partir de US$ 0,03 (Lite, sem áudio) |
| Kling 3.0 | 4K nativo | ~10s | sim | limitado | varia |
| Seedance 2.0 | até 1080P | 10s | sim | limitado | varia |
| Sora 2 Pro | 1080P | até ~25s | sim | limitado | ~US$ 0,50 (agregador) |
| Hailuo 2.3 | 1080P | ~10s | não nativo | nenhum | ~US$ 0,082 |
Kling 3.0 e Seedance 2.0 não têm uma tarifa pública de API por segundo comparável à divulgada pela MiniMax, por isso as células indicam "varia". O preço do Sora vem de um agregador de terceiros, não de uma tarifa oficial da OpenAI.
A ficha técnica não mostra por completo onde o H3 chegou. Nas arenas de preferência cega da Artificial Analysis, consultadas em 4 de agosto de 2026, ele ocupa o primeiro lugar em edição de vídeo (Elo 1.130 em 8.223 votos), o segundo em texto para vídeo com áudio (1.234 em 6.077 votos, atrás apenas do Gemini Omni Flash) e o terceiro em imagem para vídeo (1.187), categoria na qual seu intervalo de confiança se sobrepõe ao dos dois primeiros. É o modelo de pesos abertos mais bem colocado nas três listas. No mesmo ranking de texto para vídeo, Kling 3.0 1080p aparece em oitavo, com 1.109, e Veo 3.1 em décimo primeiro, com 1.093: ambos superam o H3 em resolução, mas ficam abaixo dele na preferência dos espectadores.
Na prática, a escolha se divide de forma clara. Para 4K nativo, as alternativas são Kling 3.0 ou Veo 3.1. Se áudio for a prioridade, o Seedance 2.0 é uma opção focada nesse recurso. O H3 tem, entre os modelos listados aqui, o menor preço por segundo para material em 2K com som sincronizado e controle por múltiplas referências. O mercado também está encolhendo: a versão web e o app do Sora foram encerrados em 26 de abril de 2026, e o fim da API está previsto para 24 de setembro.
O H3 tem pesos abertos?
Sim, mas com uma ressalva que define se vale a pena hospedar o modelo localmente. Os pesos estão públicos em MiniMaxAI/MiniMax-H3, sem acesso restrito, sob a H3 Community License da própria MiniMax, e não Apache ou MIT. Portanto, leia os termos da licença antes de usá-lo comercialmente. O H3-Base é distribuído em dois checkpoints BF16: FL2VA, para texto e tarefas com primeiro/último quadro, e Ref2VA, para tarefas omni-reference. O gerador é um transformer denso de fluxo único com 33B, e o codificador de texto é o Qwen3-VL-32B completo.
Dois módulos continuam fechados, justamente os que sustentam as especificações de destaque. O H3-Regenerate-2K, que cria 2K regenerando no contexto a saída de 768p do próprio H3, ainda "não foi disponibilizado como open source", segundo o model card. O H3-Context-IR, camada hospedada que interpreta instruções multimodais antes da geração, ficou de fora porque abrange diversos serviços hospedados; a MiniMax o define como "crítico para a qualidade do resultado final". A primeira versão também não inclui inferência com atenção esparsa: a inferência local usa atenção completa.
A implantação de referência oficial usa quatro GPUs por meio do SGLang. Há suporte para vLLM, diffusers e um tutorial oficial do ComfyUI, além de templates de fluxo de trabalho T2V e R2V. É um lançamento genuinamente aberto, mas não é o mesmo produto da API em 2K.
Como acessar o MiniMax H3
O H3 está disponível pela API da MiniMax, no endpoint video-generation-v2, e pelo MiniMax Hub. Não há lista de espera pública para acessá-lo.
Ele também está no AIReiter desde agosto de 2026, cobrindo os mesmos tipos de geração oferecidos pela API oficial: texto para vídeo, primeiro/último quadro e referência para vídeo. A terceira opção é hospedar localmente, em 768p e sem cobrança por segundo.
Limitações que o H3 ainda tem
As vitórias do MiniMax H3 nas arenas medem a preferência dos espectadores entre clipes curtos; elas não dizem se o modelo aguenta uma edição de produção. Além disso, os vídeos de demonstração em circulação são fornecidos pelo fabricante, não testes independentes. Por isso, cada afirmação sobre a qualidade de saída do H3 neste texto é atribuída a uma fonte, em vez de ser apresentada como uma medição.
As limitações relatadas em coberturas de acesso antecipado — variação de personagens entre cortes, diálogos pouco confiáveis, artefatos em textos e marcas exatas, controle detalhado limitado e instabilidade típica de acesso antecipado — são comuns em um modelo neste estágio. Também explicam por que uma geração impressionante não basta para escolher um modelo. Guarde os clipes que falharam como evidência, junto com os que deram certo.
"Tive acesso antecipado ao novo modelo de vídeo omni H3 da MiniMax, e ele é uma surpresa positiva! Eu o colocaria no mesmo nível de VEO, Kling..." — testador de prévia para criadores
Perguntas frequentes
MiniMax H3 é o mesmo que M3?
Não. H3 é um modelo de geração de vídeo; M3 é um modelo de linguagem e programação com cerca de 428 bilhões de parâmetros. Eles foram lançados no mesmo evento e pertencem à mesma empresa, por isso os resultados de busca os confundem.
O MiniMax H3 é open source?
Os pesos do H3-Base são públicos no HuggingFace sob a licença comunitária própria da MiniMax, e não uma licença open source padrão. O módulo de regeneração em 2K e a camada de pré-processamento Context-IR não foram liberados; por isso, uma instalação local gera em 768p.
Quanto custa o MiniMax H3?
US$ 0,13 por segundo gerado em 2K e US$ 0,08 em 768P pela API oficial, mais US$ 0,05/s ao regenerar um clipe de 768P para 2K e cobranças por tokens da etapa Context-IR. A entrada de áudio é gratuita, assim como as primeiras cinco imagens de referência.
Posso usar o MiniMax H3 no AIReiter?
Sim. O MiniMax H3 está no AIReiter desde agosto de 2026, com texto para vídeo, primeiro/último quadro e referência para vídeo.
O H3 é melhor que Veo ou Kling?
Não em resolução bruta: Kling e Veo oferecem 4K nativo. Consulte a tabela comparativa acima: o H3 troca 4K por áudio gerado na mesma passagem e controle mais rico de referências, a um preço menor por segundo.
Quando posso baixar os pesos do H3?
Agora. O H3-Base foi publicado no HuggingFace em 28 de julho de 2026. Não há data informada para o H3-Regenerate-2K, necessário para uma instalação local gerar em 2K.
A questão em aberto mudou: hoje já é possível hospedar o H3 por conta própria, mas apenas sua metade em 768p, e a MiniMax não informou quando o módulo de 2K será lançado. Se essa diferença vale US$ 0,13 por segundo depende de quanto do seu trabalho precisa ser entregue em 2K.