MiniMax M3 e DeepSeek V4 Pro são suficientemente próximos em qualidade para que o fator decisivo para a maioria das equipes seja o custo — e o custo muda dependendo de como sua carga de trabalho se divide entre tokens de entrada e de saída. O M3 tem a entrada mais barata, o DeepSeek V4 Pro tem a saída mais barata, então o modelo "mais barato" muda conforme seu padrão de uso. O M3 também lê imagens e vídeo; o V4 Pro é apenas texto. Esta comparação passa primeiro pela matemática dos preços, porque é a parte que a maioria dos comparativos diretos ignora, e depois aborda onde a capacidade e a velocidade desempateiam.
O ponto de equilíbrio de custo que ninguém calcula
Ambos são modelos Mixture-of-Experts de pesos abertos com contexto de 1M de tokens, precificados por milhão de tokens. Os preços de tabela (verificados em 13 de julho de 2026) contam histórias opostas em cada lado da transação:
MiniMax M3 | DeepSeek V4 Pro | |
|---|---|---|
Entrada / 1M | $0.30 | $0.43 |
Saída / 1M | $1.20 (promo; $2.40 standard) | $0.87 |
Entrada em cache / 1M | ~$0.06 | ~$0.0036 |
M3 vence na entrada, V4 Pro vence na saída. Então, o que é mais barato depende da sua proporção de saída — a fração dos seus tokens totais que são gerados em vez de enviados.

A matemática é simples o suficiente para você mesmo verificar. Para a participação da saída x (0 a 1), o custo por milhão de tokens totais é M3 = 0.30(1 − x) + 1.20x e V4 Pro = 0.43(1 − x) + 0.87x; igualando-os, as linhas se cruzam em x ≈ 0.28. Abaixo disso — cargas de trabalho com foco em entrada — o M3 é mais barato. Acima disso, o V4 Pro é. Na prática:
Entrada pesada (M3 vence): geração aumentada por recuperação, análise de documentos longos, loops de agentes que inserem grande contexto para respostas curtas. Esses casos frequentemente executam 10–20% de saída. M3 é a chamada mais barata.
Saída pesada (V4 Pro vence): geração de conteúdo, redação de textos longos, rastros de raciocínio verbosos. Quando a geração passa de cerca de um quarto dos seus tokens, V4 Pro sai na frente.
Onde a matemática do preço muda
Dois detalhes podem deslocar o ponto de equilíbrio:
O cache de prompt favorece bastante a DeepSeek. Seu input em cache custa cerca de US$ 0,0036 por milhão contra cerca de US$ 0,06 da M3 — aproximadamente 16× mais barato. Se você reutiliza o mesmo contexto longo em muitas chamadas (um system prompt fixo, uma base de código em cache, um corpus de RAG), a precificação de cache da DeepSeek pode inverter uma carga de trabalho intensiva em input que, de outra forma, seria favorável à M3 e colocá-la a seu favor. Em termos concretos: um serviço de RAG que envia um contexto em cache de 100 mil tokens com cada resposta de 2 mil tokens paga à DeepSeek aproximadamente US$ 0,0036 × 0,1 + US$ 0,87 × 0,002 ≈ US$ 0,0021 por chamada, versus US$ 0,06 × 0,1 + US$ 1,20 × 0,002 ≈ US$ 0,0084 da M3 — cerca de 4× mais na M3, inteiramente por causa da taxa de cache. RAG com muito cache é o único caso intensivo em input em que a V4 Pro é a chamada mais barata.
O preço de saída do M3 é promocional. A tarifa de saída de $1.20 é uma promoção; a tarifa padrão é $2.40, o que reduziria muito mais o ponto de equilíbrio e tornaria o V4 Pro mais barato para quase qualquer carga de trabalho com geração significativa. Considere isso com base na tarifa que você realmente será cobrado, e não na promocional.
A velocidade também funciona ao contrário. O M3 gera em cerca de 45 tokens/seg, contra cerca de 21 do V4 Pro — quase 2× mais rápido. Para produtos interativos ou sensíveis à latência, esse throughput pode valer mais do que um desconto por token, e reduz a concorrência que você precisa provisionar.
Além do preço: capacidade, velocidade, modalidade
O custo só importa se ambos os modelos atingirem seu padrão de qualidade. Aqui eles divergem de maneiras que uma tabela de preços oculta.
Benchmarks de programação. O M3 registra 59,0% no SWE-Bench Pro e 93,5% no LiveCodeBench; o V4 Pro fica em torno de 52–55% no SWE-Bench Pro. Um ponto de atenção importante para a confiança: os números do M3 são informados pelo fornecedor, enquanto os do V4 Pro tendem a ser verificados independentemente. O M3 parece mais forte no papel, mas “informado pelo fornecedor vs. verificado independentemente” é exatamente a lacuna que você gostaria de testar nas suas próprias tarefas antes de se comprometer.
Tamanho vs eficiência. O V4 Pro é muito maior — 1,6T de parâmetros totais (49B ativos) contra 428B totais do M3 (23B ativos). O M3 pontuar mais alto em programação enquanto ativa metade dos parâmetros é o resultado mais eficiente, o que é parte do motivo pelo qual seu preço por token pode ser tão baixo.
Modalidade. M3 é nativamente multimodal: recebe entrada de imagem e vídeo juntamente com texto. V4 Pro é apenas texto. Se o seu pipeline lida com capturas de tela, documentos como imagens ou quadros de vídeo, isso não é um critério de desempate — é a decisão inteira.
Ecossistema. O DeepSeek é a opção mais madura para implantação, disponível em cerca de 14 provedores de inferência; o M3 foi lançado com bem menos. Se redundância de provedor ou buscar o host mais barato é importante para você, o V4 Pro leva vantagem hoje. Ambos publicam pesos abertos — os do M3 estão no Hugging Face, e o DeepSeek distribui o V4 Pro por meio de seus próprios canais e hosts parceiros — embora hospedar qualquer um deles em grande escala por conta própria exija hardware multi-GPU.
Qual escolher, por carga de trabalho
Escolha o MiniMax M3 se sua carga de trabalho for mais voltada para entrada (RAG, análise de contexto longo, orquestração de agentes), se você precisar de entrada de imagem ou vídeo, ou se a velocidade de geração importar. Também é a escolha mais simples quando você quer um modelo forte em vez de ficar comparando provedores.
Escolha o DeepSeek V4 Pro se sua carga de trabalho for mais voltada para saída, se você depender de cache de prompt para contexto repetido, se quiser pontuações de benchmark verificadas de forma independente, ou se valorizar um ecossistema multi-provedor maduro. Seu tier V4 Flash mais leve (284B total, 13B ativo) vale a pena considerar se você quiser a economia da DeepSeek em tarefas mais simples.
Para a maioria das equipes, a resposta honesta é rotear por tarefa: trabalhos com muita entrada e multimodais para M3, e trabalhos com muita saída e muito cache para V4 Pro. Nenhum deles é o vencedor absoluto.
O que vem a seguir
A MiniMax não está parada: relatos apontam para uma sucessora muito maior, com o suposto MiniMax M3 Pro devendo alcançar 2,7 trilhões de parâmetros e ter lançamento previsto para o 3º trimestre de 2026. Se vier com pesos abertos, a comparação acima muda — um M3 Pro de 2,7T seria voltado para uma categoria diferente da V4 Pro. Por enquanto, tanto o M3 quanto a V4 Pro são modelos em produção que você pode usar hoje.
FAQ
O MiniMax M3 é mais barato que o DeepSeek V4 Pro?
Depende da sua proporção de saída. O M3 tem entrada mais barata ($0.30 vs $0.43 por 1M) e o DeepSeek saída mais barata ($0.87 vs $1.20). Eles empatam em aproximadamente 28% de saída; abaixo disso, o M3 é mais barato, acima disso, o V4 Pro é.
Qual é melhor para programar?
O M3 apresenta benchmarks de codificação mais altos (59,0% SWE-Bench Pro vs ~52–55%), mas seus resultados são informados pelo fornecedor, enquanto os do V4 Pro são verificados independentemente. Teste ambos em seu próprio repositório antes de decidir.
Quantos parâmetros o DeepSeek V4 Pro tem?
1,6 trilhão no total, com 49B ativos por token, versus os 428B totais do M3 e 23B ativos. O V4 Pro é muito maior; o M3 é mais eficiente em termos de parâmetros.
O DeepSeek V4 Pro oferece suporte a imagens ou vídeo?
Não. O V4 Pro é apenas texto. O MiniMax M3 é nativamente multimodal e aceita entrada de imagem e vídeo.
Ambos os modelos são gratuitos e de código aberto?
Ambos publicam pesos abertos para download, mas suas licenças diferem — o M3 segue os termos do M2.7 da MiniMax, que por padrão são de uso não comercial, então verifique a licença de cada modelo antes da implantação comercial. "Peso aberto" significa baixável, não automaticamente irrestrito.
