AIREITER

Preço da API do Mistral Large 4: o que o preview realmente oferece

Última Atualização: 2026-10-06 18:53:17

Um contexto de 1 milhão de tokens e uma tarifa de US$ 0,68 por milhão de tokens de entrada fazem o Mistral Large 4 parecer barato demais para um modelo com 1 trilhão de parâmetros. O detalhe é que ainda estamos falando de um preview público: não há uma data clara para o fim do preço promocional, os limites dos gateways variam em relação à especificação divulgada e a licença dos futuros pesos ainda não foi publicada.

A decisão em um minuto

Vale testar o Mistral Large 4 agora se você precisa de uma API barata, com contexto longo, para documentos, repositórios de código ou fluxos de trabalho que usam ferramentas. Ainda é cedo para tratá-lo como substituto estável para implantação própria ou como líder comprovado em benchmarks de programação.

NecessidadeDecisão
Testar documentos longos ou bases de código grandes por uma APITeste agora, monitorando a taxa de acerto do cache e o custo de saída
Precisa de um preço previsível no longo prazoEspere ou reserve orçamento para a tarifa mais alta de US$ 1,36 na entrada e US$ 4,18 na saída
Precisa de implantação privadaEspere pelos pesos, pela licença, pela quantização e pelas orientações de serving
Precisa da melhor pontuação em programaçãoNão escolha apenas com base nos números do lançamento; rode o mesmo harness nas suas tarefas

Esta é uma decisão sobre uma API em preview público, não um veredito definitivo sobre o modelo. A Mistral anunciou o preview em 6 de outubro de 2026, e seus materiais públicos dizem que os pesos estão planejados para o fim de outubro. (Anúncio da Mistral)

O que está disponível de fato em 6 de outubro

O Mistral Large 4 está disponível como API em preview público por meio do Mistral Studio. A Mistral o descreve como um modelo multimodal nativo, baseado em mixture of experts, com 1,05 trilhão de parâmetros totais e 49 bilhões de parâmetros ativos por token. O anúncio oficial também menciona chamadas de função, saídas estruturadas, perguntas e respostas sobre documentos, processamento em lote, agentes e ferramentas integradas.

O modelo também aparece listado como mistralai/mistral-large-4-0 na OpenRouter. Portanto, o acesso pela OpenRouter já não é apenas um rumor do dia do lançamento. Limites, latência, cobrança e política de fallback podem variar conforme a rota.

A API está ativa, mas os pesos para download e a licença final ainda não estão disponíveis. “Open weight” não deve ser interpretado como código aberto comercial irrestrito até que a Mistral publique o model card e os termos de uso.

O preço aparece em dois níveis — e há um motivo

As tarifas atuais do preview, exibidas na documentação do modelo da Mistral, são bastante atraentes:

Tipo de tokenTarifa do previewPossível tarifa pós-preview exibida nos materiais de lançamento
EntradaUS$ 0,68 / 1 milhão de tokensUS$ 1,36 / 1 milhão de tokens
Entrada em cacheUS$ 0,07 / 1 milhão de tokensUS$ 0,14 / 1 milhão de tokens
SaídaUS$ 2,09 / 1 milhão de tokensUS$ 4,18 / 1 milhão de tokens

Os valores mais baixos são apresentados como preços promocionais de 50% durante o preview na página do gateway da Vercel e em outras páginas de acesso ao modelo, mas nenhuma data de encerramento é informada. Considere US$ 0,68 e US$ 2,09 como as tarifas atuais, não como um contrato permanente.

Em uma carga de trabalho com 500.000 tokens de entrada sem cache e 100.000 tokens de saída, a cobrança do preview fica em aproximadamente US$ 0,55: US$ 0,34 pela entrada mais US$ 0,209 pela saída. Se a entrada estiver em cache, o total cai para cerca de US$ 0,244: US$ 0,035 pela entrada em cache mais US$ 0,209 pela saída. Antes de migrar tráfego de produção, avalie o reaproveitamento do cache, o volume de saída e a durabilidade do desconto.

Contexto e recursos dependem da rota usada

A documentação do modelo da Mistral descreve uma janela de contexto de 1 milhão de tokens. Essa é uma especificação do modelo, não necessariamente o limite exposto por todos os gateways.

A página do AI Gateway da Vercel lista atualmente uma janela de contexto compartilhada de 524 mil tokens e uma saída máxima de 262 mil tokens para seu provedor Mistral. A página também informa tempo P50 até o primeiro token de 0,9 segundo, 38 tokens por segundo e uma taxa de acerto de cache de 74%, com base no tráfego do gateway.

Preços e métricas do provedor no gateway do Mistral Large 4

Esses são números específicos da rota, não garantias universais do modelo. A página documenta entrada de imagens, chamadas de ferramentas, APIs Chat Completions e Responses compatíveis com a OpenAI e acesso Messages compatível com a Anthropic. O ID do gateway é mistral/mistral-large-4, diferente do identificador qualificado do provedor usado pela OpenRouter.

Em uma integração, confirme o contexto compartilhado do endpoint, o limite de saída, o cálculo de imagens e tokens, o comportamento das ferramentas, a política de cache, o roteamento entre provedores e as regras de fallback. A marca de 1 milhão de tokens é útil para uma triagem inicial, mas não basta para dimensionar uma aplicação.

O que as evidências dos benchmarks permitem concluir

A análise de lançamento da TechsCurrent relata os números divulgados pela Mistral: 61,7% no DeepSWE v1.1, 28,3% no Terminal-Bench 4 e 59,9% no AutomationBench. A comparação de lançamento da CellCog cita 74,2 para o DeepSeek V4.1 Flash no DeepSWE e 61,7 para o Mistral Large 4, enquanto o número do Mistral no AutomationBench é superior ao das linhas usadas na comparação. São sinais divulgados pelo fornecedor ou reunidos de fontes diferentes, não resultados de um único ranking padronizado.

Antes de usar o modelo em agentes de produção, faça uma avaliação controlada:

  1. Use o mesmo repositório, prompt, ferramentas e tempo limite para o Mistral Large 4 e o modelo atual.
  2. Meça conclusão das tarefas, erros nos argumentos das ferramentas, novas tentativas, latência, tokens de saída e custo.
  3. Inclua casos de recuperação em contexto longo nos quais a resposta apareça no meio e perto do fim da entrada.
  4. Repita o teste com contexto em cache e sem cache.
  5. Mantenha os resultados do preview separados dos resultados obtidos após o futuro lançamento dos pesos.

Quem já pode usar o modelo

Equipes API-first com contexto recorrente e volumoso: Testem o Mistral Large 4 agora. A tarifa de US$ 0,07 por milhão de tokens de entrada em cache pode fazer diferença quando um agente envia repetidamente o mesmo prefixo de política, repositório ou documento. Defina um teto de gastos para o experimento, porque a tarifa mais alta continua sendo uma possibilidade real.

Equipes que desenvolvem fluxos de documentos com imagens: Testem a entrada de imagens e a extração de documentos na rota que pretendem usar em produção. O modelo aceita imagens, mas os limites de arquivos e os detalhes de cobrança específicos da rota ainda precisam ser verificados.

Equipes de agentes de programação: Tratem o modelo como candidato, não como vencedor automático. Os benchmarks divulgados são mistos, e a confiabilidade real depende das chamadas de ferramentas, das novas tentativas e da taxa de conclusão.

Equipes preocupadas com privacidade ou interessadas em hospedar o modelo: Esperem pelos pesos e pela licença. O número de 49 bilhões de parâmetros ativos não significa que o checkpoint completo seja pequeno; o modelo total ainda precisará ser armazenado e servido. Hardware, quantização, throughput e direitos de redistribuição continuam sem definição.

FAQ sobre a API do Mistral Large 4

O Mistral Large 4 já é open source?

Não. No lançamento, a licença final e os pesos para download ainda não estavam disponíveis. A Mistral planejava liberar os pesos até o fim de outubro de 2026, mas o termo “open weight”, por si só, não define os direitos comerciais ou de redistribuição.

O preço de US$ 0,68 é permanente?

Não há uma data de encerramento informada. Faça os testes considerando as tarifas atuais de US$ 0,68 na entrada e US$ 2,09 na saída, mas modele também os valores de US$ 1,36 e US$ 4,18.

A janela de contexto é de 1 milhão ou 524 mil tokens?

A Mistral documenta um contexto de 1 milhão de tokens para o modelo; a Vercel lista 524 mil tokens de contexto compartilhado em sua rota de gateway. Confirme o limite do provedor e do formato de API que você pretende chamar.

O modelo já está na OpenRouter?

Sim. A OpenRouter lista atualmente o modelo mistralai/mistral-large-4-0. Consulte a página atualizada antes da implantação, pois o roteamento de um preview pode mudar.

Ele processa imagens e usa ferramentas?

A documentação oficial e a do gateway descrevem entrada de imagens e chamadas de ferramentas. Teste o formato da requisição, os limites de imagem, o cálculo de tokens e o comportamento diante de chamadas de ferramentas malformadas na rota escolhida.

Devo hospedar o modelo quando os pesos forem liberados?

Não automaticamente. Espere pela licença, pelos formatos dos checkpoints, pelas opções de quantização, pelos requisitos de memória, pelos dados de throughput e por uma configuração de serving de referência.

O próximo teste que vale a pena fazer

Monte uma avaliação com 20 tarefas antes de direcionar tráfego real: cinco tarefas de recuperação em contexto longo, cinco alterações de código, cinco perguntas sobre imagens e documentos e cinco tarefas de chamada de ferramentas. Registre a taxa de sucesso, as novas tentativas, o tempo até o primeiro token, a latência total, os tokens de entrada, cache e saída e o custo efetivo por tarefa concluída.

Fontes: documentação do modelo da Mistral, anúncio da Mistral, Vercel AI Gateway, página do modelo na OpenRouter, TechsCurrent, CellCog.