AIREITER

Qwen 3.8 Max vs Kimi K3: saída mais barata, Kimi programa melhor (2026)

Última Atualização: 2026-08-06 07:45:15

Dois modelos chineses de ponta com arquitetura mixture-of-experts, contexto de um milhão de tokens e raciocínio no esforço máximo ativado por padrão — mas com custos bastante diferentes. O Kimi K3 é a opção mais forte para programação, porém cobra US$ 15 por milhão de tokens de saída: 2,5x os US$ 6 do Qwen 3.8 Max. Já o Qwen 3.8 Max, em disponibilidade geral desde 3 de agosto de 2026, é a escolha mais nova e econômica, além de levar vantagem em gráficos e uso de computador. A contrapartida é que os dois raciocinam intensamente por padrão: no Kimi K3, a tarifa maior de saída pesa em cada requisição; e os pesos abertos do Qwen só devem chegar por volta de 11 de agosto.

Modelos muito parecidos no papel, com escolhas bem diferentes na prática

Qwen 3.8 Max e Kimi K3 são modelos mixture-of-experts de trilhões de parâmetros, com janelas de contexto de um milhão de tokens e visão nativa. Foram lançados com apenas três semanas de diferença em meados de 2026. As especificações os colocam na mesma faixa, o que faz muitas comparações virarem uma troca interminável de benchmarks. Na prática, a decisão é mais objetiva: quanto você aceita pagar a mais em saída para ganhar qualidade em programação, e se precisa agora de pesos abertos ou de multimodalidade mais forte.

EspecificaçãoQwen 3.8 MaxKimi K3
Parâmetros totais2.4T2.8T
Ativos por token~95B104B
ArquiteturaMoE (~4% ativos)MoE (16 de 896 especialistas)
Janela de contexto~1M (991K de entrada máxima)1,048,576
VisãoSim (entrada de texto + imagem)Sim (nativa)
Raciocínio padrãoxhigh, thinking ativadoesforço máximo, reasoning ativado
Pesos abertosNão (previsão de ~11 de agosto)Sim (HF, 27 de julho, 1.56TB MXFP4)
Status da APIGA, 3 de agosto de 2026GA

Fontes: comparativo direto da yottalabs, Alibaba QwenCloud via AIReiter e Moonshot platform.kimi.ai, verificados em 6 de agosto de 2026.

Preços, custo por carga de trabalho e acesso

Os dois fornecedores divulgam preços por token, mas a maior diferença não está onde a contagem de parâmetros sugere. Ela se concentra nos tokens de saída, justamente onde modelos de raciocínio consomem grande parte do orçamento. O Kimi K3 cobra US$ 15 por milhão de tokens de saída, contra US$ 6 do Qwen 3.8 Max. Como ambos expõem o raciocínio por padrão, essa cobrança vale tanto para os traços de raciocínio quanto para a resposta final.

Preço por 1M de tokensQwen 3.8 MaxKimi K3
Entrada (sem cache)US$ 2.00US$ 3.00
Entrada (com cache)US$ 0.25US$ 0.30
Saída (inclui thinking)US$ 6.00US$ 15.00
Contexto~1M1,048,576

Fontes: página de modelos Alibaba QwenCloud, atualizada em 2 de agosto de 2026, e Moonshot platform.kimi.ai/docs/pricing/chat-k3, verificados em 6 de agosto de 2026.

Preços oficiais da API Kimi K3 na plataforma Moonshot: US$ 3.00 por milhão de tokens de entrada sem cache, US$ 0.30 para leitura de cache, US$ 15.00 de saída e contexto de 1,048,576 tokens

Em uma carga típica de programação — 20M de tokens de entrada, 60% de cache hit e 5M de tokens de saída — o Kimi K3 custa cerca de US$ 103, sendo US$ 27.60 de entrada e US$ 75 de saída. No Qwen 3.8 Max, o total fica perto de US$ 49: US$ 19 de entrada e US$ 30 de saída. A diferença de 2x vem quase toda da saída. O cache reduz a distância na entrada, mas não altera a tarifa de saída; e, como os dois usam raciocínio máximo por padrão, essa parcela tende a ser grande.

O acesso também não é igual. O Qwen 3.8 Max entrou em disponibilidade geral na API da Alibaba em 3 de agosto de 2026, mas seus pesos ainda não são públicos. A página do modelo continua indicando Open Source: No, com previsão de publicação no Hugging Face e no ModelScope na semana de 11 de agosto (Alibaba, via a página de preços do Qwen 3.8 Max). O Kimi K3 é a alternativa aberta: a Moonshot publicou o checkpoint MXFP4 de 1.56 TB em 27 de julho, e a API já está disponível.

O Kimi K3 também pode ser acessado pelo endpoint de API Kimi K3 da AIReiter, pela tarifa oficial da Moonshot e sem markup. É útil para testar o K3 ao lado de outros modelos em uma única fatura. O Qwen 3.8 Max ainda não foi integrado ao serviço.

Kimi K3 é superior em programação agêntica

Para programação em várias etapas — loops de agentes, refatorações de repositórios e tarefas no estilo SWE que exigem chamadas de ferramentas e recuperação após becos sem saída — o Kimi K3 é a melhor escolha. Ele supera o Qwen 3.8 Max de forma consistente nos benchmarks públicos de agentes, com uma margem maior justamente nas tarefas mais próximas do trabalho real de engenharia.

Benchmarks diretos: Kimi K3 lidera no TerminalBench 2.1, FrontierSWE e CharXiv-com-ferramenta; Qwen 3.8 Max lidera no CharXiv-sem-ferramenta e PerceptionBench
BenchmarkQwen 3.8 MaxKimi K3
FrontierSWE73.581.2
TerminalBench 2.186.688.3
CharXiv (com ferramenta)88.491.3

Fonte: comparativo direto da yottalabs, verificado em 6 de agosto de 2026.

A percepção da comunidade acompanha os números, com a ressalva de custo que define esta comparação:

"O K3 está em outro nível. O Qwen 3.8 é quase parecido com ele. Ainda assim, os custos de assinatura ou API não se justificam para nenhum dos modelos como estão..." — r/Qwen_AI

"O K3 supera o Qwen 3.8 de longe neste exercício; o Qwen foi 3 vezes mais rápido que o Kimi para gerar esta landing page." — @filicroval no X

O Kimi K3 também tem uma pontuação bruta de inteligência mais alta: 57 no Artificial Analysis Intelligence Index. Por outro lado, é lento: cerca de 39 tokens de saída por segundo e 3.1 segundos até o primeiro token (Artificial Analysis). A troca aqui é qualidade e abertura em troca de mais latência e custo.

Qwen 3.8 Max entrega mais em multimodalidade e custo-benefício

O Qwen 3.8 Max faz mais sentido quando a carga de trabalho depende de interpretar gráficos, capturas de tela ou controlar um navegador, e quando o custo de saída importa mais do que extrair os últimos pontos em benchmarks de programação. Ele supera o Kimi K3 em avaliações de documentos e percepção, mantém um recorde verificado em um benchmark de uso de computador e cobra 40% da tarifa de saída do Kimi K3.

BenchmarkQwen 3.8 MaxKimi K3
CharXiv (sem ferramenta)93.584.8
PerceptionBench63.558.5
OSWorld-Verified86.1% (SOTA)sem pontuação pública

Fonte: comparativo direto da yottalabs, verificado em 6 de agosto de 2026.

O ponto fraco do Qwen 3.8 Max é exatamente a área em que o Kimi K3 se destaca e se aproxima dos modelos fechados de fronteira. No SWE-bench Pro, ele marca 67.7, bem abaixo dos 80 do Claude Fable 5 (tabela publicada pela Alibaba, executada pelo fornecedor). Portanto, não é o modelo indicado para as avaliações mais difíceis de engenharia de software. Sua API tinha apenas três dias no momento da publicação, já que a disponibilidade geral chegou em 3 de agosto de 2026, e seus pesos ainda são fechados. Quem precisa de self-hosting hoje terá de esperar ou escolher o Kimi K3.

Qual modelo escolher para cada carga de trabalho

A escolha certa depende menos de qual é objetivamente melhor e mais do tipo de tarefa que você vai enviar ao modelo. A tabela abaixo associa cargas de trabalho comuns à recomendação e ao motivo verificado.

Se sua carga de trabalho é…EscolhaPor quê
Loops de agentes, refatorações de repositórios, tarefas SWE (custo não é a restrição)Kimi K3FrontierSWE 81.2 vs 73.5, TerminalBench 88.3 vs 86.6
Leitura de documentos/gráficos, navegador ou uso de computador, com sensibilidade a custoQwen 3.8 MaxCharXiv 93.5, OSWorld 86.1% SOTA, US$ 6 vs US$ 15 de saída
Self-hosting hojeKimi K3Pesos no HF desde 27 de julho; os do Qwen chegam por volta de 11 de agosto

Perguntas frequentes

O Qwen 3.8 Max é melhor que o Kimi K3 para programação?

Não. O Kimi K3 lidera os benchmarks de programação agêntica mais relevantes, com 81.2 a 73.5 no FrontierSWE e 88.3 a 86.6 no TerminalBench 2.1. Para tarefas de engenharia em várias etapas, o Kimi K3 é a escolha mais forte.

Qual é mais barato: Qwen 3.8 Max ou Kimi K3?

O Qwen 3.8 Max. Ele cobra US$ 6 por milhão de tokens de saída, contra US$ 15 do Kimi K3, e US$ 2 de entrada, contra US$ 3. Os preços de cache hit são parecidos, resultando em uma diferença de aproximadamente 2x em uma carga típica de programação.

Qual é mais barato para programação agêntica com raciocínio máximo?

O Qwen 3.8 Max continua sendo mais barato. Os dois modelos cobram tokens de raciocínio como saída no esforço máximo, então a tarifa de US$ 15/M do Kimi K3 amplia a diferença justamente na carga de programação em que ele é superior.

Os dois modelos aceitam contexto de um milhão de tokens?

Sim. O Qwen 3.8 Max aceita aproximadamente 991K tokens de entrada, menos quando o thinking está ativado, enquanto o Kimi K3 aceita 1,048,576. Ambos têm, nominalmente, janelas de um milhão de tokens.

Os pesos são abertos?

Os do Kimi K3 são. A Moonshot lançou o checkpoint MXFP4 de 1.56 TB em 27 de julho de 2026. Os do Qwen 3.8 Max ainda não: a Alibaba os lista como fechados, com lançamento no Hugging Face e ModelScope previsto para a semana de 11 de agosto.

Leituras relacionadas