Melhor LLM de código open source: diferença de custo de 48x no nosso teste

Última Atualização: 2026-07-17 10:09:57

Resposta curta: GLM-5.2 é o LLM open source mais forte para programação no momento — no uso prolongado, a qualidade da saída fica próxima ao nível do Claude Sonnet, e é o modelo que entregaríamos para os problemas mais difíceis. Ele também é lento e consome muitos tokens, então, para agentes de programação rápidos via API, escolha Kimi K2.7 Code; para o menor custo, DeepSeek V4 Flash; e para sua própria GPU de 24 GB, Qwen3.6-27B.

Essa é a conclusão ao submeter as mesmas duas tarefas de programação a cinco modelos open source de destaque, com o Claude Opus 4.8 como referência de código fechado. Todos eles produziram código correto. O que os diferenciou foi quantos tokens eles consumiram para chegar lá, e essa diferença foi de até 48x em custo.

Uma observação sobre a terminologia: quase todos esses são tecnicamente modelos de pesos abertos: os pesos são livres, os dados de treinamento não são. Usamos "open source" porque esse é o termo que as pessoas procuram. A distinção importa apenas para uma resposta de FAQ abaixo.

Como testamos

Duas tarefas, o mesmo prompt para todos os modelos, enviadas em 17 de julho de 2026 com as configurações padrão:

  • Tarefa 1: escreva uma função de análise de duração com casos extremos complicados (12 casos de teste)
  • Tarefa 2: corrija uma função com bug de mesclagem de intervalos (6 casos de teste)

Classificamos o código localmente e registramos três números por execução: taxa de aprovação, tokens de saída e tempo de parede. O custo é o número de tokens multiplicado pelo preço de tabela de cada fornecedor, que verificamos no mesmo dia. Duas tarefas é uma sondagem, não um benchmark, mas é o tipo de solicitação rotineira que você enviará centenas de vezes.

Os resultados

Cada modelo passou em todos os casos de teste. Portanto, a tabela abaixo trata de uma coisa: eficiência:

ModeloTokens de saída (ambas as tarefas)Tempo da tarefa 1Custo
Kimi K2.7 Code2,18345.2s$0.0090
DeepSeek V4 Flash2,23116.7s$0.00066
DeepSeek V4 Pro2,52737.3s$0.0023
MiniMax M35,40936.7s$0.0067
GLM-5.27,13099.3s$0.0318
Claude Opus 4.8 (baseline)5398.1s
Output tokens used by each model to solve the same two coding tasks

A coluna de tokens é a história. GLM-5.2 e MiniMax M3 são modelos "thinking": por padrão, eles raciocinam por muito tempo antes de responder. Esse raciocínio é cobrado como output. Para a mesma função correta, o GLM-5.2 escreveu 3x mais tokens do que o Kimi K2.7 Code.

Fica pior com um limite de tokens. Quando limitamos as respostas a 2.048 tokens, ambos os modelos de raciocínio gastaram todo o orçamento raciocinando e retornaram nenhum código. Você paga e não recebe nada. O GLM-5.2 precisou de um teto de 16.384 tokens antes de concluir, e suas duas tentativas fracassadas custaram cerca de US$ 0,045 por conta própria. Se você usar um modelo de raciocínio dentro de um agente de codificação, aumente max_tokens ou desative o raciocínio para edições rotineiras.

Cost to complete both test tasks at official API prices

Para comparação, o Claude Opus 4.8 resolveu ambas as tarefas em 539 tokens. Os modelos abertos alcançaram a mesma precisão; em concisão, a referência fechada ainda está 4x à frente.

Os melhores modelos de código de código aberto por nível de implantação

Escolha com base em onde o modelo será executado. Os preços são por 1M tokens, verificados em 2026-07-17.

Modelo mais forte, se você puder esperar por ele: GLM-5.2

Em trabalhos de programação difíceis e com várias etapas, a qualidade de saída do GLM-5.2 é o mais próximo que um modelo aberto chega atualmente do nível Claude — ele lidera os benchmarks agentic (SWE-Bench Pro, Terminal-Bench 2.1), e, em nosso uso prolongado, é o que confiamos para os problemas em que os outros tropeçam. Saiba mais em nosso guia da API do GLM-5.2.

O preço dessa qualidade é a paciência. Foi o modelo mais lento e mais faminto em nosso teste (99,3s e 5.695 tokens na Tarefa 1), e a lentidão no serving reflete mais a capacidade limitada de GPU do lado do fornecedor do que o próprio modelo. US$ 1,40 de entrada / US$ 4,40 de saída, contexto de 1M, MIT simples. Dê a ele os problemas difíceis e um grande orçamento de tokens; encaminhe edições rápidas para outro lugar.

Melhor para agentes de codificação de API rápidos: Kimi K2.7 Code

O modelo aberto mais eficiente em tokens que testamos: sua correção de bug levou 259 tokens, com a concisão de um Claude. Ele também lidera o benchmark de conclusão de tarefas da Kilo com 60,7%.

Preço: $0.95 de entrada / $4.00 de saída, $0.19 em acertos de cache. A única limitação real é o contexto: 262K tokens, enquanto o restante desta lista oferece 1M. Para ver como ele se compara ao concorrente mais próximo, consulte Kimi K2.7 Code vs GLM-5.2.

Kimi K2.7 Code official pricing page showing $0.95 input and $4.00 output per million tokens

Melhor custo-benefício: DeepSeek V4 Flash

$0.14 de entrada / $0.28 de saída, de longe o modelo mais barato aqui, e ainda assim passou por tudo o que testamos nele, sendo o mais rápido entre os modelos abertos. Seus resultados publicados (79.0% SWE-Bench Verified, 91.6% LiveCodeBench) ficam dentro de dois pontos do seu irmão maior. O contexto é de 1M tokens, e a licença é a MIT padrão.

Comece aqui. Faça upgrade para V4 Pro somente quando o trabalho com vários arquivos começar a expor a diferença.

DeepSeek official pricing docs showing V4 Flash and V4 Pro with OpenAI and Anthropic format endpoints

Melhor em uma GPU de consumo de 24 GB: Qwen3.6-27B

Um modelo denso de 27B que alcança 77,2% no SWE-Bench Verified, com resultados quase de flagship, vindo de um modelo que cabe em uma única placa de consumo, o que explica por que ele é a resposta recorrente em threads do r/LocalLLaMA que começam com "I have 24GB of VRAM."

Seu irmão mais rápido, o Qwen3-Coder-Next (80B no total, apenas 3B ativos por token, Apache 2.0), é a opção de velocidade da comunidade: um usuário o executou a ~20 tokens/s em uma única RX 9070 XT com o contexto completo de 262K. Se você preferir usá-lo como uma API, ele começa em $0.30/$1.50 via Alibaba Cloud.

Melhor auto-hospedagem com GPU única: Gemma 4 31B

De acordo com o cartão de modelo do Google, o modelo 31B cabe em uma H100 de 80GB com um contexto de 256K, sob a Apache 2.0. A variante 12B roda em 16GB de VRAM.

Um armadilha de dimensionamento: modelos MoE anunciam contagens pequenas de parâmetros "ativos", mas você ainda precisa armazenar todos os pesos. O DeepSeek V4 Flash ativa 13B por token, mas tem 284B no total, cerca de 142GB mesmo a 4 bits. Isso é um projeto para várias GPUs, não para uma única placa.

Melhor escolha econômica para longas execuções autônomas: MiniMax M3

Contexto de 1M a $0.30/$1.20, feito para sessões de agente de várias horas — a MiniMax demonstrou uma execução de pesquisa autônoma de 12 horas. Ela compartilha a verbosidade do modelo de raciocínio que você viu na tabela de resultados, então reserve tokens de acordo. Quando a qualidade importa mais do que o custo em uma execução longa, o GLM-5.2 acima é a opção de upgrade.

O que os rankings não contam para você

Os números de benchmark estão próximos agora: o AI Index de Stanford descobriu que a diferença entre o modelo #1 e o #10 diminuiu de 11,9% para 5,4% em um ano. Três coisas que as tabelas de pontuação ainda ocultam:

Custo por tarefa é melhor do que custo por token. O preço de saída de $4.40 do GLM-5.2 parece próximo aos $4.00 do Kimi. Depois das contagens reais de tokens, o mesmo trabalho custa 3,5x mais. As estatísticas ao vivo da Kilo mostram o caso extremo: o DeepSeek V4 Pro tem uma média de $15.91 por tentativa concluída de benchmark, com um preço de tabela de $0.87.

Mesmo modelo, diferente estrutura, resultado diferente. Um modelo dentro de um loop de agente bem construído (ferramentas estruturadas, novas tentativas, limites de tokens sensatos) se comporta de forma bem diferente do mesmo modelo em uma chamada de chat bruta. Nossas falhas do GLM sem código foram uma interação de configuração, não uma lacuna de capacidade.

Cada benchmark mede um trabalho diferente. O LiveCodeBench é geração algorítmica; o DeepSeek V4 Pro vence nele com 93,5%, acima das pontuações publicadas dos modelos fechados. O SWE-Bench Verified é correção de bugs no nível de repositório; o Claude Mythos 5 ainda lidera com 95,5%, com os modelos abertos em torno de 80%. Associe o benchmark ao seu trabalho real antes de confiar em um ranking.

Substituindo uma assinatura do Claude

Um gatilho comum para adotar open source: atingir os limites da assinatura do Claude no meio do expediente. A matemática fecha. Nossa análise de duas tarefas custou US$ 0,00066 no DeepSeek V4 Flash; algumas centenas dessas chamadas por dia ainda ficam abaixo de um dólar.

A troca também exige menos encanamento do que antes. A DeepSeek publica um endpoint compatível com Anthropic (api.deepseek.com/anthropic), então o Claude Code pode usá-lo com uma mudança na variável de ambiente; a mesma configuração funciona para o GLM-5.2. E, se você quiser manter o Claude para os problemas difíceis enquanto direciona o trabalho rotineiro para modelos abertos, plataformas como a AIReiter oferecem o Claude por 20% do preço de tabela por meio da mesma interface compatível com Anthropic.

Kimi K3: o que vale a pena acompanhar

Moonshot lançou o Kimi K3 em 16 de julho de 2026 e, em trabalho de frontend, ele já superou o modelo fechado mais forte: #1 no leaderboard de Frontend Code com 1.679 contra 1.631 do Claude Fable 5, e os primeiros relatos práticos apontam na mesma direção.

Ele não está ranqueado aqui por um motivo: os weights serão abertos em 27 de julho. Até lá, é uma API fechada em $3/$15. Quando forem disponibilizados, o K3 se tornará o maior modelo open-weight lançado até hoje, e os números da interface acima sugerem que ele disputará o topo desta lista. Estamos acompanhando o lançamento dos open-weights do K3 separadamente.

Como escolher

1. Onde será executado? Abaixo de 16GB de VRAM: use uma API (Gemma 4 12B cabe localmente, mas espere uma queda real de qualidade). 24GB: Qwen3.6-27B. Um H100: Gemma 4 31B. API: DeepSeek V4 Flash até que se prove insuficiente. 2. Que tipo de trabalho? Edições rápidas favorecem modelos concisos: Kimi K2.7 Code ou DeepSeek. Problemas difíceis e execuções longas de agentes favorecem GLM-5.2 (ou MiniMax M3, se o orçamento for limitado), com orçamentos generosos de tokens. 3. Restrições de licença? MIT (GLM, DeepSeek) e Apache 2.0 (Qwen, Gemma) não têm amarras. A MIT modificada do Kimi adiciona uma regra de atribuição que só entra em vigor em escala comercial muito alta.

Perguntas Frequentes

Qual é o melhor LLM de código aberto para programação em 2026?

GLM-5.2 tem o teto mais alto — saída quase no nível do Claude Sonnet em problemas difíceis, ao custo de velocidade. Kimi K2.7 Code vence em eficiência de tokens para agentes de API, Qwen3.6-27B para hardware local, e DeepSeek V4 Flash em custo.

Posso executar esses modelos localmente de graça?

Os pesos são gratuitos; o hardware, não. Um modelo de 27B precisa de uma GPU de 24GB, o Gemma 4 31B precisa de 80GB, e os carros-chefe com trilhões de parâmetros são apenas via API ou cluster.

Qual é a diferença entre código aberto e open weight?

Open-weight significa pesos livres, mas dados de treinamento e código privados, o que descreve quase todos os modelos aqui. Modelos totalmente open source (OpenCoder, StarCoder2, IBM Granite Code) publicam tudo, mas ficam atrás em capacidade.

Existe um LLM de código aberto tão bom quanto o Claude para programação?

Em benchmarks algorítmicos, sim: os 93,5% do DeepSeek V4 Pro no LiveCodeBench superam as pontuações publicadas de modelos fechados. Em correções no nível do repositório, o Claude ainda lidera (95,5% vs ~80% no SWE-Bench Verified). Em nosso teste, os modelos abertos igualaram o Claude em correção, mas usaram de 4 a 13x mais tokens.

Qual LLM de código aberto é melhor para C++ ou linguagens de nicho?

A série K2 da Kimi tem a melhor reputação em linguagens de nicho (a Moonshot destaca especificamente Zig). Para C++, o consenso da comunidade aponta para DeepSeek V4 Pro e Qwen3 Coder Next. Independentemente do que você escolher, teste no seu próprio codebase; a qualidade em linguagens de nicho varia muito mais do que os benchmarks de Python sugerem.