Em custo bruto por token, a API de LLM mais barata para programação é a DeepSeek V4 Flash — mas ela não entregou a resposta mais limpa do teste. Kimi K2.7 Code cumpriu todos os requisitos, e GPT-5.4 mini terminou quatro vezes mais rápido. Na prática, porém, a opção mais barata muda de figura quando um patch ruim exige nova tentativa.
Quatro APIs acessíveis diante do mesmo bug
Quatro APIs atuais com capacidade de programação receberam o mesmo bug de concorrência em TypeScript em 30 de julho de 2026. A tarefa era pequena, mas rigorosa: corrigir mapLimit para preservar a ordem da saída, exigir um limite de concorrência inteiro e positivo antes de chamar código do usuário, nunca ultrapassar esse limite e parar de agendar trabalho após a primeira rejeição. Cada resposta também precisava incluir exatamente três testes.
Esta é uma amostra de uma única tarefa sobre seguimento de instruções, não um benchmark de programação. Cada execução direta usou uma mensagem de usuário, sem ferramentas, limite de saída de 8.000 tokens, temperatura padrão do provedor e revisão manual em relação aos quatro requisitos informados. O tempo total inclui nosso gateway compartilhado e a sobrecarga de provedor/rede.
| Modelo | Entrada / saída verificadas por 1M | Tempo | Implementação | Testes | Veredito |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | US$ 0,14 / US$ 0,28 | 59,4s | Cumpriu os quatro requisitos na versão final | Cobriu os comportamentos solicitados | Resposta utilizável mais barata; resposta ruidosa |
| MiniMax M3 | US$ 0,30 / US$ 1,20 promocional | 60,7s | Ordem e concorrência corretas; o estado de rejeição foi definido uma camada de promise tarde demais | Três testes relevantes | Quase passou na regra rígida de interrupção |
| Kimi K2.7 Code | US$ 0,95 / US$ 4,00 | 64,3s | Agendador limpo, resultados ordenados e estado de conclusão imediato | Cobriu ordem/concorrência, rejeição e limites inválidos | Resposta mais completa |
| GPT-5.4 mini | US$ 0,75 / US$ 4,50 | 13,6s | Implementação correta com pool de workers | Três testes, mas nenhum cobriu limites inválidos | Implementação limpa mais rápida; lacuna nos testes |
DeepSeek V4 Flash: menor custo, mais limpeza manual
A DeepSeek V4 Flash acabou entregando uma implementação correta: pré-alocou o array de resultados, atribuiu valores pelo índice de entrada, validou limit e interrompeu os workers com uma flag compartilhada de rejeição. O problema estava na própria resposta. Antes da função final, ela exibiu uma implementação abandonada com um caminho de promise não resolvido e depois explicou por que aquele rascunho estava errado.
Isso é aceitável quando um desenvolvedor revisa cada linha. Para um agente que extrai o primeiro bloco de código e o aplica automaticamente, é uma escolha ruim. Eu usaria DeepSeek como primeira tentativa econômica apenas quando testes e checagem de tipos forem etapas obrigatórias.
MiniMax M3: preço atraente, uma aresta na concorrência
MiniMax M3 gerou código conciso e preservou a ordem com out[i]. A flag de rejeição, porém, foi definida no catch externo de Promise.all, e não dentro do worker que observou a falha do callback. Essa reação extra de promise deixa uma pequena janela evitável de agendamento antes que os demais workers enxerguem a flag de parada.
O preço é excepcionalmente bom. A página oficial da MiniMax mostra uma redução permanente de 50% para US$ 0,30/M de entrada e US$ 1,20/M de saída no M3 para até 512K tokens de entrada. Acima de 512K, a faixa com desconto sobe para US$ 0,60/US$ 2,40.
Kimi K2.7 Code: a resposta mais completa desta amostra
Kimi K2.7 Code retornou uma única implementação, em vez de um rascunho seguido de correção. Validou o limite antes de agendar qualquer trabalho, manteve um array de resultados indexado, limitou as promises ativas e definiu settled no manipulador de rejeição. Seus três testes cobriram os três pontos em que essa função normalmente falha: ordem de conclusão, agendamento após uma falha e limites inválidos.
Kimi foi a resposta mais lenta nesta execução e custa mais por token do que DeepSeek ou MiniMax com desconto. Eu pagaria essa diferença em trabalho autônomo de agentes, quando uma aresta não coberta custa mais do que mais um centavo de uso da API.
GPT-5.4 mini: código mais rápido, seleção de testes incompleta
GPT-5.4 mini entregou a implementação correta mais rápida, em 13,6 segundos na execução com o pedido esclarecido. O código cumpriu os quatro requisitos, inclusive validando o limite antes de agendar qualquer callback. Os três testes verificaram ordem, pico de concorrência e comportamento de rejeição, mas o modelo não testou a própria validação de limite.
A primeira tentativa também pediu um caminho do repositório, embora a função completa estivesse no prompt. Esse deslize isolado não representa uma nota de confiabilidade do modelo como um todo, mas reforça a regra para agentes de programação: valide o artefato, não o nome do modelo.
Quanto custam, de fato, 100 chamadas de programação
Comparar preços por token fica mais simples com uma carga de trabalho concreta. Suponha que cada solicitação envie 8.000 tokens novos de instruções e contexto do repositório e receba um patch de 2.000 tokens mais explicação. Nas tarifas verificadas acima, 100 chamadas custam entre US$ 0,168 e US$ 1,56 antes do cache.
| Modelo | Custo para 100 chamadas | Fórmula |
|---|---|---|
| DeepSeek V4 Flash | US$ 0,168 | 100 × (0.008 × $0.14 + 0.002 × $0.28) |
| MiniMax M3 | US$ 0,48 | 100 × (0.008 × $0.30 + 0.002 × $1.20) |
| GPT-5.4 mini | US$ 1,50 | 100 × (0.008 × $0.75 + 0.002 × $4.50) |
| Kimi K2.7 Code | US$ 1,56 | 100 × (0.008 × $0.95 + 0.002 × $4.00) |
Quando as verificações de aceitação são fracas, uma nova tentativa após uma falha pode anular a diferença de preço por chamada. Um patch quebrado que chega à revisão ou à produção custa muito mais do que qualquer uma dessas chamadas de API.
Agentes que trabalham com repositórios podem reutilizar prefixos estáveis de prompt e código. As tarifas oficiais para entrada em cache são US$ 0,0028/M para DeepSeek V4 Flash, US$ 0,06/M para MiniMax M3, US$ 0,19/M para Kimi K2.7 Code e US$ 0,075/M para GPT-5.4 mini; arquivos alterados e rastros de ferramentas continuam sendo entrada nova.
Para chat, classificação e outras cargas que não envolvem programação, o nível mínimo de capacidade é diferente. A comparação mais ampla de APIs de LLM mais baratas aborda essas tarifas padrão separadamente.
"Groq e Cerebras são extremamente rápidos para inferência, mas limitam bastante o uso quando você atinge um volume moderado." — relato de um desenvolvedor no r/ArtificialInteligence
Trate esse relato como um caso de teste, não como uma conclusão sobre todo o provedor: meça a API pré-selecionada com o número de workers simultâneos que você pretende executar.
A opção mais barata para cada fluxo de programação
A API de LLM mais barata para programação depende de como as falhas são detectadas. DeepSeek é a opção padrão de menor custo quando todo patch passa por verificações determinísticas; nesta amostra, Kimi é a alternativa mais segura quando o modelo precisa cobrir sozinho os casos de borda.
| Fluxo de trabalho | Escolha | Motivo | Evite quando |
|---|---|---|---|
| Protótipos com testes e checagem de tipos | DeepSeek V4 Flash | US$ 0,14/US$ 0,28 e uma implementação final correta | Sua automação pode aplicar o primeiro bloco de código sem revisão |
| Ciclos autônomos de agentes de programação | Kimi K2.7 Code | Implementação e seleção de testes mais completas desta amostra | Latência ou a menor conta possível de tokens é a restrição principal |
| Ações interativas no editor | GPT-5.4 mini | 13,6s, muito mais rápido que os outros três nesta execução | Você espera que os testes gerados cubram toda invariante informada |
| Trabalho econômico com contexto grande | MiniMax M3 | US$ 0,30/US$ 1,20 até 512K com seu desconto permanente | Semântica rigorosa de concorrência/erros é central para a tarefa |
Eu não usaria um modelo pequeno de chat genérico apenas porque sua saída custa US$ 0,08/M. Uma API barata para programação precisa gerar um patch que sobreviva às verificações que seu fluxo consegue executar. Se não houver checagem automatizada, priorize a completude da primeira resposta do modelo, e não o menor preço de tabela.
Uma rota barata primeiro é melhor que um único modelo fixo
Uma rota em duas camadas torna útil o menor preço por token sem confiar cegamente nele. A seleção do modelo deve seguir o resultado das verificações determinísticas, e não o tamanho do prompt ou uma pontuação subjetiva de confiança.
- Envie a primeira tentativa para DeepSeek V4 Flash.
- Execute o formatador do repositório, o verificador de tipos, os testes unitários e qualquer teste oculto específico da tarefa.
- Aceite o patch quando todas as verificações passarem.
- Em caso de falha, envie a tarefa original, o patch que falhou e uma saída concisa dos testes para Kimi K2.7 Code; use GPT-5.4 mini no lugar dele quando a latência interativa importar.
- Limite as tentativas de escalonamento para que um agente não gaste indefinidamente em um único problema.
Essa rota preserva a economia de menos de um centavo da DeepSeek em tarefas diretas e paga a tarifa maior apenas em falhas comprovadas. Uma camada de modelo compatível com OpenAI transforma a troca em uma mudança de nome de modelo, em vez de quatro integrações separadas; o diretório de APIs de LLM da AIReiter disponibiliza os modelos por trás de um único endpoint.
Perguntas frequentes
Qual é a API de LLM mais barata para programação?
DeepSeek V4 Flash foi a API com capacidade de programação mais barata neste teste, a US$ 0,14/M de entrada e US$ 0,28/M de saída. Ela produziu uma implementação final correta, mas a resposta também continha um rascunho abandonado e quebrado; por isso, combine-a com verificações automatizadas.
DeepSeek é boa o suficiente para agentes de programação?
DeepSeek V4 Flash é boa o suficiente como primeira tentativa econômica quando o agente precisa passar por testes, checagem de tipos e formatação antes que um patch seja aceito. Para tarefas autônomas sem verificações robustas, Kimi K2.7 Code entregou a resposta mais completa nesta amostra de uma tarefa.
Cobrança por API ou assinatura de programação: qual é mais barata?
Calcule o custo mensal da API com base nos tokens de entrada e saída medidos, usando as tarifas da tabela, e compare o total com o preço da assinatura, os limites de solicitações e a inclusão — ou não — de acesso à API ou ao agente. Nenhum dos dois modelos de cobrança é inerentemente mais barato.
A regra de roteamento em uma linha
Comece tarefas de programação com DeepSeek V4 Flash, aceite apenas patches que passem nas verificações determinísticas e escale falhas para Kimi K2.7 Code — ou trabalhos sensíveis à latência para GPT-5.4 mini. Os preços foram verificados; a ordem de qualidade vem de uma tarefa restrita e deve ser testada novamente no seu próprio repositório.
