AIREITER

Kimi K3 no OpenCode: configuração e custo real por sessão

Última Atualização: 2026-07-29 11:31:33

Rodar o Kimi K3 no OpenCode exige apenas três comandos. Embora a tabela de preços o posicione na faixa do Sonnet, com $3/$15 por milhão de tokens, sessões reais no OpenCode custam em média só $1.79 graças ao uso intenso de cache de prompt.

Como configurar o Kimi K3 no OpenCode em três passos

O OpenCode é um agente de programação open source para terminal. A conexão com o Kimi usa autenticação nativa, sem precisar informar URL base nem editar arquivos de configuração. O processo abaixo corresponde ao OpenCode 1.18.3 e ao próprio guia de integração do Kimi.

Página da documentação oficial do Kimi sobre o uso de modelos Kimi no OpenCode, mostrando as três etapas de configuração

1. Configure a chave de API

Execute opencode auth login, escolha Moonshot AI como provedor e cole sua chave da Kimi Open Platform. Há dois detalhes importantes aqui. Primeiro: a conta precisa ter saldo real — vouchers para novos usuários não funcionam com o K3. Segundo: não coloque a chave em arquivo de configuração, captura de tela ou repositório git; o OpenCode a guarda em seu próprio sistema de credenciais por um bom motivo.

2. Escolha o modelo kimi-k3

Dentro do OpenCode, execute /models e selecione kimi-k3. Isso carrega o modelo com toda a sua janela de contexto de 1M de tokens, com saída limitada a 131K tokens por turno. A barra de status deve passar a mostrar "Kimi K3" e "Moonshot AI".

3. Ajuste o esforço de raciocínio

Use /variants para definir quanto o K3 raciocina antes de responder. O padrão é max, mas você pode reduzir para high ou low. Como a seção de custos mostra, esse é o principal controle sobre a sua conta.

Quanto uma sessão com Kimi K3 realmente custa

O preço de tabela do K3 é $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída, acima da tarifa promocional de $2/$10 do Claude Sonnet 5.

Na prática, o custo do K3 é bem menor porque a maior parte dos tokens vem de leituras de cache baratas. Dados públicos de uso do OpenCode, exibidos na página do modelo abaixo, apontam uma média de $1.79 por sessão de Kimi K3, com base em 66,379 sessões concluídas que consumiram 2.9M de tokens cada. Isso equivale a cerca de $0.62 por milhão de tokens efetivamente usados, muito abaixo dos $3 da tabela. O motivo é que 93% dos tokens de entrada acertam o cache: cada acerto custa $0.30 por milhão, em vez de $3.00, um desconto de 90%. (A Artificial Analysis estima um valor combinado de $2.31 por milhão, mas parte de apenas 70% de cache; a taxa real de 93% no OpenCode explica por que as sessões ficam mais baratas.)

Página de dados públicos de uso do OpenCode para o Kimi K3, mostrando a posição #9, contexto de 1M, limite de saída de 131K e lançamento em julho de 2026

O preço de tabela continua na categoria do Sonnet; o lançamento open-weight, com pesos completos até 27 de julho de 2026, muda as possibilidades de auto-hospedagem, não o que você paga pela API. Veja como as tarifas por milhão se comparam:

Gráfico de barras agrupadas comparando o preço de entrada e saída por milhão de tokens para Kimi K3, Claude Sonnet 5 promo e Kimi K2.5

O K3 ocupa a posição #9 em volume de tokens no OpenCode Go, e seu uso dobrou nas oito semanas até 20 de julho, segundo os dados de crescimento do OpenCode. No papel ele é caro, mas segue muito procurado para tarefas difíceis.

Por que o K3 consome tantos tokens — e como conter isso

A reclamação mais comum não é o preço por token, mas a quantidade de tokens que o K3 gasta. Como ele usa max como esforço de raciocínio padrão, pensa longamente antes de agir. Em edições simples, esse raciocínio vira gasto desnecessário. Um usuário do OpenCode no X resumiu bem em julho de 2026: ele pode consumir muitos tokens "without accomplishing much" em tarefas que um modelo mais leve terminaria mais rápido.

Três medidas ajudam a controlar isso:

  • Reduza a variante. Para trabalho rotineiro, troque /variants para low ou high. O max faz sentido em arquitetura e refatorações envolvendo vários arquivos, não para renomear uma função.
  • Aproveite o cache. A taxa de 93% de acertos no cache é o que mantém as sessões baratas. Continue trabalhando em uma sessão longa, em vez de reiniciar a toda hora; cada reinício reenvia contexto não armazenado em cache pelo preço cheio.
  • Enxugue o ambiente do agente. O K3 pensa demais quando o scaffolding do agente está poluído. Remova arquivos de instrução sempre ativos, servidores MCP não utilizados e descrições extensas de ferramentas. Assim, ele faz menos idas e vindas com ferramentas e tem menos espaço para se perder em espirais de raciocínio.

Há uma contrapartida: no OpenCode, o K3 parece mais lento que modelos leves por causa do custo do raciocínio. Quando a latência importa mais que profundidade, troque de modelo.

Kimi K3 vs Kimi K2.7 Code: quando o modelo mais barato é a melhor escolha

O K3 custa cerca de três vezes mais que o Kimi K2.7 Code. A questão, então, é saber quando esse salto vale a pena.

Para avaliar a opção mais barata, chamei o K2.7 Code pela API em 2026-07-20 para uma tarefa pequena: escrever uma função Python merge_intervals com análise de complexidade. Ele devolveu código correto e idiomático — ordenação seguida de merge linear, tempo O(n log n) e espaço O(n) — em 10.7 segundos, usando 52 tokens de prompt e 341 de conclusão. Para programação cotidiana, como correções de bugs, funções pequenas e estrutura de testes, isso é tudo de que a maioria das pessoas precisa, por uma fração da conta de tokens do K3.

Deixe o K3 para o que ele faz melhor: trabalho de contexto longo que ocupa sua janela de 1M, raciocínio complexo entre vários arquivos e tarefas em que um modelo mais leve continua falhando. O comparativo direto entre K2.7 Code e GLM 5.2 é uma boa referência para quem procura um modelo para o dia a dia, e não para trabalho pesado.

API direta, OpenRouter ou assinatura: como reduzir a conta

A rota usada para acessar o K3 afeta tanto a confiabilidade quanto o custo.

API direta do Kimi. Conectar-se diretamente à Kimi Open Platform é o caminho mais confiável. O K3 no OpenRouter é atendido por um único provedor e pode retornar erros 429 frequentes, de limite de taxa, quando há carga. Ir direto evita esse gargalo.

Assinatura OpenCode Go. Um plano mensal, em torno de $10–19, transforma o K3 em uma "segunda reserva" de valor fixo para usar quando o modelo principal emperra. Vários usuários o utilizam exatamente assim: como alternativa quando uma sessão do Claude é interrompida no meio da tarefa, não como modelo principal em tempo integral.

Gateway de API. Se você já direciona vários modelos por uma única chave, um gateway compatível com Anthropic e OpenAI, como o AIReiter, permite chamar o K3 ao lado de outros modelos com cobrança conforme o uso, mantendo a mesma economia de cache que reduz o custo por sessão. O detalhamento de preços do Kimi K3 traz os cálculos por token para comparar as rotas antes de decidir.

Vale a pena usar o Kimi K3 no OpenCode?

Dois grupos devem pensar duas vezes antes de adotá-lo. Se você executa loops de agentes baratos e em alto volume, o K2.7 Code ou outro modelo leve economiza dinheiro com pouca perda de qualidade. Se precisa de respostas rápidas, o raciocínio em esforço max do K3 parecerá lento até que você reduza a variante.

Para todos os demais: sim. É um modelo no topo dos rankings, com contexto de 1M de tokens, configurado em três comandos e por menos de $2 em uma sessão real — além de ser totalmente controlável por você, caso esteja saindo de um assistente que trava no meio da tarefa.

Perguntas frequentes

O Kimi K3 é gratuito no OpenCode?

Não. O K3 é cobrado conforme o uso e exige saldo na Kimi Open Platform; vouchers para novos usuários não se aplicam a ele. O OpenCode em si é gratuito e open source — você paga apenas pelos tokens do K3.

Quanto custa o Kimi K3 por milhão de tokens?

A tarifa de tabela é $3 por milhão de tokens de entrada e $15 por milhão de saída. Na prática, o valor pago é bem menor: acertos de cache custam $0.30 por milhão, e as sessões reais do OpenCode têm média de $1.79 graças à taxa de 93% de acertos no cache.

O Kimi K3 é open source?

Ele é open-weight. A Moonshot está liberando os pesos completos do modelo até 27 de julho de 2026, tornando-o o primeiro modelo aberto na classe de 3 trilhões de parâmetros. A API hospedada continua sendo paga.

O Kimi K3 programa tão bem quanto o Claude?

No ranking de programação da Arena, o K3 está atualmente no topo e marca 57 no Artificial Analysis Intelligence Index, na posição #4 entre 187 modelos. Na prática, ele compete com modelos proprietários de ponta em tarefas difíceis de programação, a um preço de tabela semelhante.

Por que recebo erros 429 com o Kimi K3?

Erros 429 frequentes normalmente acontecem ao usar o OpenRouter, onde o K3 é atendido por um único provedor. Conectar-se diretamente à Kimi Open Platform pela autenticação nativa do OpenCode evita esse limite.