Kimi K3 no OpenCode: configuração + custo real de uma sessão

Última Atualização: 2026-07-20 07:00:21

Sim, o Kimi K3 roda no OpenCode com três comandos. Ele é listado com tarifas da classe Sonnet ($3/$15 por milhão de tokens), mas as sessões reais do OpenCode têm uma média de apenas $1.79, graças ao forte cache de prompts.

Configure o Kimi K3 no OpenCode em três etapas

OpenCode é um agente de codificação para terminal de código aberto. Ele se conecta ao Kimi por meio da autenticação integrada, então você nunca precisa colar uma URL base ou editar um arquivo de configuração. As etapas abaixo correspondem ao OpenCode 1.18.3 e ao próprio guia de integração do Kimi.

Kimi's official documentation page for using Kimi models in OpenCode, showing the three setup steps

1. Configure a chave da API

Execute opencode auth login, selecione Moonshot AI como provedor e cole sua chave da Kimi Open Platform. Duas coisas costumam confundir as pessoas aqui. Primeiro, a conta precisa de saldo real — vouchers para novos usuários não funcionam no K3. Segundo, mantenha a chave fora de qualquer arquivo de configuração, captura de tela ou repositório git; o OpenCode a armazena em seu próprio sistema de credenciais por um motivo.

2. Selecione o modelo kimi-k3

No OpenCode, execute /models e selecione kimi-k3. Isso carrega o modelo com sua janela de contexto completa de 1M tokens (o limite de saída é de 131K tokens por turno). A barra de status agora deve exibir "Kimi K3" e "Moonshot AI".

3. Defina o esforço de raciocínio

Execute /variants para controlar o quão intensamente o K3 raciocina antes de responder. O padrão é max, e você pode reduzir para high ou low — a principal alavanca na sua fatura, como mostra a seção de custos.

O que realmente custa uma sessão do Kimi K3

K3 custa US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de saída, mais do que a taxa promocional do Claude Sonnet 5 de US$ 2/US$ 10.

Na prática, o K3 custa muito menos, porque a maioria dos tokens são leituras de cache baratas. Os dados públicos de uso do OpenCode (mostrados na página por modelo abaixo) indicam que a sessão média do Kimi K3 custa $1.79, medida em 66.379 sessões concluídas, cada uma consumindo 2,9 milhões de tokens. Isso equivale a cerca de $0.62 por milhão de tokens efetivamente usados, bem abaixo da tarifa de tabela de $3. O motivo: 93% dos tokens de entrada são hits de cache, e um hit de cache custa $0.30 por milhão em vez de $3.00, um desconto de 90%. (A Artificial Analysis cita um valor combinado de $2.31 por milhão, mas isso pressupõe apenas 70% de cache; a taxa real de 93% de cache do OpenCode é o motivo pelo qual as sessões ficam mais baratas.)

OpenCode public usage data page for Kimi K3 showing its #9 rank, 1M context, 131K output limit, and July 2026 release

O preço de tabela permanece da classe Sonnet; o lançamento de pesos abertos (pesos completos até 27 de julho de 2026) muda o que você pode hospedar por conta própria, não o que você paga pela API. As taxas por milhão se comparam assim:

Grouped bar chart comparing input and output price per million tokens for Kimi K3, Claude Sonnet 5 promo, and Kimi K2.5

K3 ocupa a 9ª posição em volume de tokens no OpenCode Go, e seu uso dobrou ao longo das oito semanas até 20 de julho (segundo os dados de momentum do OpenCode) — caro no papel, mas ainda em alta demanda para tarefas difíceis.

Por que o K3 consome tokens e como contê-lo

A reclamação mais comum não é o preço por token; é quantos tokens o K3 gasta. Como ele padrão para o esforço de raciocínio max, o K3 raciocina por muito tempo antes de agir, e, em edições simples, esse raciocínio é gasto desperdiçado. Um usuário do OpenCode no X resumiu isso sem rodeios em julho de 2026: ele pode queimar muitos tokens "without accomplishing much" em tarefas que um modelo mais leve concluiria mais rápido.

Três alavancas mantêm isso sob controle:

  • Dispense a variante. Altere /variants para low ou high para trabalhos rotineiros. max vale a pena para arquitetura e refatorações em vários arquivos, não para renomear uma função.
  • Aposte no cache. A taxa de acerto de cache de 93% do K3 é o que mantém as sessões baratas. Continue trabalhando em uma sessão longa em vez de reiniciar; cada reinicialização reenvia o contexto não armazenado em cache pelo preço cheio.
  • Enxugue o harness. O K3 pensa demais quando o scaffold do agente é barulhento. Corte arquivos de instruções sempre ativos, servidores MCP não usados e descrições de ferramentas verbosas para que ele faça menos idas e vindas com ferramentas e tenha menos espaço para entrar em espiral.

Espere uma compensação: o K3 parece mais lento do que modelos mais leves no OpenCode — o custo do raciocínio. Quando a latência importa mais do que a profundidade, troque de modelo.

Kimi K3 vs Kimi K2.7 Code: quando o modelo mais barato vence

K3 custa aproximadamente três vezes o preço do Kimi K2.7 Code, então a questão é quando esse salto vale a pena.

Para verificar a opção mais barata, chamei o K2.7 Code por meio da sua API em 2026-07-20 com uma tarefa pequena: escrever uma função Python merge_intervals com análise de complexidade. Ela retornou código correto e idiomático (ordenar, depois mesclagem linear, tempo O(n log n) e espaço O(n)) em 10.7 segundos, usando 52 tokens de prompt e 341 tokens de conclusão. Para programação do dia a dia, como correções de bugs, funções pequenas e scaffolding de testes, isso é tudo de que a maioria das pessoas precisa, e a conta de tokens é uma fração da do K3.

Reserve o K3 para o que ele faz melhor: trabalho de longo contexto que preenche sua janela de 1M, raciocínio complexo em vários arquivos e tarefas em que um modelo mais leve continua falhando. O comparativo direto entre K2.7 Code e GLM 5.2 é uma referência útil se você estiver escolhendo um modelo para uso diário em vez de um modelo para tarefas pesadas.

API direta vs OpenRouter vs assinatura: reduzindo a conta

Como você faz o roteamento para K3 altera tanto a confiabilidade quanto o custo.

API direta do Kimi. Conectar-se diretamente à Kimi Open Platform é o caminho mais confiável. O K3 no OpenRouter é fornecido por um único provedor e pode retornar erros 429 frequentes (limite de taxa) sob carga; ir direto evita esse gargalo.

Assinatura OpenCode Go. Um plano mensal (cerca de US$ 10–19) transforma o K3 em uma "segunda reserva" com tarifa fixa, que você aciona quando seu modelo principal trava. Vários usuários o utilizam exatamente assim — como um recurso de contingência quando uma sessão do Claude é interrompida no meio da tarefa, e não como o principal em tempo integral.

API gateway. Se você já roteia vários modelos por uma única chave, um gateway compatível com Anthropic e OpenAI, como AIReiter, permite chamar o K3 junto com outros modelos em pricing pay-as-you-go, com a mesma economia de cache que reduz o custo por sessão. A análise de preços do Kimi K3 traz a matemática por token para comparar rotas antes de se comprometer.

O Kimi K3 vale a pena no OpenCode?

Dois grupos devem pensar duas vezes antes de confirmar o uso. Se você executa loops de agentes baratos e de alto volume, o K2.7 Code ou um modelo mais leve economiza dinheiro com pouca perda de qualidade. Se você precisa de respostas rápidas, o raciocínio de esforço max do K3 parecerá lento até você reduzir a variante.

Todo mundo: sim. Um modelo líder de ranking com contexto de 1M de tokens, configurado em três comandos, por menos de US$ 2 uma sessão real — e que você controla totalmente, se está saindo de um assistente que trava no meio da tarefa.

Perguntas Frequentes

O Kimi K3 é gratuito para usar no OpenCode?

Não. K3 é pay-as-you-go e requer um saldo financiado na Kimi Open Platform; vouchers de novos usuários não se aplicam a ele. O OpenCode em si é gratuito e de código aberto — você só paga pelos tokens K3.

Quanto custa o Kimi K3 por milhão de tokens?

A taxa de lista é de $3 por milhão de tokens de entrada e $15 por milhão de saída. O que você paga na prática é muito mais baixo: acertos de cache custam $0.30 por milhão, e as sessões reais do OpenCode têm uma média de $1.79 graças a uma taxa de acerto de cache de 93%.

O Kimi K3 é de código aberto?

É de peso aberto. A Moonshot está disponibilizando os pesos completos do modelo até 27 de julho de 2026, tornando-o o primeiro modelo aberto na classe de 3 trilhões de parâmetros. A API hospedada ainda é paga.

O Kimi K3 codifica tão bem quanto o Claude?

No ranking de programação do Arena, o K3 atualmente ocupa o primeiro lugar e pontua 57 no Artificial Analysis Intelligence Index (#4 de 187 modelos). Na prática, ele é competitivo com modelos proprietários de ponta em tarefas difíceis de programação, a um preço de tabela semelhante.

Por que recebo erros 429 com o Kimi K3?

429s frequentes geralmente vêm do roteamento pelo OpenRouter, onde o K3 é atendido por um único provedor. Conectar-se diretamente à Kimi Open Platform por meio da autenticação integrada do OpenCode evita esse limite.