Modelo / Kimi K3

Kimi K3 API

Moonshot AI-Geração de texto-$3.00 / 1M input Token-Disponível
Contexto 1,05MCache de promptStreaming SSECompatível com OpenAI
Ver modelo
100%Ao vivo

Provedor

Moonshot AI

Modelo

Kimi K3

Janela de contexto

1,048,576 Token

Protocolo

Chat Completions

Escolha Kimi K3 quando o contexto for o gargalo

Kimi K3 é um modelo de texto de contexto longo para workflows em que é preciso manter muitas evidências no prompt: repositórios de código, documentos legais ou de políticas, notas de pesquisa, logs, chamadas de ferramentas anteriores e memória do Agent. AIReiter o expõe por um endpoint Chat compatível com OpenAI.

Ideal para

Rota de reasoning de contexto longo

Use Kimi K3 quando quiser que uma única solicitação grande carregue todo o contexto de trabalho, sem construir retrieval ou chunking primeiro.

Coloque contexto complexo em uma única solicitação

Adequado para grandes codebases, pacotes documentais ricos em evidências e tarefas Agent longas sem quebrar demais o contexto.

Mantenha a integração leve

AIReiter expõe Kimi K3 via OpenAI Chat Completions; apps existentes normalmente mudam apenas baseURL e model.

Torne prompts longos compatíveis com cache

Quando system prompt, contexto de projeto ou prefixos de documento se repetirem, verifique leituras de cache nos campos usage.

Referência de orçamento

Estime o número de chamadas com base no mix atual de Token.

Recarregar Credits

$10

cerca de 13 solicitações de exemplo

Teste rápido

$50

cerca de 65 solicitações de exemplo

Desenvolvimento diário

$100

cerca de 130 solicitações de exemplo

Avaliação production

Preços

Preços de Token do Kimi K3

Os preços são exibidos por 1M Token. AIReiter lista atualmente Kimi K3 pelo preço público do modelo; o valor da página é acesso rápido, endpoint claro e visibilidade de usage.

Tipo de TokenPreçoNotas
Entrada$3.00 / 1MToken de prompt quando o prefixo estável não vem do cache.
Leitura de cache$0.30 / 1MToken de prompt em cache reportados nos campos usage.
Saída$15.00 / 1MToken de resposta gerados, incluindo respostas com reasoning pesado.

Camada production

Onde Kimi K3 se encaixa em um stack de modelos production

O modelo é mais útil quando a continuidade do contexto muda o resultado: ele não apenas responde a um prompt, mas conserva estado do projeto, evidências e saídas de tools para tornar o próximo passo confiável.

Desenvolvimento de grandes codebases

Revise notas de arquitetura, contratos de serviço, testes antigos, diff e issues antes de uma mudança arriscada.

Análise de documentos longos

Leia contratos, políticas, notas de pesquisa e pacotes de evidências no mesmo contexto de trabalho, evitando resumos prematuros.

Agent multi-step com tools

Mantenha tool call ID, observações intermediárias, parâmetros e decisões para preservar a coerência dos próximos passos.

Revisão de protótipo para production

Use Kimi K3 para verificar se um protótipo, migração ou workflow Agent tem contexto suficiente para edge cases de production.

Checklist production

Confirme estes quatro pontos antes de usar Kimi K3 em production

Modelos de contexto longo falham de forma diferente de modelos com prompts curtos. Verifique model ID, caminho de contexto, estado da conversa e registros usage.

01

Use o model ID de production

Envie kimi-k3 nas solicitações API. A page-chat key chat-kimi-k3 serve apenas para a chat UI da AIReiter.

Model ID
02

Não trate 256K como a mesma entrada

Aqui Kimi K3 suporta 1,048,576 Token. Verifique se client, proxy e timeout suportam solicitações grandes.

Contexto
03

Preserve estado de assistant e tools

Execuções Agent longas exigem assistant messages anteriores, tool outputs e parâmetros. Removê-los cria falsa continuidade.

Estado de tools
04

Registre cache e campos usage

Leituras de cache, Token de saída e respostas com reasoning pesado devem ser medidas pelos campos usage, não estimadas pelo número de solicitações.

Usage
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "Analise este repositório e identifique as três hipóteses de implementação de maior risco." }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Analise este repositório e identifique as três hipóteses de implementação de maior risco." }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<contexto estável do repositório ou documento>" },
    { "role": "user", "content": "Revise o diff de hoje contra esse contexto." }
  ],
  "stream": true
}

// Confirme as leituras de cache em usage:
// usage.prompt_tokens_details.cached_tokens > 0

Casos de uso

Onde Kimi K3 se destaca

Nesses casos, uma janela de 1M Token muda mais o workflow do que pequenas diferenças de latência ou estilo.

Reasoning de contexto longo

Leia brief do projeto, notas de arquitetura, logs e diffs recentes em uma solicitação.

Assistente de coding

Para review de codebase, descoberta de riscos, planejamento de migração e crítica de implementação.

Síntese de pesquisa

Resuma e reconcilie muitos documentos longos sem construir retrieval primeiro.

Planejamento de Agent

Mantenha trilhas de tools, histórico de tarefas e decisões na janela de conversa.

Revisão custo-qualidade

Não compare apenas o preço do Token

Em production, meça o custo do resultado útil: retry, edição humana, sucesso de tools, cache hit e tempo até uma resposta confiável.

Taxa de sucesso na primeira passagem
Taxa de reescrita humana
Número de retry
Token de saída
Taxa de cache hit
Sucesso de tool call
Tempo até resposta útil
Taxa de escalonamento

Se Kimi K3 reduz retry e conserva mais contexto, mais Token ainda pode reduzir o custo final. Para tarefas curtas e stateless, use um modelo mais leve.

Confronto

Kimi K3 comparado aos modelos de texto da AIReiter

DimensãoKimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
Dimensãokimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
Protocolo AIReiterChat CompletionsPágina da família Chat / ResponsesRota de modelo ChatRota Claude Messages
Uso idealCodebases com contexto 1M, documentos longos, estado AgentReasoning flagship compatível com OpenAIGrande contexto, multimodal e tarefas documentaisCode review e avaliação documental
Quando escolherQuando a continuidade do contexto é o gargaloQuando qualidade ou routing GPT-5.6 são necessáriosQuando o comportamento documental ou multimodal do Gemini importaQuando a qualidade de código estilo Claude importa

Pronto para testar

Crie uma key, recarregue Credits e envie uma solicitação Kimi K3

O caminho mais rápido: crie uma API Key, mantenha Chat Completions e comece com uma pequena solicitação streaming.

FAQ

Perguntas sobre Kimi K3 API

Quanto custa Kimi K3 por 1M Token?

Páginas públicas geralmente listam Kimi K3 a $3.00 por 1M Token de input cache-miss, $0.30 por 1M Token de input cache-read e $15.00 por 1M Token de output.

Qual é o tamanho da janela de contexto do Kimi K3?

Kimi K3 é listado com janela de contexto de 1,048,576 Token, útil para codebases, documentos longos e traces Agent.

Context caching realmente reduz custos?

Sim. Entrada em cache costuma ser $0.30 por 1M Token contra $3.00 por 1M Token sem cache.

Qual model ID usar nas APIs?

Use "kimi-k3" no campo model e envie para https://aireiter.com/api/v1/chat/completions. Não use a key interna page-chat como model ID público.

Posso chamar Kimi K3 com SDK estilo OpenAI?

Sim. Defina baseURL como https://aireiter.com/api/v1, mantenha Chat Completions e envie model "kimi-k3".

O que monitorar em production?

Monitore Token cache-read, Token output, latência de solicitações longas, retry rate e se as respostas com reasoning produzem resultados realmente utilizáveis.