Coloque contexto complexo em uma única solicitação
Adequado para grandes codebases, pacotes documentais ricos em evidências e tarefas Agent longas sem quebrar demais o contexto.
Modelo / Kimi K3
Status 24h
Ainda sem tráfego
Provedor
Moonshot AI
Modelo
Kimi K3
Janela de contexto
1,048,576 Token
Protocolo
Chat Completions
Kimi K3 é um modelo de texto de contexto longo para workflows em que é preciso manter muitas evidências no prompt: repositórios de código, documentos legais ou de políticas, notas de pesquisa, logs, chamadas de ferramentas anteriores e memória do Agent. AIReiter o expõe por um endpoint Chat compatível com OpenAI.
Ideal para
Rota de reasoning de contexto longo
Use Kimi K3 quando quiser que uma única solicitação grande carregue todo o contexto de trabalho, sem construir retrieval ou chunking primeiro.
Adequado para grandes codebases, pacotes documentais ricos em evidências e tarefas Agent longas sem quebrar demais o contexto.
AIReiter expõe Kimi K3 via OpenAI Chat Completions; apps existentes normalmente mudam apenas baseURL e model.
Quando system prompt, contexto de projeto ou prefixos de documento se repetirem, verifique leituras de cache nos campos usage.
Estime o número de chamadas com base no mix atual de Token.
$10
cerca de 13 solicitações de exemplo
Teste rápido
$50
cerca de 65 solicitações de exemplo
Desenvolvimento diário
$100
cerca de 130 solicitações de exemplo
Avaliação production
Preços
Os preços são exibidos por 1M Token. AIReiter lista atualmente Kimi K3 pelo preço público do modelo; o valor da página é acesso rápido, endpoint claro e visibilidade de usage.
| Tipo de Token | Preço | Notas |
|---|---|---|
| Entrada | $3.00 / 1M | Token de prompt quando o prefixo estável não vem do cache. |
| Leitura de cache | $0.30 / 1M | Token de prompt em cache reportados nos campos usage. |
| Saída | $15.00 / 1M | Token de resposta gerados, incluindo respostas com reasoning pesado. |
Camada production
O modelo é mais útil quando a continuidade do contexto muda o resultado: ele não apenas responde a um prompt, mas conserva estado do projeto, evidências e saídas de tools para tornar o próximo passo confiável.
Revise notas de arquitetura, contratos de serviço, testes antigos, diff e issues antes de uma mudança arriscada.
Leia contratos, políticas, notas de pesquisa e pacotes de evidências no mesmo contexto de trabalho, evitando resumos prematuros.
Mantenha tool call ID, observações intermediárias, parâmetros e decisões para preservar a coerência dos próximos passos.
Use Kimi K3 para verificar se um protótipo, migração ou workflow Agent tem contexto suficiente para edge cases de production.
Checklist production
Modelos de contexto longo falham de forma diferente de modelos com prompts curtos. Verifique model ID, caminho de contexto, estado da conversa e registros usage.
Envie kimi-k3 nas solicitações API. A page-chat key chat-kimi-k3 serve apenas para a chat UI da AIReiter.
Aqui Kimi K3 suporta 1,048,576 Token. Verifique se client, proxy e timeout suportam solicitações grandes.
Execuções Agent longas exigem assistant messages anteriores, tool outputs e parâmetros. Removê-los cria falsa continuidade.
Leituras de cache, Token de saída e respostas com reasoning pesado devem ser medidas pelos campos usage, não estimadas pelo número de solicitações.
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "Analise este repositório e identifique as três hipóteses de implementação de maior risco." }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Analise este repositório e identifique as três hipóteses de implementação de maior risco." }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<contexto estável do repositório ou documento>" },
{ "role": "user", "content": "Revise o diff de hoje contra esse contexto." }
],
"stream": true
}
// Confirme as leituras de cache em usage:
// usage.prompt_tokens_details.cached_tokens > 0Casos de uso
Nesses casos, uma janela de 1M Token muda mais o workflow do que pequenas diferenças de latência ou estilo.
Leia brief do projeto, notas de arquitetura, logs e diffs recentes em uma solicitação.
Para review de codebase, descoberta de riscos, planejamento de migração e crítica de implementação.
Resuma e reconcilie muitos documentos longos sem construir retrieval primeiro.
Mantenha trilhas de tools, histórico de tarefas e decisões na janela de conversa.
Revisão custo-qualidade
Em production, meça o custo do resultado útil: retry, edição humana, sucesso de tools, cache hit e tempo até uma resposta confiável.
Se Kimi K3 reduz retry e conserva mais contexto, mais Token ainda pode reduzir o custo final. Para tarefas curtas e stateless, use um modelo mais leve.
Confronto
| Dimensão | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| Dimensão | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| Protocolo AIReiter | Chat Completions | Página da família Chat / Responses | Rota de modelo Chat | Rota Claude Messages |
| Uso ideal | Codebases com contexto 1M, documentos longos, estado Agent | Reasoning flagship compatível com OpenAI | Grande contexto, multimodal e tarefas documentais | Code review e avaliação documental |
| Quando escolher | Quando a continuidade do contexto é o gargalo | Quando qualidade ou routing GPT-5.6 são necessários | Quando o comportamento documental ou multimodal do Gemini importa | Quando a qualidade de código estilo Claude importa |
Pronto para testar
O caminho mais rápido: crie uma API Key, mantenha Chat Completions e comece com uma pequena solicitação streaming.
FAQ
Páginas públicas geralmente listam Kimi K3 a $3.00 por 1M Token de input cache-miss, $0.30 por 1M Token de input cache-read e $15.00 por 1M Token de output.
Kimi K3 é listado com janela de contexto de 1,048,576 Token, útil para codebases, documentos longos e traces Agent.
Sim. Entrada em cache costuma ser $0.30 por 1M Token contra $3.00 por 1M Token sem cache.
Use "kimi-k3" no campo model e envie para https://aireiter.com/api/v1/chat/completions. Não use a key interna page-chat como model ID público.
Sim. Defina baseURL como https://aireiter.com/api/v1, mantenha Chat Completions e envie model "kimi-k3".
Monitore Token cache-read, Token output, latência de solicitações longas, retry rate e se as respostas com reasoning produzem resultados realmente utilizáveis.