AIREITER
DOCS APIPREÇOS
TEMPLATES

Modelo / Kimi K3

Kimi K3 API

Moonshot AI-Geração de texto-$3.00 / 1M input Token-Disponível
Contexto 1,05MCache de promptStreaming SSECompatível com OpenAI
Ver modelo

Status 24h

Ainda sem tráfego

100%Ao vivoModelo de linguagem

Provedor

Moonshot AI

Modelo

Kimi K3

Janela de contexto

1,048,576 Token

Protocolo

Chat Completions

Escolha Kimi K3 quando o contexto for o gargalo

Kimi K3 é um modelo de texto de contexto longo para workflows em que é preciso manter muitas evidências no prompt: repositórios de código, documentos legais ou de políticas, notas de pesquisa, logs, chamadas de ferramentas anteriores e memória do Agent. AIReiter o expõe por um endpoint Chat compatível com OpenAI.

Ideal para

Rota de reasoning de contexto longo

Use Kimi K3 quando quiser que uma única solicitação grande carregue todo o contexto de trabalho, sem construir retrieval ou chunking primeiro.

Coloque contexto complexo em uma única solicitação

Adequado para grandes codebases, pacotes documentais ricos em evidências e tarefas Agent longas sem quebrar demais o contexto.

Mantenha a integração leve

AIReiter expõe Kimi K3 via OpenAI Chat Completions; apps existentes normalmente mudam apenas baseURL e model.

Torne prompts longos compatíveis com cache

Quando system prompt, contexto de projeto ou prefixos de documento se repetirem, verifique leituras de cache nos campos usage.

Referência de orçamento

Estime o número de chamadas com base no mix atual de Token.

Recarregar Credits

$10

cerca de 13 solicitações de exemplo

Teste rápido

$50

cerca de 65 solicitações de exemplo

Desenvolvimento diário

$100

cerca de 130 solicitações de exemplo

Avaliação production

Preços

Preços de Token do Kimi K3

Os preços são exibidos por 1M Token. AIReiter lista atualmente Kimi K3 pelo preço público do modelo; o valor da página é acesso rápido, endpoint claro e visibilidade de usage.

Tipo de TokenPreçoNotas
Entrada$3.00 / 1MToken de prompt quando o prefixo estável não vem do cache.
Leitura de cache$0.30 / 1MToken de prompt em cache reportados nos campos usage.
Saída$15.00 / 1MToken de resposta gerados, incluindo respostas com reasoning pesado.

Calculadora de custos

Estime uma solicitação

Custo estimado

$0.765

Entrada × $3 + entrada em cache × $0.30 + saída × $15, por 1M Token.

Criar API KeyRecarregar Credits

Camada production

Onde Kimi K3 se encaixa em um stack de modelos production

O modelo é mais útil quando a continuidade do contexto muda o resultado: ele não apenas responde a um prompt, mas conserva estado do projeto, evidências e saídas de tools para tornar o próximo passo confiável.

Desenvolvimento de grandes codebases

Revise notas de arquitetura, contratos de serviço, testes antigos, diff e issues antes de uma mudança arriscada.

Análise de documentos longos

Leia contratos, políticas, notas de pesquisa e pacotes de evidências no mesmo contexto de trabalho, evitando resumos prematuros.

Agent multi-step com tools

Mantenha tool call ID, observações intermediárias, parâmetros e decisões para preservar a coerência dos próximos passos.

Revisão de protótipo para production

Use Kimi K3 para verificar se um protótipo, migração ou workflow Agent tem contexto suficiente para edge cases de production.

Checklist production

Confirme estes quatro pontos antes de usar Kimi K3 em production

Modelos de contexto longo falham de forma diferente de modelos com prompts curtos. Verifique model ID, caminho de contexto, estado da conversa e registros usage.

01

Use o model ID de production

Envie kimi-k3 nas solicitações API. A page-chat key chat-kimi-k3 serve apenas para a chat UI da AIReiter.

Model ID
02

Não trate 256K como a mesma entrada

Aqui Kimi K3 suporta 1,048,576 Token. Verifique se client, proxy e timeout suportam solicitações grandes.

Contexto
03

Preserve estado de assistant e tools

Execuções Agent longas exigem assistant messages anteriores, tool outputs e parâmetros. Removê-los cria falsa continuidade.

Estado de tools
04

Registre cache e campos usage

Leituras de cache, Token de saída e respostas com reasoning pesado devem ser medidas pelos campos usage, não estimadas pelo número de solicitações.

Usage

API

Comece com uma solicitação completa

Use Chat Completions para Kimi K3 na AIReiter. model ID, endpoint e campos usage são mostrados para copiar e verificar rapidamente.

Criar API KeyRecarregar Credits
modelObrigatório

kimi-k3

messagesObrigatório

Array messages do OpenAI Chat

streamOpcional

true para streaming SSE

temperatureOpcional

Omita salvo se precisar controlar sampling

max_tokensOpcional

Defina apenas se o app precisar de limite rígido de saída

request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "Analise este repositório e identifique as três hipóteses de implementação de maior risco." }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Analise este repositório e identifique as três hipóteses de implementação de maior risco." }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<contexto estável do repositório ou documento>" },
    { "role": "user", "content": "Revise o diff de hoje contra esse contexto." }
  ],
  "stream": true
}

// Confirme as leituras de cache em usage:
// usage.prompt_tokens_details.cached_tokens > 0

Casos de uso

Onde Kimi K3 se destaca

Nesses casos, uma janela de 1M Token muda mais o workflow do que pequenas diferenças de latência ou estilo.

Reasoning de contexto longo

Leia brief do projeto, notas de arquitetura, logs e diffs recentes em uma solicitação.

Assistente de coding

Para review de codebase, descoberta de riscos, planejamento de migração e crítica de implementação.

Síntese de pesquisa

Resuma e reconcilie muitos documentos longos sem construir retrieval primeiro.

Planejamento de Agent

Mantenha trilhas de tools, histórico de tarefas e decisões na janela de conversa.

Revisão custo-qualidade

Não compare apenas o preço do Token

Em production, meça o custo do resultado útil: retry, edição humana, sucesso de tools, cache hit e tempo até uma resposta confiável.

Taxa de sucesso na primeira passagem
Taxa de reescrita humana
Número de retry
Token de saída
Taxa de cache hit
Sucesso de tool call
Tempo até resposta útil
Taxa de escalonamento

Se Kimi K3 reduz retry e conserva mais contexto, mais Token ainda pode reduzir o custo final. Para tarefas curtas e stateless, use um modelo mais leve.

Confronto

Kimi K3 comparado aos modelos de texto da AIReiter

DimensãoKimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
Dimensãokimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
Protocolo AIReiterChat CompletionsPágina da família Chat / ResponsesRota de modelo ChatRota Claude Messages
Uso idealCodebases com contexto 1M, documentos longos, estado AgentReasoning flagship compatível com OpenAIGrande contexto, multimodal e tarefas documentaisCode review e avaliação documental
Quando escolherQuando a continuidade do contexto é o gargaloQuando qualidade ou routing GPT-5.6 são necessáriosQuando o comportamento documental ou multimodal do Gemini importaQuando a qualidade de código estilo Claude importa

Pronto para testar

Crie uma key, recarregue Credits e envie uma solicitação Kimi K3

O caminho mais rápido: crie uma API Key, mantenha Chat Completions e comece com uma pequena solicitação streaming.

Criar API KeyRecarregar Credits

FAQ

Perguntas sobre Kimi K3 API

Quanto custa Kimi K3 por 1M Token?

Páginas públicas geralmente listam Kimi K3 a $3.00 por 1M Token de input cache-miss, $0.30 por 1M Token de input cache-read e $15.00 por 1M Token de output.

Qual é o tamanho da janela de contexto do Kimi K3?

Kimi K3 é listado com janela de contexto de 1,048,576 Token, útil para codebases, documentos longos e traces Agent.

Context caching realmente reduz custos?

Sim. Entrada em cache costuma ser $0.30 por 1M Token contra $3.00 por 1M Token sem cache.

Qual model ID usar nas APIs?

Use "kimi-k3" no campo model e envie para https://aireiter.com/api/v1/chat/completions. Não use a key interna page-chat como model ID público.

Posso chamar Kimi K3 com SDK estilo OpenAI?

Sim. Defina baseURL como https://aireiter.com/api/v1, mantenha Chat Completions e envie model "kimi-k3".

O que monitorar em production?

Monitore Token cache-read, Token output, latência de solicitações longas, retry rate e se as respostas com reasoning produzem resultados realmente utilizáveis.

AIREITER

Dúvidas? Entre em contato em
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vídeo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagem IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.