Pon contexto complejo en una sola solicitud
Útil para bases de código grandes, paquetes de documentos con mucha evidencia y tareas de agentes de larga duración.
Modelo / Kimi K3
Estado 24 h
Sin tráfico aún
Proveedor
Moonshot AI
Modelo
Kimi K3
Ventana de contexto
1,048,576 Token
Protocolo
Chat Completions
Kimi K3 es un modelo de texto de contexto largo para flujos donde lo difícil es mantener suficiente evidencia en el prompt: repositorios de código, paquetes legales o de políticas, notas de investigación, logs, llamadas de herramientas previas y memoria de agentes. AIReiter lo ofrece mediante un endpoint Chat compatible con OpenAI.
Mejor uso
Ruta de razonamiento de contexto largo
Usa Kimi K3 cuando quieras que una solicitud grande lleve todo el contexto de trabajo, sin construir primero recuperación o chunking.
Útil para bases de código grandes, paquetes de documentos con mucha evidencia y tareas de agentes de larga duración.
AIReiter expone Kimi K3 mediante OpenAI Chat Completions, así que normalmente solo cambias baseURL y model.
Cuando se repitan system prompts, contexto de proyecto o prefijos de documentos, verifica lecturas de caché en usage.
Estima llamadas disponibles según la mezcla actual de Token.
$10
unas 13 solicitudes de ejemplo
Prueba rápida
$50
unas 65 solicitudes de ejemplo
Desarrollo diario
$100
unas 130 solicitudes de ejemplo
Evaluación de producción
Precios
Los precios se muestran por 1M Token. AIReiter lista Kimi K3 al precio público del modelo; el valor aquí es acceso rápido, endpoint claro y visibilidad de uso.
| Tipo de Token | Tarifa | Notas |
|---|---|---|
| Entrada | $3.00 / 1M | Token de prompt cuando el prefijo estable no viene de caché. |
| Lectura de caché | $0.30 / 1M | Token de prompt en caché reportados en usage. |
| Salida | $15.00 / 1M | Token de respuesta generados, incluidas respuestas con razonamiento pesado. |
Capa de producción
El modelo es más útil cuando la continuidad del contexto cambia el resultado: no solo responde, también conserva estado, evidencia y salidas de herramientas para el siguiente paso.
Revisa notas de arquitectura, contratos de servicio, pruebas antiguas, diffs e incidencias antes de cambios riesgosos.
Lee contratos, políticas, notas de investigación y paquetes de evidencia en un mismo contexto de trabajo.
Mantén IDs de herramientas, observaciones, parámetros y decisiones para que los pasos posteriores sigan consistentes.
Usa Kimi K3 para comprobar si un prototipo, migración o agente tiene contexto suficiente para casos límite.
Checklist de producción
Los modelos de contexto largo fallan de forma distinta. Revisa model ID, ruta de contexto, estado de conversación y registros usage.
Envía kimi-k3 en llamadas API. La clave page-chat chat-kimi-k3 solo es para la UI de chat de AIReiter.
Aquí Kimi K3 admite 1,048,576 Token. Confirma que cliente, proxy y timeouts soportan solicitudes grandes.
Los agentes largos necesitan mensajes assistant previos, salidas de herramientas y parámetros. Eliminarlos crea continuidad falsa.
Lecturas de caché, Token de salida y respuestas de razonamiento deben medirse desde usage, no adivinarse por número de solicitudes.
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "Analiza este repositorio e identifica las tres suposiciones de implementación con mayor riesgo." }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Analiza este repositorio e identifica las tres suposiciones de implementación con mayor riesgo." }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<contexto estable del repositorio o documento>" },
{ "role": "user", "content": "Revisa el diff de hoy contra ese contexto." }
],
"stream": true
}
// Confirma las lecturas de caché desde usage:
// usage.prompt_tokens_details.cached_tokens > 0Casos de uso
Aquí una ventana de 1M Token cambia más el flujo que pequeñas diferencias de latencia o estilo.
Lee brief, arquitectura, logs y diffs recientes en una solicitud.
Para revisión de código, riesgos, migraciones y crítica de implementación.
Resume y cruza muchos documentos largos sin crear recuperación primero.
Mantén trazas de herramientas, historial y decisiones en la conversación.
Revisión de coste y calidad
En producción mide coste de resultado útil: reintentos, edición humana, éxito de herramientas, caché y tiempo hasta una respuesta fiable.
Si Kimi K3 reduce reintentos y conserva más contexto, más Token pueden aun así bajar el coste final. Para tareas cortas y sin estado, usa un modelo más ligero.
Comparar
| Dimensión | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| Dimensión | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| Protocolo AIReiter | Chat Completions | Página de familia Chat / Responses | Ruta de modelo Chat | Ruta Claude Messages |
| Mejor uso | Bases de código 1M, documentos largos, estado de agentes | Razonamiento insignia compatible con OpenAI | Contexto grande, multimodal y documentos densos | Revisión de código y juicio documental |
| Cuándo elegirlo | Cuando la continuidad del contexto es el cuello de botella | Cuando necesitas calidad o routing GPT-5.6 | Cuando importa el comportamiento documental o multimodal de Gemini | Cuando importa la calidad de código estilo Claude |
Listo para probar
La ruta rápida: crea una API Key, conserva Chat Completions y empieza con una solicitud streaming pequeña.
FAQ
Las páginas públicas suelen listar Kimi K3 a $3.00 por 1M Token de entrada sin caché, $0.30 por 1M Token leídos de caché y $15.00 por 1M Token de salida.
Kimi K3 se lista con 1,048,576 Token de contexto, clave para bases de código, documentos largos y trazas de agentes.
Sí. La entrada en caché suele costar $0.30 por 1M Token frente a $3.00 por entrada no cacheada.
Usa "kimi-k3" en model y envía a https://aireiter.com/api/v1/chat/completions. No uses la clave interna de page-chat como model ID público.
Sí. Configura baseURL en https://aireiter.com/api/v1, usa Chat Completions y envía model "kimi-k3".
Token leídos de caché, Token de salida, latencia de solicitudes largas, reintentos y si las respuestas de razonamiento entregan resultados útiles.