Modelo / Kimi K3

Kimi K3 API

Moonshot AI-Generación de texto-$3.00 / 1M input Token-Disponible
Contexto 1,05MCaché de promptStreaming SSECompatible con OpenAI
Ver modelo
100%En vivo

Proveedor

Moonshot AI

Modelo

Kimi K3

Ventana de contexto

1,048,576 Token

Protocolo

Chat Completions

Elige Kimi K3 cuando el contexto sea el cuello de botella

Kimi K3 es un modelo de texto de contexto largo para flujos donde lo difícil es mantener suficiente evidencia en el prompt: repositorios de código, paquetes legales o de políticas, notas de investigación, logs, llamadas de herramientas previas y memoria de agentes. AIReiter lo ofrece mediante un endpoint Chat compatible con OpenAI.

Mejor uso

Ruta de razonamiento de contexto largo

Usa Kimi K3 cuando quieras que una solicitud grande lleve todo el contexto de trabajo, sin construir primero recuperación o chunking.

Pon contexto complejo en una sola solicitud

Útil para bases de código grandes, paquetes de documentos con mucha evidencia y tareas de agentes de larga duración.

Mantén la integración ligera

AIReiter expone Kimi K3 mediante OpenAI Chat Completions, así que normalmente solo cambias baseURL y model.

Haz que los prompts largos aprovechen caché

Cuando se repitan system prompts, contexto de proyecto o prefijos de documentos, verifica lecturas de caché en usage.

Referencia de presupuesto

Estima llamadas disponibles según la mezcla actual de Token.

Recargar Credits

$10

unas 13 solicitudes de ejemplo

Prueba rápida

$50

unas 65 solicitudes de ejemplo

Desarrollo diario

$100

unas 130 solicitudes de ejemplo

Evaluación de producción

Precios

Precios de Token de Kimi K3

Los precios se muestran por 1M Token. AIReiter lista Kimi K3 al precio público del modelo; el valor aquí es acceso rápido, endpoint claro y visibilidad de uso.

Tipo de TokenTarifaNotas
Entrada$3.00 / 1MToken de prompt cuando el prefijo estable no viene de caché.
Lectura de caché$0.30 / 1MToken de prompt en caché reportados en usage.
Salida$15.00 / 1MToken de respuesta generados, incluidas respuestas con razonamiento pesado.

Capa de producción

Dónde encaja Kimi K3 en una pila de modelos de producción

El modelo es más útil cuando la continuidad del contexto cambia el resultado: no solo responde, también conserva estado, evidencia y salidas de herramientas para el siguiente paso.

Desarrollo en bases de código grandes

Revisa notas de arquitectura, contratos de servicio, pruebas antiguas, diffs e incidencias antes de cambios riesgosos.

Análisis de documentos largos

Lee contratos, políticas, notas de investigación y paquetes de evidencia en un mismo contexto de trabajo.

Agentes con herramientas en varios pasos

Mantén IDs de herramientas, observaciones, parámetros y decisiones para que los pasos posteriores sigan consistentes.

Revisión de prototipo a producción

Usa Kimi K3 para comprobar si un prototipo, migración o agente tiene contexto suficiente para casos límite.

Checklist de producción

Confirma estas cuatro cosas antes de llevar Kimi K3 a producción

Los modelos de contexto largo fallan de forma distinta. Revisa model ID, ruta de contexto, estado de conversación y registros usage.

01

Usa el model ID de producción

Envía kimi-k3 en llamadas API. La clave page-chat chat-kimi-k3 solo es para la UI de chat de AIReiter.

Model ID
02

No trates 256K como la misma entrada

Aquí Kimi K3 admite 1,048,576 Token. Confirma que cliente, proxy y timeouts soportan solicitudes grandes.

Contexto
03

Conserva estado de assistant y herramientas

Los agentes largos necesitan mensajes assistant previos, salidas de herramientas y parámetros. Eliminarlos crea continuidad falsa.

Estado de herramientas
04

Registra caché y campos usage

Lecturas de caché, Token de salida y respuestas de razonamiento deben medirse desde usage, no adivinarse por número de solicitudes.

Uso
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "Analiza este repositorio e identifica las tres suposiciones de implementación con mayor riesgo." }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Analiza este repositorio e identifica las tres suposiciones de implementación con mayor riesgo." }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<contexto estable del repositorio o documento>" },
    { "role": "user", "content": "Revisa el diff de hoy contra ese contexto." }
  ],
  "stream": true
}

// Confirma las lecturas de caché desde usage:
// usage.prompt_tokens_details.cached_tokens > 0

Casos de uso

En qué destaca Kimi K3

Aquí una ventana de 1M Token cambia más el flujo que pequeñas diferencias de latencia o estilo.

Razonamiento de contexto largo

Lee brief, arquitectura, logs y diffs recientes en una solicitud.

Asistente de código

Para revisión de código, riesgos, migraciones y crítica de implementación.

Síntesis de investigación

Resume y cruza muchos documentos largos sin crear recuperación primero.

Planificación de agentes

Mantén trazas de herramientas, historial y decisiones en la conversación.

Revisión de coste y calidad

No compares precio por Token sin coste de tarea

En producción mide coste de resultado útil: reintentos, edición humana, éxito de herramientas, caché y tiempo hasta una respuesta fiable.

Éxito al primer intento
Tasa de reescritura humana
Número de reintentos
Token de salida
Tasa de caché
Éxito de herramientas
Tiempo hasta respuesta útil
Tasa de escalado

Si Kimi K3 reduce reintentos y conserva más contexto, más Token pueden aun así bajar el coste final. Para tareas cortas y sin estado, usa un modelo más ligero.

Comparar

Kimi K3 frente a modelos de texto de AIReiter

DimensiónKimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
Dimensiónkimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
Protocolo AIReiterChat CompletionsPágina de familia Chat / ResponsesRuta de modelo ChatRuta Claude Messages
Mejor usoBases de código 1M, documentos largos, estado de agentesRazonamiento insignia compatible con OpenAIContexto grande, multimodal y documentos densosRevisión de código y juicio documental
Cuándo elegirloCuando la continuidad del contexto es el cuello de botellaCuando necesitas calidad o routing GPT-5.6Cuando importa el comportamiento documental o multimodal de GeminiCuando importa la calidad de código estilo Claude

Listo para probar

Crea una key, carga Credits y envía una solicitud Kimi K3

La ruta rápida: crea una API Key, conserva Chat Completions y empieza con una solicitud streaming pequeña.

FAQ

Preguntas sobre Kimi K3 API

¿Cuánto cuesta Kimi K3 por 1M Token?

Las páginas públicas suelen listar Kimi K3 a $3.00 por 1M Token de entrada sin caché, $0.30 por 1M Token leídos de caché y $15.00 por 1M Token de salida.

¿Qué tamaño tiene la ventana de contexto de Kimi K3?

Kimi K3 se lista con 1,048,576 Token de contexto, clave para bases de código, documentos largos y trazas de agentes.

¿El caché de contexto reduce costes?

Sí. La entrada en caché suele costar $0.30 por 1M Token frente a $3.00 por entrada no cacheada.

¿Qué model ID debo usar?

Usa "kimi-k3" en model y envía a https://aireiter.com/api/v1/chat/completions. No uses la clave interna de page-chat como model ID público.

¿Puedo llamar Kimi K3 con un SDK estilo OpenAI?

Sí. Configura baseURL en https://aireiter.com/api/v1, usa Chat Completions y envía model "kimi-k3".

¿Qué debo vigilar en producción?

Token leídos de caché, Token de salida, latencia de solicitudes largas, reintentos y si las respuestas de razonamiento entregan resultados útiles.