AIREITER

Guía de precios y API de Prime Inference (2026)

Última actualización: 2026-10-03 07:26:11

Prime Inference ya está disponible: es compatible con OpenAI y está pensado para tráfico sostenido de agentes, no como un simple anuncio de producto futuro. El principal inconveniente es la transparencia de precios. La publicación de lanzamiento de Prime Intellect detalla ampliamente su infraestructura de serving, pero hoy resulta más fácil encontrar la tabla completa de tarifas por modelo en directorios de precios activos que en una página oficial de precios convencional.

Página de lanzamiento de Prime Inference de Prime Intellect

Prime Inference ya funciona, pero los precios están repartidos entre varias fuentes

Prime Intellect lanzó oficialmente Prime Inference el 2 de octubre de 2026. El producto ofrece endpoints serverless para demanda variable y capacidad reservada para cargas sostenidas. La API pública está desacoplada de la flota de modelos subyacente, de modo que la capacidad puede trasladarse o fallar sin que cambie el endpoint del cliente.

No se trata de una lista de espera, sino de un lanzamiento para producción. Según Prime Intellect, su primer despliegue público, GLM-5.3, se publicó en OpenRouter el 22 de septiembre, mientras que los clientes directos pueden apuntar SDK compatibles con OpenAI a https://api.pinference.ai/api/v1.

La advertencia sobre precios es sencilla: la página oficial de lanzamiento promete facturación unificada y seguimiento de uso por equipo, pero no publica una tabla completa de tarifas. Por ello, antes de comprometer presupuesto conviene revisar las tarifas actuales de cada modelo en el panel autenticado o en el endpoint de modelos. Los directorios públicos sirven como referencia puntual, no como cotizaciones contractuales.

Precios actuales de Prime Inference

Los precios de Prime Inference dependen del modelo y del uso. Los tokens de entrada y salida se cobran por separado; la salida puede costar varias veces más que la entrada. Por eso, una tarifa de entrada aparentemente baja puede dar una imagen engañosa en agentes de programación o cargas de razonamiento que generan respuestas extensas.

La siguiente referencia se registró el 3 de octubre de 2026 en el catálogo de Prime Intellect de endpoints.run, donde figuraban 64 endpoints. Confirma cada tarifa con Prime Intellect antes de comprar.

ID del modeloEntrada / 1 M de tokensSalida / 1 M de tokensContexto indicadoMejor uso
meta-llama/Llama-3.2-1B-Instruct$0.03$0.2060KClasificación y extracción sencilla
qwen/qwen3.7-flash$0.03$0.131MTrabajo general de contexto largo y bajo coste
z-ai/glm-5.3-flash$0.15$0.501MFlujos más rápidos de agentes y herramientas
qwen/qwen3-coder-next$0.30$1.50262KProgramación y uso de herramientas
deepseek/deepseek-v4.1-flash$0.30$1.201MRazonamiento y visión con contexto largo
z-ai/glm-5.3$1.40$4.401MCargas emblemáticas de agentes con GLM
deepseek/deepseek-v4-pro$1.91$3.831MRazonamiento de gama más alta
moonshotai/kimi-k3$3.45$17.251MTareas premium de contexto largo

Un segundo directorio, Compute Prices, mostraba 111 modelos en la misma fecha y un mínimo exacto de $0.027 por millón de tokens de entrada para Llama 3.2 1B. La discrepancia entre ambos catálogos es motivo suficiente para consultar la API activa en vez de tomar cualquiera de los directorios como un inventario fijo: pueden incluir espacios de nombres distintos, modelos de gateway o actualizarse en momentos diferentes.

Tres ejemplos de coste realistas

El coste de tokens puede calcularse así:

(tokens de entrada ÷ 1,000,000 × tarifa de entrada) + (tokens de salida ÷ 1,000,000 × tarifa de salida)

Carga mensualModelo y volumen de tokensFactura estimada de tokens
Bot de soporte ligeroQwen3.7 Flash; 50M de entrada + 10M de salida$2.80
Agente de programaciónQwen3 Coder Next; 100M de entrada + 40M de salida$90.00
Agente emblemático con mucha salidaGLM-5.3; 200M de entrada + 100M de salida$720.00

Estos cálculos solo cubren los cargos publicados por tokens. No incluyen contratos de capacidad reservada, ejecución en sandbox, entrenamiento, evaluaciones ni alquiler de GPU. Prime Intellect comercializa esos servicios por separado, así que la factura integral de un agente puede contener más conceptos que los tokens de inferencia.

El soporte para contexto largo tampoco implica que cada solicitud consuma un millón de tokens. La facturación sigue los tokens realmente procesados. Sin embargo, un agente que reenvía repetidamente un historial de 140K tokens puede acumular cargos de entrada con rapidez si el caché de prefijos o la gestión de contexto en la aplicación no reducen el trabajo repetido.

Configurar la API solo exige cambiar el endpoint

Prime Inference expone un endpoint compatible con OpenAI, por lo que una integración existente con el SDK de OpenAI normalmente solo necesita una nueva URL base, una clave de API y un identificador de modelo. La publicación de lanzamiento de Prime Intellect indica como URL base https://api.pinference.ai/api/v1.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_PRIME_API_KEY",
    base_url="https://api.pinference.ai/api/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "user", "content": "Write a haiku about KV caches."}
    ],
    stream=False,
)

print(response.choices[0].message.content)

La solicitud equivalente con cURL es:

curl https://api.pinference.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $PRIME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a haiku about KV caches."}
    ]
  }'

Prime Intellect también documenta una vía mediante CLI: instala la herramienta prime, autentícate con prime login y ejecuta prime inference chat. Antes de desplegar, recupera la lista actual de modelos y copia el ID exacto: los prefijos de los directorios varían entre catálogos.

Qué cambia esta arquitectura para las cargas de agentes

Prime Inference destaca especialmente cuando los prompts son largos, las sesiones regresan con frecuencia y las llamadas a herramientas deben mantenerse válidas. Prime Intellect afirma que un turno interno típico de un agente añade alrededor de 6K tokens a un prompt de 140K tokens, un escenario en el que la retención de caché y el enrutamiento importan tanto como la velocidad bruta de decodificación.

El informe oficial de lanzamiento aporta varias mediciones concretas de su despliegue de GLM-5.3 sobre hardware GB200 NVL72:

  • Separar los workers de prefill y decode redujo casi un 40% la latencia p90 entre tokens en las pruebas de Prime Intellect.
  • Con un objetivo de 100 tokens de extremo a extremo por segundo y usuario, una topología probada de prefill/decode 1:4 atendió 66 sesiones por grupo de prefill a 101 tokens por segundo y usuario.
  • Reducir el presupuesto de prefill de 8K a 4K tokens por GPU recortó la espera mediana en cola de 550 ms a 110 ms y redujo aproximadamente un 20% el tiempo mediano hasta el primer token.
  • La compresión NVFP4 elevó la capacidad de caché de 1.09 millones a 1.63 millones de tokens almacenados en caché por decodificador, aproximadamente un 50%, con el mismo presupuesto de memoria.
  • Una disposición de caché block-major redujo cerca de 10× los descriptores de transferencia y bajó el tiempo medio de transferencia de 146 ms a 78 ms en una comparación TP8 independiente.

Son cifras específicas de una carga y una configuración, no garantías universales de latencia. Su valor práctico está en que Prime Intellect hace públicos los cuellos de botella que optimizó: reutilización de caché en sesiones recurrentes, demora de admisión, interferencia entre prefill y decode, y sobrecarga de transferencia de caché.

El uso de herramientas merece una prueba independiente. Prime Intellect detectó casos en los que herramientas no declaradas se descartaban silenciosamente o los argumentos tenían tipos incorrectos, y añadió decodificación restringida y pruebas de esquemas a su ruta de serving de GLM. La empresa informa de una tasa de errores de llamadas a herramientas cercana a cero, pero los compradores deberían reproducir sus propios esquemas anidados, argumentos anulables, llamadas en streaming y solicitudes malformadas antes de redirigir tráfico de producción.

Serverless o capacidad reservada: depende del patrón de tráfico

Para la mayoría de equipos, serverless es el punto de partida sensato porque convierte una demanda incierta en cargos por tokens. La capacidad reservada cobra relevancia cuando la concurrencia sostenida, una latencia predecible o un despliegue personalizado pesan más que evitar capacidad inactiva.

Carga de trabajoMejor opción inicialMotivo
Prototipo o chatbot intermitenteServerlessNo hace falta reservar GPU inactivas
Trabajos de evaluación con picosServerless por ahoraLa inferencia batch y asíncrona de menor precio figura en la hoja de ruta, no como función disponible en el lanzamiento
Servicio de agentes estable y con alta concurrenciaPresupuesto de capacidad reservadaLa planificación de capacidad puede importar más que las tarifas nominales por token
Modelo fine-tuned o LoRAConfirma la disponibilidad primeroEl despliegue dedicado con un clic de modelos fine-tuned se describe como trabajo futuro en la publicación de lanzamiento
SLA contractual estricto o requisito de regiónRevisión comercialEl material público de lanzamiento no establece un contrato universal, una matriz de regiones ni un precio estándar de capacidad reservada

No des por hecho que «reservada» cuesta automáticamente menos. Compara el coste presupuestado de capacidad con el gasto serverless medido a una concurrencia representativa, incluidos los periodos de inactividad y el margen para picos.

Lo que Prime Intellect aún no publica con claridad

Prime Inference ofrece un nivel de detalle inusual sobre su infraestructura, pero varios datos relevantes para una compra siguen sin estar claros en el material público indexado:

  • una tabla oficial completa de tarifas por modelo;
  • las reglas de facturación de entrada en caché y tokens de razonamiento para todos los modelos;
  • límites públicos de tasa y concurrencia;
  • un mapa de procesamiento por región;
  • condiciones estándar de retención de datos para solicitudes de inferencia;
  • un SLA formal universal y las compensaciones asociadas;
  • plazos mínimos y precios de capacidad reservada;
  • qué entradas del catálogo están alojadas directamente por Prime y cuáles son modelos de gateway enrutados.

Que algo sea desconocido no significa que no esté disponible. Significa que debe confirmarse en el panel, la documentación, el endpoint de modelos, el contrato o la respuesta comercial, en lugar de inferirlo a partir de la compatibilidad con OpenAI.

Preguntas frecuentes sobre Prime Inference

¿Prime Inference está disponible oficialmente?

Sí. Prime Intellect anunció el lanzamiento público el 2 de octubre de 2026 y publicó una URL base para la API, un comando de CLI y la división de producto entre serverless y capacidad reservada.

¿Prime Inference tiene un nivel gratuito?

La publicación pública de lanzamiento no especifica créditos gratuitos para Prime Inference. Prime Intellect tiene opciones gratuitas o con precio cero en otras partes de su stack de entrenamiento, pero no deben interpretarse como un nivel gratuito de inferencia.

¿Prime Inference es compatible con el SDK de OpenAI?

Sí. Configura la URL base compatible con OpenAI como https://api.pinference.ai/api/v1, proporciona una clave de API de Prime y utiliza un ID de modelo disponible actualmente.

¿Prime Inference admite llamadas a herramientas?

La ruta de serving de GLM-5.3 admite llamadas a herramientas, y Prime Intellect describe mecanismos de cumplimiento de gramática y pruebas de regresión para los esquemas de argumentos. Aun así, conviene comprobar la compatibilidad por modelo, ya que sus capacidades son distintas.

¿Cuántos modelos hay disponibles?

Los directorios públicos mostraban 64 y 111 entradas el 3 de octubre de 2026. Como los recuentos no coinciden, el endpoint de modelos activo de Prime o el panel son las fuentes fiables para conocer el inventario disponible para una cuenta.

¿Prime Inference es más barato que alquilar GPU?

Serverless suele ser más fácil de justificar con tráfico variable; las GPU alquiladas o reservadas pueden resultar económicas con una utilización alta y estable. La respuesta depende de los tokens medidos, la concurrencia, los objetivos de latencia y la capacidad inactiva, no solo del precio por token.

Comprobación de viabilidad en cinco minutos

Prime Inference merece una prueba para equipos que necesitan acceso a modelos abiertos, serving de agentes con contexto largo o una vía para llevar el stack de entrenamiento de Prime Intellect a producción. Sin embargo, no está preparado para una adquisición sin más basándose únicamente en una tabla pública de precios.

  1. Consulta la lista de modelos activa y registra las tarifas exactas de entrada, salida, caché y razonamiento.
  2. Reproduce una conversación larga representativa y mide la latencia hasta el primer token, la velocidad de generación y el total de tokens facturados.
  3. Ejecuta los esquemas reales de herramientas de la aplicación en modos streaming y no streaming.
  4. Solicita las condiciones de retención, región, límites de tasa, SLA y capacidad reservada si la carga es sensible.
  5. Compara el gasto serverless medido con un presupuesto de capacidad reservada solo después de observar el tráfico normal y los picos.

La disyuntiva decisiva es clara: Prime Inference aporta una ingeniería de serving creíble y una API con poca fricción, pero verificar precios y condiciones contractuales aún exige un paso adicional que la propia página de lanzamiento no resuelve.