Prime Inference ya está disponible: es compatible con OpenAI y está pensado para tráfico sostenido de agentes, no como un simple anuncio de producto futuro. El principal inconveniente es la transparencia de precios. La publicación de lanzamiento de Prime Intellect detalla ampliamente su infraestructura de serving, pero hoy resulta más fácil encontrar la tabla completa de tarifas por modelo en directorios de precios activos que en una página oficial de precios convencional.
Prime Inference ya funciona, pero los precios están repartidos entre varias fuentes
Prime Intellect lanzó oficialmente Prime Inference el 2 de octubre de 2026. El producto ofrece endpoints serverless para demanda variable y capacidad reservada para cargas sostenidas. La API pública está desacoplada de la flota de modelos subyacente, de modo que la capacidad puede trasladarse o fallar sin que cambie el endpoint del cliente.
No se trata de una lista de espera, sino de un lanzamiento para producción. Según Prime Intellect, su primer despliegue público, GLM-5.3, se publicó en OpenRouter el 22 de septiembre, mientras que los clientes directos pueden apuntar SDK compatibles con OpenAI a https://api.pinference.ai/api/v1.
La advertencia sobre precios es sencilla: la página oficial de lanzamiento promete facturación unificada y seguimiento de uso por equipo, pero no publica una tabla completa de tarifas. Por ello, antes de comprometer presupuesto conviene revisar las tarifas actuales de cada modelo en el panel autenticado o en el endpoint de modelos. Los directorios públicos sirven como referencia puntual, no como cotizaciones contractuales.
Precios actuales de Prime Inference
Los precios de Prime Inference dependen del modelo y del uso. Los tokens de entrada y salida se cobran por separado; la salida puede costar varias veces más que la entrada. Por eso, una tarifa de entrada aparentemente baja puede dar una imagen engañosa en agentes de programación o cargas de razonamiento que generan respuestas extensas.
La siguiente referencia se registró el 3 de octubre de 2026 en el catálogo de Prime Intellect de endpoints.run, donde figuraban 64 endpoints. Confirma cada tarifa con Prime Intellect antes de comprar.
| ID del modelo | Entrada / 1 M de tokens | Salida / 1 M de tokens | Contexto indicado | Mejor uso |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | Clasificación y extracción sencilla |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | Trabajo general de contexto largo y bajo coste |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | Flujos más rápidos de agentes y herramientas |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | Programación y uso de herramientas |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | Razonamiento y visión con contexto largo |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | Cargas emblemáticas de agentes con GLM |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | Razonamiento de gama más alta |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | Tareas premium de contexto largo |
Un segundo directorio, Compute Prices, mostraba 111 modelos en la misma fecha y un mínimo exacto de $0.027 por millón de tokens de entrada para Llama 3.2 1B. La discrepancia entre ambos catálogos es motivo suficiente para consultar la API activa en vez de tomar cualquiera de los directorios como un inventario fijo: pueden incluir espacios de nombres distintos, modelos de gateway o actualizarse en momentos diferentes.
Tres ejemplos de coste realistas
El coste de tokens puede calcularse así:
(tokens de entrada ÷ 1,000,000 × tarifa de entrada) + (tokens de salida ÷ 1,000,000 × tarifa de salida)
| Carga mensual | Modelo y volumen de tokens | Factura estimada de tokens |
|---|---|---|
| Bot de soporte ligero | Qwen3.7 Flash; 50M de entrada + 10M de salida | $2.80 |
| Agente de programación | Qwen3 Coder Next; 100M de entrada + 40M de salida | $90.00 |
| Agente emblemático con mucha salida | GLM-5.3; 200M de entrada + 100M de salida | $720.00 |
Estos cálculos solo cubren los cargos publicados por tokens. No incluyen contratos de capacidad reservada, ejecución en sandbox, entrenamiento, evaluaciones ni alquiler de GPU. Prime Intellect comercializa esos servicios por separado, así que la factura integral de un agente puede contener más conceptos que los tokens de inferencia.
El soporte para contexto largo tampoco implica que cada solicitud consuma un millón de tokens. La facturación sigue los tokens realmente procesados. Sin embargo, un agente que reenvía repetidamente un historial de 140K tokens puede acumular cargos de entrada con rapidez si el caché de prefijos o la gestión de contexto en la aplicación no reducen el trabajo repetido.
Configurar la API solo exige cambiar el endpoint
Prime Inference expone un endpoint compatible con OpenAI, por lo que una integración existente con el SDK de OpenAI normalmente solo necesita una nueva URL base, una clave de API y un identificador de modelo. La publicación de lanzamiento de Prime Intellect indica como URL base https://api.pinference.ai/api/v1.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
La solicitud equivalente con cURL es:
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime Intellect también documenta una vía mediante CLI: instala la herramienta prime, autentícate con prime login y ejecuta prime inference chat. Antes de desplegar, recupera la lista actual de modelos y copia el ID exacto: los prefijos de los directorios varían entre catálogos.
Qué cambia esta arquitectura para las cargas de agentes
Prime Inference destaca especialmente cuando los prompts son largos, las sesiones regresan con frecuencia y las llamadas a herramientas deben mantenerse válidas. Prime Intellect afirma que un turno interno típico de un agente añade alrededor de 6K tokens a un prompt de 140K tokens, un escenario en el que la retención de caché y el enrutamiento importan tanto como la velocidad bruta de decodificación.
El informe oficial de lanzamiento aporta varias mediciones concretas de su despliegue de GLM-5.3 sobre hardware GB200 NVL72:
- Separar los workers de prefill y decode redujo casi un 40% la latencia p90 entre tokens en las pruebas de Prime Intellect.
- Con un objetivo de 100 tokens de extremo a extremo por segundo y usuario, una topología probada de prefill/decode 1:4 atendió 66 sesiones por grupo de prefill a 101 tokens por segundo y usuario.
- Reducir el presupuesto de prefill de 8K a 4K tokens por GPU recortó la espera mediana en cola de 550 ms a 110 ms y redujo aproximadamente un 20% el tiempo mediano hasta el primer token.
- La compresión NVFP4 elevó la capacidad de caché de 1.09 millones a 1.63 millones de tokens almacenados en caché por decodificador, aproximadamente un 50%, con el mismo presupuesto de memoria.
- Una disposición de caché block-major redujo cerca de 10× los descriptores de transferencia y bajó el tiempo medio de transferencia de 146 ms a 78 ms en una comparación TP8 independiente.
Son cifras específicas de una carga y una configuración, no garantías universales de latencia. Su valor práctico está en que Prime Intellect hace públicos los cuellos de botella que optimizó: reutilización de caché en sesiones recurrentes, demora de admisión, interferencia entre prefill y decode, y sobrecarga de transferencia de caché.
El uso de herramientas merece una prueba independiente. Prime Intellect detectó casos en los que herramientas no declaradas se descartaban silenciosamente o los argumentos tenían tipos incorrectos, y añadió decodificación restringida y pruebas de esquemas a su ruta de serving de GLM. La empresa informa de una tasa de errores de llamadas a herramientas cercana a cero, pero los compradores deberían reproducir sus propios esquemas anidados, argumentos anulables, llamadas en streaming y solicitudes malformadas antes de redirigir tráfico de producción.
Serverless o capacidad reservada: depende del patrón de tráfico
Para la mayoría de equipos, serverless es el punto de partida sensato porque convierte una demanda incierta en cargos por tokens. La capacidad reservada cobra relevancia cuando la concurrencia sostenida, una latencia predecible o un despliegue personalizado pesan más que evitar capacidad inactiva.
| Carga de trabajo | Mejor opción inicial | Motivo |
|---|---|---|
| Prototipo o chatbot intermitente | Serverless | No hace falta reservar GPU inactivas |
| Trabajos de evaluación con picos | Serverless por ahora | La inferencia batch y asíncrona de menor precio figura en la hoja de ruta, no como función disponible en el lanzamiento |
| Servicio de agentes estable y con alta concurrencia | Presupuesto de capacidad reservada | La planificación de capacidad puede importar más que las tarifas nominales por token |
| Modelo fine-tuned o LoRA | Confirma la disponibilidad primero | El despliegue dedicado con un clic de modelos fine-tuned se describe como trabajo futuro en la publicación de lanzamiento |
| SLA contractual estricto o requisito de región | Revisión comercial | El material público de lanzamiento no establece un contrato universal, una matriz de regiones ni un precio estándar de capacidad reservada |
No des por hecho que «reservada» cuesta automáticamente menos. Compara el coste presupuestado de capacidad con el gasto serverless medido a una concurrencia representativa, incluidos los periodos de inactividad y el margen para picos.
Lo que Prime Intellect aún no publica con claridad
Prime Inference ofrece un nivel de detalle inusual sobre su infraestructura, pero varios datos relevantes para una compra siguen sin estar claros en el material público indexado:
- una tabla oficial completa de tarifas por modelo;
- las reglas de facturación de entrada en caché y tokens de razonamiento para todos los modelos;
- límites públicos de tasa y concurrencia;
- un mapa de procesamiento por región;
- condiciones estándar de retención de datos para solicitudes de inferencia;
- un SLA formal universal y las compensaciones asociadas;
- plazos mínimos y precios de capacidad reservada;
- qué entradas del catálogo están alojadas directamente por Prime y cuáles son modelos de gateway enrutados.
Que algo sea desconocido no significa que no esté disponible. Significa que debe confirmarse en el panel, la documentación, el endpoint de modelos, el contrato o la respuesta comercial, en lugar de inferirlo a partir de la compatibilidad con OpenAI.
Preguntas frecuentes sobre Prime Inference
¿Prime Inference está disponible oficialmente?
Sí. Prime Intellect anunció el lanzamiento público el 2 de octubre de 2026 y publicó una URL base para la API, un comando de CLI y la división de producto entre serverless y capacidad reservada.
¿Prime Inference tiene un nivel gratuito?
La publicación pública de lanzamiento no especifica créditos gratuitos para Prime Inference. Prime Intellect tiene opciones gratuitas o con precio cero en otras partes de su stack de entrenamiento, pero no deben interpretarse como un nivel gratuito de inferencia.
¿Prime Inference es compatible con el SDK de OpenAI?
Sí. Configura la URL base compatible con OpenAI como https://api.pinference.ai/api/v1, proporciona una clave de API de Prime y utiliza un ID de modelo disponible actualmente.
¿Prime Inference admite llamadas a herramientas?
La ruta de serving de GLM-5.3 admite llamadas a herramientas, y Prime Intellect describe mecanismos de cumplimiento de gramática y pruebas de regresión para los esquemas de argumentos. Aun así, conviene comprobar la compatibilidad por modelo, ya que sus capacidades son distintas.
¿Cuántos modelos hay disponibles?
Los directorios públicos mostraban 64 y 111 entradas el 3 de octubre de 2026. Como los recuentos no coinciden, el endpoint de modelos activo de Prime o el panel son las fuentes fiables para conocer el inventario disponible para una cuenta.
¿Prime Inference es más barato que alquilar GPU?
Serverless suele ser más fácil de justificar con tráfico variable; las GPU alquiladas o reservadas pueden resultar económicas con una utilización alta y estable. La respuesta depende de los tokens medidos, la concurrencia, los objetivos de latencia y la capacidad inactiva, no solo del precio por token.
Comprobación de viabilidad en cinco minutos
Prime Inference merece una prueba para equipos que necesitan acceso a modelos abiertos, serving de agentes con contexto largo o una vía para llevar el stack de entrenamiento de Prime Intellect a producción. Sin embargo, no está preparado para una adquisición sin más basándose únicamente en una tabla pública de precios.
- Consulta la lista de modelos activa y registra las tarifas exactas de entrada, salida, caché y razonamiento.
- Reproduce una conversación larga representativa y mide la latencia hasta el primer token, la velocidad de generación y el total de tokens facturados.
- Ejecuta los esquemas reales de herramientas de la aplicación en modos streaming y no streaming.
- Solicita las condiciones de retención, región, límites de tasa, SLA y capacidad reservada si la carga es sensible.
- Compara el gasto serverless medido con un presupuesto de capacidad reservada solo después de observar el tráfico normal y los picos.
La disyuntiva decisiva es clara: Prime Inference aporta una ingeniería de serving creíble y una API con poca fricción, pero verificar precios y condiciones contractuales aún exige un paso adicional que la propia página de lanzamiento no resuelve.