Prime Inference est déjà disponible : l’offre est compatible OpenAI et conçue pour absorber un trafic d’agents soutenu, pas seulement pour annoncer un produit à venir. Son principal angle mort reste la lisibilité des prix. Le billet de lancement de Prime Intellect détaille l’infrastructure de serving, mais la grille complète par modèle se trouve aujourd’hui plus facilement dans des annuaires de tarifs en direct que sur une page officielle classique.
Prime Inference est lancé, mais les tarifs sont dispersés
Prime Intellect a officiellement lancé Prime Inference le 2 octobre 2026. Le service propose des endpoints serverless pour les besoins variables, ainsi que de la capacité réservée pour les charges continues. L’API publique est dissociée de la flotte de modèles sous-jacente : la capacité peut donc être déplacée ou tomber en panne sans modifier l’endpoint côté client.
Il s’agit bien d’une disponibilité de production, et non d’une liste d’attente. Prime Intellect indique que son premier déploiement public, GLM-5.3, était disponible sur OpenRouter dès le 22 septembre. Les clients directs peuvent quant à eux configurer leurs SDK compatibles OpenAI avec https://api.pinference.ai/api/v1.
Le point à retenir côté prix est simple : la page officielle de lancement promet une facturation unifiée et un suivi de l’usage au niveau des équipes, sans toutefois publier de grille tarifaire exhaustive. Avant d’engager des dépenses, il faut donc vérifier les prix actuels des modèles dans le tableau de bord authentifié ou via l’endpoint des modèles. Les annuaires publics constituent des instantanés utiles, pas des devis contractuels.
Les tarifs actuels de Prime Inference
La facturation de Prime Inference dépend du modèle et de l’usage. Les tokens d’entrée et de sortie sont comptés séparément ; la sortie peut coûter plusieurs fois le prix de l’entrée. Un tarif d’entrée attractif peut donc masquer une facture plus élevée pour des agents de code ou de raisonnement qui produisent de longues réponses.
L’instantané ci-dessous a été relevé le 3 octobre 2026 dans le catalogue Prime Intellect d’endpoints.run, qui recensait 64 endpoints. Vérifiez chaque tarif auprès de Prime Intellect avant tout achat.
| ID du modèle | Entrée / 1 M de tokens | Sortie / 1 M de tokens | Contexte indiqué | Usage recommandé |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | Classification et extraction simple |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | Tâches généralistes à faible coût et contexte long |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | Workflows d’agents et d’outils plus rapides |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | Code et utilisation d’outils |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | Raisonnement à long contexte et vision |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | Charges d’agents GLM haut de gamme |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | Raisonnement avancé |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | Tâches premium à long contexte |
Un second annuaire, Compute Prices, affichait 111 modèles à la même date, avec un plancher exact de $0.027 par million de tokens d’entrée pour Llama 3.2 1B. L’écart entre les tailles de catalogue justifie de consulter l’API en direct plutôt que de considérer l’un ou l’autre annuaire comme un inventaire figé : les listes peuvent employer des espaces de noms différents, inclure des modèles via passerelle ou être mises à jour à des moments distincts.
Trois exemples de coûts concrets
Voici la formule pour estimer le coût des tokens :
(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)
| Charge mensuelle | Modèle et volume de tokens | Facture estimée pour les tokens |
|---|---|---|
| Bot de support léger | Qwen3.7 Flash ; 50 M en entrée + 10 M en sortie | $2.80 |
| Agent de code | Qwen3 Coder Next ; 100 M en entrée + 40 M en sortie | $90.00 |
| Agent phare gourmand en sortie | GLM-5.3 ; 200 M en entrée + 100 M en sortie | $720.00 |
Ces calculs couvrent uniquement les frais de tokens affichés. Ils n’intègrent ni les contrats de capacité réservée, ni l’exécution en sandbox, ni l’entraînement, les évaluations ou la location de GPU. Prime Intellect commercialise ces services séparément : le coût complet d’un agent peut donc dépasser la seule inférence.
La prise en charge de contextes longs ne signifie pas non plus que chaque requête consomme un million de tokens. La facturation porte sur les tokens réellement traités. En revanche, un agent qui renvoie continuellement un historique de 140K tokens peut rapidement accumuler des frais d’entrée si le cache de préfixe ou la gestion du contexte côté application ne limite pas les traitements répétés.
Une simple modification d’endpoint pour configurer l’API
Prime Inference expose un endpoint compatible OpenAI. Une intégration existante avec le SDK OpenAI demande donc généralement seulement une nouvelle URL de base, une clé API et un identifiant de modèle. Le billet de lancement de Prime Intellect donne https://api.pinference.ai/api/v1 comme URL de base.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
La requête cURL équivalente est la suivante :
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime Intellect documente également une utilisation en CLI : installez l’outil prime, authentifiez-vous avec prime login, puis lancez prime inference chat. Avant le déploiement, récupérez la liste actuelle des modèles et reprenez l’ID exact du modèle : les préfixes utilisés par les annuaires varient.
Ce que l’architecture de lancement apporte aux charges d’agents
Prime Inference se distingue surtout lorsque les prompts sont longs, que les sessions reviennent régulièrement et que les appels d’outils doivent rester fiables. Prime Intellect affirme qu’un tour d’agent interne type ajoute environ 6K tokens à un prompt de 140K tokens. Dans ce contexte, la rétention du cache et le routage comptent autant que la vitesse brute de décodage.
Le rapport officiel de lancement fournit plusieurs mesures concrètes issues de son déploiement GLM-5.3 sur matériel GB200 NVL72 :
- La séparation des workers de prefill et de décodage a réduit de près de 40 % la latence inter-token p90 dans les tests de Prime Intellect.
- Avec un objectif de 100 tokens de bout en bout par seconde et par utilisateur, une topologie prefill/décodage 1:4 testée a servi 66 sessions par groupe de prefill à 101 tokens par seconde et par utilisateur.
- La baisse du budget de prefill de 8K à 4K tokens par GPU a ramené l’attente médiane en file de 550 ms à 110 ms et réduit d’environ 20 % le temps médian jusqu’au premier token.
- La compression NVFP4 a fait passer la capacité de cache de 1,09 million à 1,63 million de tokens mis en cache par décodeur, soit environ 50 %, à budget mémoire constant.
- Dans une comparaison TP8 distincte, une disposition du cache par blocs a réduit d’environ 10× le nombre de descripteurs de transfert et fait passer le temps moyen de transfert de 146 ms à 78 ms.
Ces chiffres dépendent de la charge et de la configuration : ils ne constituent pas des garanties de latence universelles. Leur intérêt pratique est de montrer les goulots d’étranglement optimisés par Prime Intellect : réutilisation du cache pour les sessions récurrentes, délai d’admission, interférences entre prefill et décodage, et surcharge liée aux transferts de cache.
L’usage d’outils mérite des tests séparés. Prime Intellect a identifié des cas où des outils non déclarés étaient silencieusement écartés ou où les arguments présentaient des types incorrects, puis a ajouté un décodage contraint et des tests de schéma à son chemin de serving GLM. L’entreprise annonce un taux d’erreur d’appel d’outil proche de zéro, mais les acheteurs devraient tout de même rejouer leurs propres schémas imbriqués, arguments nullables, appels en streaming et requêtes malformées avant de basculer du trafic de production.
Serverless ou capacité réservée : le trafic dicte le choix
Pour la plupart des équipes, le serverless est le point de départ logique : il transforme une demande incertaine en coûts par token. La capacité réservée devient pertinente lorsque la concurrence soutenue, une latence prévisible ou un déploiement personnalisé comptent davantage que l’évitement de capacité inactive.
| Charge | Meilleure option de départ | Pourquoi |
|---|---|---|
| Prototype ou chatbot intermittent | Serverless | Inutile de réserver des GPU inactifs |
| Jobs d’évaluation irréguliers | Serverless pour l’instant | L’inférence batch et asynchrone à tarif réduit figure sur la feuille de route, pas parmi les fonctions de lancement actuelles |
| Service d’agents stable à forte concurrence | Devis pour capacité réservée | La planification de capacité peut primer sur les tarifs nominaux par token |
| Modèle fine-tuné ou LoRA | Confirmer la disponibilité d’abord | Le déploiement dédié en un clic de modèles fine-tunés est présenté comme un élément de feuille de route dans le billet de lancement |
| SLA contractuel strict ou exigence de région | Examen commercial | Les informations publiques de lancement ne détaillent ni contrat universel, ni matrice régionale, ni prix standard de capacité réservée |
Ne partez pas du principe que « réservé » revient automatiquement moins cher. Comparez le coût de capacité proposé avec les dépenses serverless mesurées à une concurrence représentative, en tenant compte des périodes creuses et de la marge nécessaire aux pics.
Les informations que Prime Intellect ne publie pas encore clairement
Prime Inference fournit un niveau de détail inhabituel sur son infrastructure, mais plusieurs éléments d’achat restent flous dans les informations publiques indexées :
- une grille officielle complète des tarifs par modèle ;
- les règles de facturation des entrées mises en cache et des tokens de raisonnement pour chaque modèle ;
- les limites publiques de débit et de concurrence ;
- une carte du traitement des données région par région ;
- les conditions standard de conservation des données pour les requêtes d’inférence ;
- un SLA formel universel et les recours associés ;
- les durées minimales et les tarifs de la capacité réservée ;
- les entrées du catalogue directement hébergées par Prime par rapport aux modèles routés via passerelle.
Une information non publique ne signifie pas qu’elle n’est pas prise en charge. Elle doit simplement être confirmée dans le tableau de bord, la documentation, l’endpoint des modèles, le contrat ou la réponse commerciale, plutôt que déduite de la compatibilité OpenAI.
FAQ Prime Inference
Prime Inference est-il officiellement disponible ?
Oui. Prime Intellect a annoncé la disponibilité publique le 2 octobre 2026 et publié une URL de base d’API, une commande CLI ainsi qu’une offre scindée entre serverless et capacité réservée.
Prime Inference propose-t-il une offre gratuite ?
Le billet de lancement public ne précise pas l’existence de crédits gratuits pour Prime Inference. Prime Intellect propose ailleurs des options gratuites ou à prix nul dans sa pile d’entraînement, mais elles ne doivent pas être assimilées à une offre gratuite d’inférence.
Prime Inference est-il compatible avec le SDK OpenAI ?
Oui. Configurez l’URL de base compatible OpenAI sur https://api.pinference.ai/api/v1, fournissez une clé API Prime et utilisez l’ID d’un modèle actuellement disponible.
Prime Inference prend-il en charge les appels d’outils ?
Le chemin de serving GLM-5.3 prend en charge les appels d’outils, et Prime Intellect décrit l’application de grammaires ainsi que des tests de régression sur les schémas d’arguments. La prise en charge doit toutefois être vérifiée modèle par modèle, car leurs capacités diffèrent.
Combien de modèles sont disponibles ?
Les annuaires publics affichaient 64 et 111 entrées le 3 octobre 2026. Ces totaux divergent : l’endpoint de modèles Prime en direct ou le tableau de bord reste donc la source fiable pour connaître l’inventaire accessible à un compte.
Prime Inference coûte-t-il moins cher que la location de GPU ?
Le serverless est généralement plus facile à justifier pour un trafic variable ; des GPU loués ou réservés peuvent devenir économiques avec une utilisation élevée et stable. La réponse dépend des volumes de tokens mesurés, de la concurrence, des objectifs de latence et de la capacité inactive, pas du seul tarif par token.
La vérification go/no-go en cinq minutes
Prime Inference mérite un test pour les équipes qui cherchent l’accès à des modèles ouverts, le serving d’agents à long contexte ou une passerelle entre la pile d’entraînement de Prime Intellect et la production. En revanche, ses tarifs publics ne suffisent pas encore à un achat sans vérification.
- Interrogez la liste des modèles en direct et relevez les tarifs exacts d’entrée, de sortie, de cache et de raisonnement.
- Rejouez une conversation longue représentative et mesurez la latence jusqu’au premier token, la vitesse de génération et le total de tokens facturés.
- Exécutez les véritables schémas d’outils de l’application en modes streaming et non-streaming.
- Demandez les conditions de rétention, de région, de limites de débit, de SLA et de capacité réservée si la charge est sensible.
- Ne comparez les dépenses serverless mesurées à un devis de capacité réservée qu’après avoir observé le trafic normal et les pics.
Le compromis est net : Prime Inference propose une ingénierie de serving crédible et une API simple à adopter, mais la validation des prix et des contrats exige encore une étape supplémentaire au-delà de la page de lancement.