Prime Inference è finalmente disponibile, parla il linguaggio delle API OpenAI ed è pensato per gestire il traffico continuo degli agenti, non per restare una semplice promessa. Il punto meno limpido riguarda però i prezzi: il post di lancio di Prime Intellect descrive bene l'infrastruttura di serving, mentre il listino completo per modello è oggi più facile da consultare nei cataloghi di pricing attivi che su una normale pagina ufficiale.
Prime Inference è disponibile, ma per i prezzi bisogna incrociare più fonti
Prime Intellect ha lanciato ufficialmente Prime Inference il 2 ottobre 2026. Il servizio offre endpoint serverless per gestire una domanda variabile e capacità riservata per i carichi continuativi. L'API pubblica è separata dal parco macchine sottostante, così capacità e nodi possono cambiare o non essere disponibili senza modificare l'endpoint usato dal client.
Non si tratta di una lista d'attesa, ma di un rilascio pronto all'uso. Prime Intellect afferma che il primo deployment pubblico, GLM-5.3, è arrivato su OpenRouter il 22 settembre, mentre chi usa direttamente il servizio può puntare gli SDK compatibili con OpenAI a https://api.pinference.ai/api/v1.
La situazione dei prezzi è semplice da riassumere: la pagina ufficiale promette fatturazione unificata e monitoraggio dei consumi a livello di team, ma non pubblica una tabella completa delle tariffe. Prima di impegnare budget è quindi necessario controllare i prezzi dei singoli modelli nella dashboard autenticata o nell'endpoint dei modelli. I cataloghi pubblici sono fotografie aggiornate del momento, non preventivi contrattuali.
Quanto costa oggi Prime Inference
Prime Inference applica prezzi a consumo diversi per ogni modello. I token in input e in output vengono fatturati separatamente; l'output può costare diverse volte più dell'input. Per gli agenti di coding o i carichi di ragionamento, quindi, una tariffa d'ingresso apparentemente bassa può essere fuorviante se le risposte sono lunghe.
La tabella seguente è stata registrata il 3 ottobre 2026 nel catalogo di Prime Intellect su endpoints.run, che riportava 64 endpoint. Prima di acquistare, verificate ogni tariffa direttamente su Prime Intellect.
| ID modello | Input / 1M token | Output / 1M token | Contesto indicato | Utilizzo ideale |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | Classificazione ed estrazione semplice |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | Attività generiche a basso costo con contesto esteso |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | Agenti più rapidi e flussi di lavoro con strumenti |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | Coding e utilizzo di strumenti |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | Ragionamento e visione con contesto esteso |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | Carichi agentici con il modello GLM di punta |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | Ragionamento di fascia alta |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | Attività premium con contesto esteso |
Lo stesso giorno, un secondo catalogo, Compute Prices, mostrava 111 modelli e indicava un minimo preciso di $0.027 per milione di token in input per Llama 3.2 1B. La differenza nel numero di modelli è un buon motivo per interrogare l'API in tempo reale invece di considerare uno dei due cataloghi come un inventario definitivo: le liste possono comprendere namespace diversi, modelli del gateway o aggiornamenti effettuati in momenti differenti.
Tre esempi realistici di costo
Il costo dei token si può stimare con:
(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)
| Carico mensile | Modello e volume di token | Stima della spesa per i token |
|---|---|---|
| Bot di supporto leggero | Qwen3.7 Flash; 50M input + 10M output | $2.80 |
| Agente di coding | Qwen3 Coder Next; 100M input + 40M output | $90.00 |
| Agente di punta con molto output | GLM-5.3; 200M input + 100M output | $720.00 |
Questi calcoli includono soltanto i costi dei token indicati. Restano fuori i contratti di capacità riservata, l'esecuzione in sandbox, il training, le valutazioni e il noleggio delle GPU. Prime Intellect vende questi servizi separatamente, quindi il conto complessivo di un agente può includere molto più della sola inferenza.
Il supporto al contesto lungo non significa che ogni richiesta consumi un milione di token. La fatturazione segue i token effettivamente elaborati. Tuttavia, un agente che reinvia continuamente una cronologia da 140K token può accumulare rapidamente costi di input, a meno che il prefix caching o una gestione del contesto a livello applicativo non riducano il lavoro ripetuto.
Per configurare l'API basta cambiare un endpoint
Prime Inference espone un endpoint compatibile con OpenAI. In genere, un'integrazione già basata su OpenAI SDK richiede soltanto un nuovo base URL, una chiave API e l'identificativo del modello. Nel post di lancio, Prime Intellect indica come base URL https://api.pinference.ai/api/v1.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
La richiesta equivalente con cURL è:
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime Intellect documenta anche un percorso via CLI: installate lo strumento prime, autenticatelo con prime login e poi avviate prime inference chat. Prima del deployment, recuperate l'elenco aggiornato dei modelli e copiate l'ID esatto: i prefissi cambiano da un catalogo all'altro.
Cosa cambia l'architettura di lancio per i carichi agentici
Prime Inference dà il meglio quando i prompt sono lunghi, le sessioni vengono riaperte di frequente e le chiamate agli strumenti devono restare affidabili. Prime Intellect spiega che un tipico turno di un agente interno aggiunge circa 6K token a un prompt da 140K token: in questo scenario, la conservazione della cache e il routing contano quanto la velocità pura di generazione.
Il report ufficiale del lancio riporta diverse misurazioni concrete ottenute con il deployment di GLM-5.3 su hardware GB200 NVL72:
- La separazione tra i worker di prefill e quelli di decode ha ridotto di quasi il 40% la latenza inter-token p90 nei test di Prime Intellect.
- Con un obiettivo di 100 token al secondo end-to-end per utente, una topologia prefill/decode 1:4 testata ha gestito 66 sessioni per gruppo di prefill a 101 token al secondo per utente.
- Ridurre il budget di prefill da 8K a 4K token per GPU ha portato l'attesa mediana in coda da 550 ms a 110 ms e ridotto di circa il 20% il tempo mediano al primo token.
- La compressione NVFP4 ha aumentato la capacità della cache da 1,09 milioni a 1,63 milioni di token memorizzati per decoder, circa il 50% in più, a parità di memoria disponibile.
- Un layout della cache di tipo block-major ha ridotto di circa 10 volte i descrittori di trasferimento e portato il tempo medio di trasferimento da 146 ms a 78 ms in un confronto TP8 separato.
Si tratta di numeri legati a carichi e configurazioni specifiche, non di garanzie universali sulla latenza. Il loro valore pratico sta nel mostrare quali colli di bottiglia Prime Intellect ha cercato di risolvere: riutilizzo della cache nelle sessioni ricorrenti, ritardi di ammissione, interferenze tra prefill e decode e costi del trasferimento della cache.
L'uso degli strumenti merita una verifica separata. Prime Intellect ha riscontrato casi in cui gli strumenti non dichiarati venivano scartati silenziosamente o gli argomenti ricevevano tipi errati, per poi aggiungere decoding vincolato e test sugli schemi al proprio percorso di serving GLM. L'azienda riferisce un tasso di errore nelle chiamate agli strumenti quasi nullo, ma prima di spostare il traffico di produzione è comunque opportuno riprodurre i propri schemi annidati, gli argomenti nullable, le chiamate in streaming e le richieste malformate.
Serverless o capacità riservata: la scelta dipende dal profilo del traffico
Per la maggior parte dei team, il serverless è il punto di partenza più sensato perché trasforma una domanda incerta in costi basati sui token. La capacità riservata diventa interessante quando la concorrenza sostenuta, una latenza prevedibile o un deployment personalizzato contano più della possibilità di evitare capacità inattiva.
| Carico di lavoro | Opzione migliore per iniziare | Motivo |
|---|---|---|
| Prototipo o chatbot intermittente | Serverless | Non serve riservare GPU inattive |
| Job di valutazione con picchi | Serverless per ora | L'inferenza batch e asincrona a prezzo ridotto è indicata nella roadmap, non tra le funzioni disponibili al lancio |
| Servizio agentico stabile ad alta concorrenza | Preventivo per capacità riservata | La pianificazione della capacità può contare più delle tariffe nominali per token |
| Modello fine-tuned o LoRA | Verificare prima la disponibilità | Il deployment dedicato con un clic dei modelli fine-tuned è descritto nel post di lancio come lavoro in roadmap |
| SLA contrattuale stringente o requisito geografico | Verifica con il team commerciale | Il materiale pubblico del lancio non indica un contratto universale, una matrice delle regioni o un prezzo standard per la capacità riservata |
Non date per scontato che “riservato” significhi automaticamente più economico. Confrontate il costo della capacità proposta con la spesa serverless misurata a una concorrenza rappresentativa, includendo i periodi inattivi e il margine necessario per i picchi.
Le informazioni che Prime Intellect non pubblica ancora con chiarezza
Prime Inference offre un livello di dettaglio sull'infrastruttura superiore alla media, ma diversi elementi importanti per l'acquisto restano poco chiari nel materiale pubblico indicizzato:
- un listino ufficiale completo per modello;
- le regole di fatturazione dei token in cache e dei token di ragionamento per ogni modello;
- limiti pubblici di velocità e concorrenza;
- una mappa dei trattamenti dati regione per regione;
- termini standard di conservazione dei dati per le richieste di inferenza;
- un SLA formale universale e i relativi rimedi;
- durata minima e prezzi della capacità riservata;
- quali voci del catalogo siano ospitate direttamente da Prime e quali siano modelli instradati tramite gateway.
Il fatto che un'informazione non sia pubblicata non significa che il servizio non la supporti. Significa che questi aspetti vanno confermati nella dashboard, nella documentazione, nell'endpoint dei modelli, nel contratto o tramite il team commerciale, senza dedurli dalla sola compatibilità con OpenAI.
Domande frequenti su Prime Inference
Prime Inference è ufficialmente disponibile?
Sì. Prime Intellect ha annunciato il rilascio pubblico il 2 ottobre 2026 e ha pubblicato un base URL per l'API, un comando CLI e la distinzione tra prodotto serverless e capacità riservata.
Prime Inference offre un piano gratuito?
Il post pubblico del lancio non specifica crediti gratuiti per Prime Inference. Prime Intellect offre opzioni gratuite o a costo zero in altre aree del proprio stack di training, ma non vanno considerate un piano gratuito per l'inferenza.
Prime Inference è compatibile con OpenAI SDK?
Sì. Impostate il base URL compatibile con OpenAI su https://api.pinference.ai/api/v1, inserite una chiave API Prime e utilizzate un ID modello attualmente disponibile.
Prime Inference supporta le chiamate agli strumenti?
Il percorso di serving di GLM-5.3 supporta le chiamate agli strumenti e Prime Intellect descrive meccanismi di enforcement della grammatica e test di regressione per gli schemi degli argomenti. Il supporto va comunque verificato per ogni modello, perché le capacità non sono identiche.
Quanti modelli sono disponibili?
Il 3 ottobre 2026 i cataloghi pubblici mostravano rispettivamente 64 e 111 voci. Poiché i conteggi non coincidono, per conoscere l'inventario disponibile per il proprio account la fonte affidabile è l'endpoint live dei modelli Prime o la dashboard.
Prime Inference costa meno del noleggio di GPU?
Il serverless è in genere più facile da giustificare con traffico variabile; GPU noleggiate o riservate possono diventare più convenienti quando l'utilizzo è alto e stabile. La risposta dipende da token effettivi, concorrenza, obiettivi di latenza e capacità inattiva, non soltanto dal prezzo per token.
Un controllo go/no-go in cinque minuti
Prime Inference merita una prova se avete bisogno di accedere a modelli open, servire agenti con contesti lunghi o portare in produzione i modelli addestrati con lo stack di Prime Intellect. Non è invece prudente procedere a un acquisto senza verifiche basandosi soltanto su un listino pubblico.
- Interrogate l'elenco live dei modelli e annotate le tariffe esatte per input, output, cache e ragionamento.
- Riproducete una conversazione lunga e rappresentativa, misurando latenza al primo token, velocità di generazione e totale dei token fatturati.
- Eseguite gli schemi reali degli strumenti dell'applicazione in modalità streaming e non streaming.
- Se il carico è sensibile, chiedete informazioni su conservazione dei dati, regioni, limiti di velocità, SLA e condizioni della capacità riservata.
- Confrontate la spesa serverless misurata con un preventivo per capacità riservata soltanto dopo aver osservato il traffico normale e quello di picco.
Il compromesso decisivo è chiaro: Prime Inference offre un'architettura di serving credibile e un'API facile da integrare, ma per verificare prezzi e condizioni contrattuali serve ancora un passaggio aggiuntivo rispetto a quanto comunica direttamente la pagina di lancio.