Prime Inference ist verfügbar, OpenAI-kompatibel und auf dauerhaft laufende Agent-Workloads ausgelegt – nicht bloß eine Produktankündigung für irgendwann. Der Haken: Bei den Preisen fehlt es noch an Transparenz. Im Launch-Beitrag erklärt Prime Intellect den Serving-Stack ausführlich, eine vollständige Preisliste pro Modell ist derzeit jedoch eher in aktiven Preisverzeichnissen als auf einer klassischen offiziellen Preisseite zu finden.
Prime Inference ist verfügbar – die Preise stehen aber an mehreren Stellen
Prime Intellect hat Prime Inference am 2. Oktober 2026 offiziell veröffentlicht. Zum Angebot gehören serverlose Endpunkte für schwankende Nachfrage und reservierte Kapazität für dauerhaft laufende Workloads. Die öffentliche API ist dabei vom zugrunde liegenden Modellbestand entkoppelt, sodass sich Kapazitäten verschieben oder ausfallen können, ohne den Client-Endpunkt zu ändern.
Das ist ein Produktivstart und keine Warteliste. Prime Intellect zufolge ging die erste öffentliche Bereitstellung, GLM-5.3, am 22. September auf OpenRouter live. Direkte Clients können OpenAI-kompatible SDKs dagegen auf https://api.pinference.ai/api/v1 zeigen lassen.
Der Preisvorbehalt ist schnell erklärt: Auf der offiziellen Launch-Seite werden eine einheitliche Abrechnung und eine nutzerbezogene Verbrauchsübersicht für Teams versprochen, eine vollständige Preistabelle fehlt jedoch. Die aktuellen Modellpreise sollten deshalb vor einer Ausgabenfreigabe im authentifizierten Dashboard oder über den Models-Endpunkt geprüft werden. Öffentliche Verzeichnisse sind hilfreiche Momentaufnahmen, aber keine vertraglich verbindlichen Angebote.
Was Prime Inference aktuell kostet
Die Preise von Prime Inference hängen vom Modell ab und werden nutzungsbasiert berechnet. Eingabe- und Ausgabetokens werden getrennt abgerechnet. Die Ausgabe kann ein Mehrfaches der Eingabe kosten – gerade bei Coding-Agenten oder Reasoning-Workloads mit langen Antworten ist ein niedriger Eingabepreis daher nicht automatisch günstig.
Die folgende Momentaufnahme stammt vom 3. Oktober 2026 und basiert auf dem Prime-Intellect-Katalog von endpoints.run, der 64 Endpunkte aufführte. Vor dem Kauf sollten alle Preise direkt bei Prime Intellect überprüft werden.
| Modell-ID | Eingabe / 1 Mio. Tokens | Ausgabe / 1 Mio. Tokens | Angegebener Kontext | Geeignet für |
|---|---|---|---|---|
meta-llama/Llama-3.2-1B-Instruct | $0.03 | $0.20 | 60K | Klassifizierung und einfache Extraktion |
qwen/qwen3.7-flash | $0.03 | $0.13 | 1M | Günstige Aufgaben mit langem Kontext |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1M | Schnellere Agenten- und Tool-Workflows |
qwen/qwen3-coder-next | $0.30 | $1.50 | 262K | Programmierung und Tool-Nutzung |
deepseek/deepseek-v4.1-flash | $0.30 | $1.20 | 1M | Reasoning und Vision mit langem Kontext |
z-ai/glm-5.3 | $1.40 | $4.40 | 1M | Anspruchsvolle GLM-Agenten-Workloads |
deepseek/deepseek-v4-pro | $1.91 | $3.83 | 1M | Hochwertigeres Reasoning |
moonshotai/kimi-k3 | $3.45 | $17.25 | 1M | Premium-Aufgaben mit langem Kontext |
Ein zweites Verzeichnis, Compute Prices, zeigte am selben Tag 111 Modelle und für Llama 3.2 1B einen exakten Tiefstpreis von $0.027 pro einer Million Eingabetokens. Die unterschiedlichen Katalogzahlen sprechen dafür, die Live-API abzufragen, statt eines der beiden Verzeichnisse als festen Modellbestand zu betrachten: Die Einträge können unterschiedliche Namensräume oder Gateway-Modelle enthalten oder zu verschiedenen Zeitpunkten aktualisiert worden sein.
Drei realistische Kostenbeispiele
Die Tokenkosten lassen sich mit folgender Formel schätzen:
(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)
| Monatlicher Workload | Modell und Tokenvolumen | Geschätzte Tokenkosten |
|---|---|---|
| Support-Bot für kleinere Anfragen | Qwen3.7 Flash; 50M Eingabe + 10M Ausgabe | $2.80 |
| Coding-Agent | Qwen3 Coder Next; 100M Eingabe + 40M Ausgabe | $90.00 |
| Ausgabelastiger Spitzen-Agent | GLM-5.3; 200M Eingabe + 100M Ausgabe | $720.00 |
Diese Berechnungen berücksichtigen nur die angegebenen Tokenpreise. Kosten für Verträge mit reservierter Kapazität, Sandbox-Ausführung, Training, Evaluierungen oder GPU-Miete sind nicht enthalten. Prime Intellect bietet diese Leistungen separat an – eine vollständige Agentenrechnung kann daher mehr als nur Inference-Tokens umfassen.
Unterstützung für lange Kontexte bedeutet außerdem nicht, dass jede Anfrage eine Million Tokens verbraucht. Abgerechnet werden die tatsächlich verarbeiteten Tokens. Ein Agent, der jedoch wiederholt einen Verlauf mit 140K Tokens mitsendet, kann schnell hohe Eingabekosten verursachen, sofern Prefix-Caching oder ein gutes Kontextmanagement auf Anwendungsebene diese Wiederholungen nicht reduziert.
Die API ist mit einer Änderung am Endpunkt eingerichtet
Prime Inference stellt einen OpenAI-kompatiblen Endpunkt bereit. Eine bestehende OpenAI-SDK-Integration benötigt daher in der Regel lediglich eine neue Basis-URL, einen API-Schlüssel und eine Modell-ID. Prime Intellect nennt im Launch-Beitrag die Basis-URL https://api.pinference.ai/api/v1.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_PRIME_API_KEY",
base_url="https://api.pinference.ai/api/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "user", "content": "Write a haiku about KV caches."}
],
stream=False,
)
print(response.choices[0].message.content)
Die entsprechende cURL-Anfrage sieht so aus:
curl https://api.pinference.ai/api/v1/chat/completions \
-H "Authorization: Bearer $PRIME_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "user", "content": "Write a haiku about KV caches."}
]
}'
Prime Intellect dokumentiert außerdem einen CLI-Weg: Installieren Sie das Tool prime, authentifizieren Sie sich mit prime login und starten Sie anschließend prime inference chat. Vor dem Produktiveinsatz sollte die aktuelle Modellliste abgerufen und die exakte Modell-ID übernommen werden, denn die Präfixe unterscheiden sich je nach Katalog.
Was die Architektur für Agenten-Workloads bedeutet
Seine größten Vorteile spielt Prime Inference aus, wenn Prompts lang sind, Sitzungen regelmäßig fortgesetzt werden und Tool-Aufrufe zuverlässig funktionieren müssen. Prime Intellect zufolge fügt ein typischer interner Agenten-Turn einem 140K-Token-Prompt rund 6K Tokens hinzu. Cache-Erhalt und Routing sind damit ebenso wichtig wie die reine Decodiergeschwindigkeit.
Der offizielle Launch-Bericht nennt mehrere konkrete Messwerte aus der GLM-5.3-Bereitstellung auf GB200-NVL72-Hardware:
- Die Trennung von Prefill- und Decode-Workern senkte in den Tests von Prime Intellect die p90-Latenz zwischen Tokens um fast 40 %.
- Bei einem Zielwert von 100 End-to-End-Tokens pro Sekunde und Nutzer versorgte eine getestete Prefill/Decode-Topologie im Verhältnis 1:4 pro Prefill-Gruppe 66 Sitzungen mit 101 Tokens pro Sekunde und Nutzer.
- Die Reduzierung des Prefill-Budgets von 8K auf 4K Tokens pro GPU senkte die mediane Wartezeit in der Warteschlange von 550 ms auf 110 ms und verringerte die mediane Zeit bis zum ersten Token um ungefähr 20 %.
- NVFP4-Kompression erhöhte die Cache-Kapazität bei unverändertem Speicherbudget von 1,09 Millionen auf 1,63 Millionen gecachte Tokens pro Decoder – also um etwa 50 %.
- Ein blockbasiertes Cache-Layout reduzierte die Zahl der Transfer-Deskriptoren um etwa das Zehnfache. In einem separaten TP8-Vergleich sank die mittlere Transferzeit von 146 ms auf 78 ms.
Diese Werte hängen vom jeweiligen Workload und der Konfiguration ab und sind keine allgemeingültigen Garantien für die Latenz. Ihr praktischer Wert liegt darin, dass Prime Intellect die optimierten Engpässe offenlegt: die Wiederverwendung von Caches bei fortgesetzten Sitzungen, die Zulassungsverzögerung, Interferenzen zwischen Prefill und Decode sowie den Overhead beim Cache-Transfer.
Tool-Nutzung sollte separat getestet werden. Prime Intellect stieß auf Fälle, in denen nicht deklarierte Tools stillschweigend verworfen wurden oder Argumente den falschen Typ hatten. Daraufhin ergänzte das Unternehmen Constrained Decoding und Schema-Tests für seinen GLM-Serving-Pfad. Prime Intellect berichtet von einer nahezu fehlerfreien Tool-Call-Rate. Vor einer Umstellung des Produktivverkehrs sollten Käufer dennoch eigene verschachtelte Schemas, nullable Argumente, Streaming-Aufrufe und fehlerhafte Anfragen durchspielen.
Serverlos oder reserviert? Entscheidend ist das Traffic-Muster
Für die meisten Teams ist Serverless der sinnvollere Einstieg, weil sich unsichere Nachfrage direkt in Tokenkosten übersetzen lässt. Reservierte Kapazität wird interessant, wenn dauerhaft hohe Parallelität, planbare Latenzen oder eine individuelle Bereitstellung wichtiger sind als das Vermeiden ungenutzter Kapazität.
| Workload | Bessere Einstiegsoption | Grund |
|---|---|---|
| Prototyp oder Chatbot mit unregelmäßiger Nutzung | Serverless | Keine GPUs für Leerlaufzeiten reservieren |
| Stoßweise Evaluierungsjobs | Zunächst Serverless | Batch- und asynchrone Inference zu niedrigeren Preisen stehen auf der Roadmap und sind kein aktuelles Launch-Feature |
| Agentenservice mit dauerhaft hoher Parallelität | Angebot für reservierte Kapazität | Kapazitätsplanung kann wichtiger sein als nominelle Tokenpreise |
| Feinabgestimmtes oder per LoRA angepasstes Modell | Verfügbarkeit zuerst bestätigen | Die Bereitstellung feinabgestimmter Modelle per One-Click wird im Launch-Beitrag als Roadmap-Thema beschrieben |
| Strenge vertragliche SLA oder regionale Vorgabe | Prüfung durch den Vertrieb | Die öffentlichen Launch-Materialien nennen keine allgemeingültige Vereinbarung, keine Regionenübersicht und keinen Standardpreis für reservierte Kapazität |
„Reserviert“ bedeutet nicht automatisch „günstiger“. Vergleichen Sie die Kosten der angebotenen Kapazität mit den gemessenen Serverless-Ausgaben bei repräsentativer Parallelität – einschließlich Leerlaufzeiten und Reserve für Spitzenlasten.
Welche Angaben Prime Intellect weiterhin nicht eindeutig veröffentlicht
Prime Inference liefert ungewöhnlich viele Details zur Infrastruktur. Mehrere für den Einkauf wichtige Informationen sind in öffentlich auffindbaren Materialien jedoch weiterhin unklar:
- eine vollständige offizielle Preisliste pro Modell;
- Abrechnungsregeln für gecachte Eingaben und Reasoning-Tokens bei jedem Modell;
- öffentliche Limits für Rate und Parallelität;
- eine Verarbeitungskarte nach Regionen;
- standardisierte Aufbewahrungsfristen für Inference-Anfragen;
- eine allgemeingültige formale SLA einschließlich zugesicherter Leistungen bei Verstößen;
- Mindestlaufzeiten und Preise für reservierte Kapazität;
- welche Katalogeinträge direkt von Prime gehostet werden und welche über Gateway-Modelle geroutet sind.
Unklar heißt nicht, dass diese Punkte nicht unterstützt werden. Es bedeutet lediglich, dass sie im Dashboard, in der Dokumentation, über den Model-Endpunkt, im Vertrag oder durch den Vertrieb bestätigt werden sollten, statt sie aus der OpenAI-Kompatibilität abzuleiten.
Prime Inference: Häufige Fragen
Ist Prime Inference offiziell verfügbar?
Ja. Prime Intellect hat die öffentliche Veröffentlichung am 2. Oktober 2026 angekündigt und eine API-Basis-URL, einen CLI-Befehl sowie die Aufteilung in serverlose und reservierte Produkte veröffentlicht.
Gibt es bei Prime Inference ein kostenloses Kontingent?
Der öffentliche Launch-Beitrag nennt keine kostenlosen Prime-Inference-Credits. Prime Intellect bietet an anderer Stelle in seinem Trainings-Stack kostenlose oder mit null bepreiste Optionen an. Diese sollten jedoch nicht als kostenloses Inference-Kontingent verstanden werden.
Ist Prime Inference mit dem OpenAI-SDK kompatibel?
Ja. Setzen Sie die OpenAI-kompatible Basis-URL auf https://api.pinference.ai/api/v1, hinterlegen Sie einen Prime-API-Schlüssel und verwenden Sie eine aktuell verfügbare Modell-ID.
Unterstützt Prime Inference Tool-Calling?
Der GLM-5.3-Serving-Pfad unterstützt Tool-Calling. Prime Intellect beschreibt außerdem Grammar Enforcement und Regressionstests für Argument-Schemas. Die Unterstützung sollte dennoch für jedes Modell einzeln geprüft werden, da sich die Fähigkeiten der Modelle unterscheiden.
Wie viele Modelle sind verfügbar?
Öffentliche Verzeichnisse führten am 3. Oktober 2026 insgesamt 64 beziehungsweise 111 Einträge auf. Da sich die Zahlen unterscheiden, sind der aktive Prime-Model-Endpunkt oder das Dashboard die verlässlichen Quellen für den Bestand, der für ein Konto verfügbar ist.
Ist Prime Inference günstiger als das Mieten von GPUs?
Serverless lässt sich bei schwankendem Traffic meist leichter rechtfertigen. Gemietete oder reservierte GPUs können bei hoher, stabiler Auslastung wirtschaftlicher werden. Die Antwort hängt von gemessenen Tokenmengen, Parallelität, Latenzzielen und ungenutzter Kapazität ab – nicht allein vom Tokenpreis.
Der Fünf-Minuten-Check für eine Go/No-Go-Entscheidung
Prime Inference ist für Teams einen Test wert, die Zugriff auf offene Modelle, Agenten-Serving mit langem Kontext oder einen Weg vom Trainings-Stack von Prime Intellect in die Produktion benötigen. Für eine blinde Beschaffung reicht eine öffentliche Preisliste allein jedoch noch nicht aus.
- Rufen Sie die aktuelle Modellliste ab und dokumentieren Sie die exakten Preise für Eingabe, Ausgabe, Cache und Reasoning.
- Spielen Sie ein repräsentatives langes Gespräch durch und messen Sie die Latenz bis zum ersten Token, die Generierungsgeschwindigkeit und die insgesamt abgerechneten Tokens.
- Führen Sie die echten Tool-Schemas der Anwendung im Streaming- und im Nicht-Streaming-Modus aus.
- Fordern Sie bei sensiblen Workloads Angaben zu Aufbewahrung, Region, Rate-Limits, SLA und reservierter Kapazität an.
- Vergleichen Sie die gemessenen Serverless-Ausgaben erst dann mit einem Angebot für reservierte Kapazität, wenn normaler und Spitzen-Traffic beobachtet wurden.
Die entscheidende Abwägung ist klar: Prime Inference bietet solide Serving-Technik und eine unkomplizierte API. Preise und Vertragsbedingungen müssen vor dem Einsatz jedoch weiterhin in einem zusätzlichen Schritt geprüft werden – die Launch-Seite allein liefert diese Sicherheit nicht.