AIREITER

OpenAI Ultrafast Mode: 14x GPT-5.6 Sol-Tempo, Preis noch offen

Zuletzt aktualisiert: 2026-08-17 00:34:11

Drei OpenAI-Angebote tragen inzwischen „fast“ oder „ultra“ im Namen – doch nur eines erreicht 750 Token pro Sekunde. Der am 13. August 2026 angekündigte OpenAI Ultrafast mode ist ein neuer API-Service-Tier für GPT-5.6 Sol auf Wafer-Scale-Chips von Cerebras und soll bis zu 14-mal schneller als Standard sein. Der Haken: Zugang gibt es nur auf Einladung, einen Preis hat OpenAI nicht veröffentlicht. Der schnellste Tarif, den man heute tatsächlich kaufen kann, bleibt damit Fast mode für $10/$60 pro Million Token.

Drei ähnliche Namen, drei verschiedene Funktionen

Wer GPT-5.6 Sol nutzt, stößt derzeit auf drei Geschwindigkeitsbegriffe mit grundverschiedener Bedeutung. Die Übersicht schafft Klarheit.

NameWas dahinterstecktSo erhält man ZugangSol-Preis (pro 1 Mio. Token)Beworbene Geschwindigkeit
ultra-Reasoning-EinstellungEin Arbeitsmodus für Reasoning, der Subagenten und zusätzliche Rechenleistung auf eine Aufgabe setztCodex-Einstellung, kein separat buchbarer API-TarifKein eigener Tarif; verbraucht Nutzungslimits schnellAbsichtlich langsamer
Fast modeAPI-Verarbeitungstarif, am 30. Juli 2026 von Priority umbenanntservice_tier="fast" in jeder API-Anfrage$10 Input / $60 Output (kurzer Kontext)Bis zu 2,5x Standard
Ultrafast modeCerebras-basierter API-Tarif für GPT-5.6 Sol, Vorschau vom 13. August 2026Begrenzte Vorschau, nur für ausgewählte KundenNicht veröffentlichtBis zu 14x Standard

Die Konzepte zielen in entgegengesetzte Richtungen: ultra ist der Subagent-Arbeitsmodus, der Tempo gegen Gründlichkeit tauscht. Ultrafast mode liefert dagegen reine Decoding-Geschwindigkeit für dasselbe Modell. Dazwischen liegt Fast mode als buchbares Latenz-Upgrade, das OpenAI auf der eigenen Fast-mode-Seite separat dokumentiert.

Was die Vorschau vom 13. August tatsächlich bietet

Ankündigungsseite zu OpenAI Ultrafast mode mit der Geschwindigkeitsvorschau für GPT-5.6 Sol

Die offizielle Ankündigung nennt fünf konkrete Punkte: Ultrafast startet zunächst in der OpenAI API, unterstützt ausschließlich GPT-5.6 Sol, soll bis zu 14-mal schneller als die Standardverarbeitung sein und bis zu 750 Output-Token pro Sekunde liefern. Die Infrastruktur stammt von Cerebras. Zum Start läuft der Dienst als begrenzte Vorschau für eine ausgewählte Kundengruppe, darunter Jane Street, Podium, Basis und Rogo.

Vier für Käufer zentrale Angaben fehlen allerdings: Preis pro Token, Modell-ID, Rate Limits und eine Latenz-SLA. Auch namentlich genannte Benchmarks sucht man vergeblich.

Als Beleg zeigt OpenAI einen Direktvergleich: Ultrafast und Standard Sol erstellen aus demselben Prompt einen 3D-Lagerhaus-Simulator. Ein Zitat von Rogos Alex Wang bringt das Versprechen auf den Punkt: „Ultrafast macht komplexe Finanzrecherche zu einer Echtzeit-Interaktion.“

Von 2,5x auf 14x: Was der Geschwindigkeitsunterschied bedeutet

Balkendiagramm zum Vergleich der beworbenen Geschwindigkeitsmultiplikatoren von Standard, Fast mode und Ultrafast für GPT-5.6 Sol

Zunächst ein wichtiger Messhinweis: Die 750 Token pro Sekunde bezeichnen den beworbenen Output-Durchsatz, während die Angabe für Fast mode eine SLA-Untergrenze ist. Die Kennzahlen hängen zusammen, sind aber nicht identisch. Teilt man 750 durch 14, ergibt sich für Standard Sol ein Decoding-Tempo von rund 54 Token pro Sekunde. Eine Generierung mit 10.000 Token würde damit bei Standard ungefähr 186 Sekunden dauern, bei der Enterprise-SLA-Untergrenze von Fast mode mit 80 Token pro Sekunde bis zu 125 Sekunden und mit Ultrafast etwa 13 Sekunden.

WorkloadStandard (~54 Tok./s, abgeleitet)Fast mode (SLA ≥80 Tok./s)Ultrafast (beworben: 750 Tok./s)
Generierung mit 10.000 Token~186 s≤125 s~13 s
Agent-Loop mit 5 Durchläufen, 1.000 Token/Durchlauf~93 s≤63 s~7 s

Zahlen, die auf r/AIToolsPerformance kursieren, schreiben diese Vergleiche Artificial Analysis und Cerebras zu: Demnach ist Ultrafast 11-mal schneller als Claude Fable 5 und fünfmal schneller als Opus 4.8 im Fast mode. Ein kompletter Durchlauf von Humanity's Last Exam mit 2.500 Fragen soll 11 Stunden und 11 Minuten statt 78 Stunden und 27 Minuten für Fable 5 benötigen. Sämtliche Werte stammen von den Anbietern; eine unabhängige Replikation gibt es bislang nicht.

Der Preis, den außerhalb der Vorschau niemand kennt

OpenAI-Preistabelle für Fast mode für API-Kunden

Öffentlich bekannte Preise für Ultrafast gibt es nicht. In der Ankündigung fehlt jede Tarifangabe, und genau diese Lücke fiel der Community sofort auf. Ein Beitrag auf r/AIToolsPerformance formuliert es so: „Was der Blog nicht sagt, ist der Preis. Niemand außerhalb der Vorschau weiß, was es kostet.“

Als Orientierung bleibt die heute bekannte Preisstaffel für GPT-5.6 Sol, jeweils pro Million Token:

TarifInput (kurzer Kontext)Output (kurzer Kontext)Input (langer Kontext >272k)Output (langer Kontext)Gecachter Input
Standard$5.00$30.00$10.00$45.00$0.50
Fast mode$10.00$60.00$20.00$90.00$1.00
UltrafastNicht veröffentlichtNicht veröffentlichtNicht veröffentlichtNicht veröffentlichtNicht veröffentlicht
Gruppiertes Balkendiagramm mit den Preisen von GPT-5.6 Sol Standard und Fast mode pro Million Token

Für Sol kostet Fast mode exakt das Doppelte von Standard. Aus öffentlichen Informationen lässt sich daraus kein Ultrafast-Preis ableiten, denn Tarife können sich in beide Richtungen bewegen – OpenAI senkte am 30. Juli die Preise für Terra und Luna. Wer ein Latenzbudget plant, sollte auch das Kleingedruckte von Fast mode beachten: Bei mehr als 1 Million Token pro Minute und einem Traffic-Anstieg von über 50 % in weniger als 15 Minuten werden überschüssige Anfragen still auf Standard zurückgestuft. Sie geben dann service_tier="Default" zurück und werden zu Standard-Preisen abgerechnet.

Zugang heute: Einladung statt Warteliste

Ultrafast ist nur per Einladung zugänglich, nicht über eine öffentliche Warteliste. OpenAI erklärt, die Vorschau werde „as capacity grows“ ausgeweitet, und bietet auf der Ankündigungsseite eine Anmeldung für Zugangs-Updates an. Berichte aus dem Juli zählten innerhalb des frühen Sol-Zugangs lediglich rund 20 Organisationen.

Die Infrastruktur kommt nicht aus dem Nichts: Die Partnerschaft zwischen OpenAI und Cerebras besteht seit dem 14. Januar 2026 und reserviert 750 MW Wafer-Scale-Kapazität. GPT-5.3-Codex-Spark erreichte auf derselben Hardware bereits mehr als 1.000 Token pro Sekunde.

Schnellere Ausgaben schon vor der Ultrafast-Einladung

Fast mode steht bereits allen API-Kunden zur Verfügung. Die Aktivierung erfordert nur einen zusätzlichen Parameter:

  1. Bei einer Anfrage an /v1/responses oder /v1/chat/completions service_tier="fast" ergänzen.
  2. Die bisherigen Werte service_tier="priority" funktionieren weiterhin. Bestehende Modelle zeigen in den Nutzungs-Dashboards weiter priority; Modelle nach GPT-5.6 verwenden dort fast.
  3. Für ein ganzes Projekt den Standard unter Project settings -> Default Service Tier -> Fast setzen.
Fast-mode-ModellPreis pro 1 Mio. (Input / Output)Latenz-SLA
GPT-5.6 Sol$10 / $60>80 Tok./s
GPT-5.6 Terra$4 / $24>70 Tok./s
GPT-5.6 Luna$0.40 / $2.40>100 Tok./s

Luna hat von den drei Modellen die höchste SLA-Untergrenze. Cache-Lesezugriffe senken die Input-Kosten um 90 % – bei Standard Sol auf $0.50/M und mit einer TTL von ungefähr 30 Minuten. Für alle Tiers ist eine langlebige Session daher günstiger als ständig neue Anfragen. Wer die Tiers mit echtem Traffic testen will, kann über den GPT-5.6 API endpoint alle drei Modelle über eine Schnittstelle nutzen.

FAQ

Ist Ultrafast mode in ChatGPT oder Codex verfügbar?

Nein. Ultrafast startet zunächst in der OpenAI API. Einen Termin für ChatGPT oder Codex nennt die Ankündigung nicht.

Verändert Cerebras bei GPT-5.6 Sol die Ausgabequalität?

OpenAI beschreibt Ultrafast als dasselbe GPT-5.6 Sol mit höherem Tempo, nicht als anderes Modell. Ein von Cerebras gemeldeter 5,6-facher GDP-Val-Speedup ohne Qualitätsverlust ist bislang die einzige Qualitätsbehauptung. Ein unabhängiger Benchmark hat sie noch nicht bestätigt.

Gibt es eine Latenz-SLA für Ultrafast mode?

Nein, es wurde keine veröffentlicht. Fast mode bietet für Enterprise-Kunden eine p50-SLA von >80 Token/s sowie 99,9 % Uptime; für Ultrafast nennt OpenAI während der Vorschau keine SLA.

Welche Modelle unterstützen Ultrafast mode?

Ausschließlich GPT-5.6 Sol. Terra und Luna unterstützen Fast mode, gehören aber nicht zur Ultrafast-Vorschau.

Wie viel wird Ultrafast mode kosten?

Eine offizielle Preisangabe gibt es nicht. Der veröffentlichte Aufschlag von Fast mode auf das Doppelte von Standard Sol ist der einzige Anhaltspunkt.