OpenAI hat die Preise für GPT-5.6 Luna am 30. Juli 2026 um 80 % und für Terra um 20 % gesenkt. Beim Standardtarif von Sol bleibt alles beim Alten. Für Multi-Turn-Agenten gibt es allerdings einen Haken: Cache Writes können einen großen Teil der Ersparnis wieder zunichtemachen, noch bevor sie auf der Rechnung sichtbar wird.
Die neuen GPT-5.6-Preise seit dem 30. Juli 2026
Die reduzierten Preise gelten seit dem 30. Juli 2026 für die bisherigen Modell-IDs. OpenAI begründete die Senkung mit effizienteren Serving-Systemen. Der Standardpreis von GPT-5.6 Sol wurde dagegen nicht verändert.
| Modell | Modell-ID | Input vorher | Input jetzt | Output vorher | Output jetzt |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
Preise pro 1 Mio. Tokens im Standardtarif bei kurzem Kontext, laut OpenAI API-Preisdokumentation (überprüft am 2026-07-31).
Die Aussage „Die GPT-5.6-Reihe ist günstiger geworden“ stimmt damit nur zu zwei Dritteln. Parallel zur Preissenkung führte OpenAI für Sol einen Fast mode ein: $10.00 für Input und $60.00 für Output. Das ist doppelt so teuer wie der Standardtarif, soll aber bei unverändertem zugrunde liegenden Modell bis zu 2.5× mehr Durchsatz liefern. Laut Preisdokumentation hieß Fast mode zuvor priority processing. Am selben Tag wurden also zwei günstigere Stufen billiger, während das Flaggschiff eine teurere Option bekam.
Verwende die vollständige Modell-ID statt nur den Namen der Serie. Im Modellkatalog von OpenAI ist gpt-5.6 als Alias für gpt-5.6-sol aufgeführt. Wer über den Kurznamen versehentlich die günstige Stufe erwartet, zahlt Flaggschiffpreise. Bei Resellern kann dieser Alias sogar ganz fehlen: Über den AIReiter-Endpunkt liefert gpt-5.6 den Fehler Model 'gpt-5.6' not found (getestet am 2026-07-31).
In der Entwickler-Community geht es weniger um die Höhe der Senkung als um die Frage, ob sie dauerhaft tragfähig ist:
There's no way OpenAI's 5.6 models actually cost that little to run — Titel eines r/Anthropic-Threads
Luna ist günstiger als GPT-5.4 nano – welche Stufe lohnt sich jetzt?
Mit $0.20 für Input und $1.20 für Output ist GPT-5.6 Luna pro Output-Token jetzt günstiger als gpt-5.4-nano ($0.20 / $1.25) und deutlich günstiger als gpt-5.4-mini ($0.75 / $4.50). Wer ältere nano- oder mini-Aufrufe ausschließlich aus Kostengründen beibehalten hat, hat dafür keinen Grund mehr.
Um zu prüfen, wie sich die günstige Stufe schlägt, habe ich am 2026-07-31 zwei Aufgaben über den OpenAI-kompatiblen Endpunkt von AIReiter gegen alle drei GPT-5.6-Modelle laufen lassen: die Extraktion eines Support-Tickets in JSON mit festem Schema sowie eine Rechenaufgabe zur Tokenabrechnung mit genau einer richtigen Lösung ($23.71). Jeweils zwei Durchläufe, max_tokens: 4000, keine Retries und eine Pass/Fail-Bewertung gegenüber dem erwarteten Ergebnis.
| Aufgabe | Modell | Input-Tokens | Output-Tokens | Latenz (Lauf 1 / Lauf 2) | Korrekt |
|---|---|---|---|---|---|
| Ticket → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | Ja |
| Terra | 135 | 46 | 2.1s / 2.1s | Ja | |
| Sol | 135 | 46 | 2.3s / 2.2s | Ja | |
| Abrechnungsrechnung | Luna | 119 | 111–122 | 3.1s / 4.3s | Ja |
| Terra | 119 | 87–89 | 3.8s / 2.8s | Ja | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | Ja |
Zwei Beobachtungen stechen dabei heraus.
Bei der Extraktion war Luna die langsamste der drei Stufen, nicht die schnellste: 3.5–4.0s gegenüber 2.1s bei Terra. Günstig bedeutet also nicht automatisch niedrige Latenz.
Sol meldete 4,488 Input-Tokens für einen Prompt, den Terra und Luna beide mit 119 Tokens abrechneten. Davon waren 3,840 als cached_tokens markiert. Das ließ sich in beiden Durchläufen exakt reproduzieren. Bei einem trivialen Prompt („Reply with only the word OK.“) meldeten alle drei Modelle identische 24 Tokens. Die Aufblähung hängt damit offenbar am Prompt und nicht am Modell. Sichtbar sind die Token-Zahlen, nicht ihre Ursache. Das ist gemessenes Abrechnungsverhalten an einem Endpunkt, keine dokumentierte Modelleigenschaft.
Zu den offiziellen Standardtarifen kostete dieselbe korrekte Antwort:
Pro 1.000 Durchläufe: Luna $0.16, Terra $1.29, Sol $7.73. Für dieselbe dreistellige Zahl berechnete Sol ungefähr das 6× von Terra und das 47× von Luna.
Das ist eine kleine Stichprobe mit zwei Durchläufen auf zwei einfachen Aufgaben, kein Benchmark. Sie misst auch keine Reasoning-Qualität. Sie stützt aber eine klare Regel: Mit Luna starten und nur dann eskalieren, wenn die eigene Produktion messbare Fehler zeigt. In diesen Tests brachte die Bezahlung für Sol keinen Zusatznutzen, wenn Terra bereits korrekt geantwortet hatte. Die vollständige Aufteilung nach Workload steht in der Tabelle am Ende.
Warum 80 % weniger Listenpreis nicht automatisch 80 % weniger Rechnung bedeuten
Der beworbene Preis gilt für frische Input- und Output-Tokens. Bei Multi-Turn-Agenten dominiert jedoch oft eine dritte Position: Cache Writes. In allen drei GPT-5.6-Stufen kostet ein Cache Write 12.5× so viel wie ein Cache Read.
| Modell | Gecachter Input (Read) | Cache Write | Verhältnis |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
Wie stark das ins Gewicht fällt, zeigt ein kontrollierter Test, der am 2026-07-11 in der OpenAI Developer Community veröffentlicht wurde. Über sechs aufeinanderfolgende Responses-API-Turns, verbunden über previous_response_id, verbrauchte Luna 3 % weniger Input-Tokens und 29 % weniger Output-Tokens als gpt-5.4-mini, kostete pro Unterhaltung aber dennoch 96 % mehr ($0.0651 statt $0.0332). Etwa 70 % von Lunas Input wurden als Cache Writes abgerechnet. Die Zahlen stammen zwar aus der Zeit vor der Preissenkung, der Mechanismus ist aber unverändert.
Der Auslöser war in dieser Implementierung behebbar – und genau das ist der wichtige Punkt. Der GPT-5.6-Cache bewertet keine Teilübereinstimmungen. Jede Änderung am gecachten Präfix erzwingt daher einen vollständigen Rewrite. Der Autor baute einen wachsenden Snapshot des Gesprächsverlaufs in instructions neu auf und invalidierte damit das Präfix bei jedem Turn.
Die Diagnose ist eindeutig: Stabile Instructions trafen bei 15 von 15 späteren User-Turns den Cache, veränderliche Instructions bei 0 von 15. Nachdem der Kontext in ein Developer-Input-Item verschoben wurde, sank Lunas Aufpreis von 96 % auf 16.7 %. Luna lief anschließend schneller und erzielte in der verblindeten Bewertung des Autors bessere Ergebnisse als mini. Weder prompt_cache_key noch explizite Cache-Breakpoints halfen.
Bevor du davon ausgehst, dass die Preissenkung bei dir angekommen ist, solltest du zwei Dinge tun:
- Alles Veränderliche aus dem gecachten Präfix herausnehmen. Systemtext, Tool-Definitionen und Persona stehen am Anfang und müssen byte-identisch bleiben; der Gesprächszustand gehört in Input-Items.
- Die Aufschlüsselung direkt aus der API auslesen. Das Verhältnis von
usage.prompt_tokens_details.cached_tokenszuusage.prompt_tokenszeigt bei jedem Call den Read-Anteil. Bei einem langlebigen Agenten ist ein niedriger Wert der größte einzelne Kostenfehler dieser Modellreihe.
Drei GPT-5.6-Preise kursieren – welcher gilt für dich?
Wer nach dem Preis von GPT-5.6 Luna sucht, findet mindestens drei unterschiedliche Angaben. Jede davon ist oder war für einen bestimmten Tarif korrekt. Die vermeintlichen Widersprüche lösen sich meist auf, sobald klar ist, auf welche Stufe sich ein Preis bezieht.
| Wo der Preis auftaucht | Luna Input / Output | Einordnung |
|---|---|---|
| $0.20 / $1.20 | Standardtarif, kurzer Kontext | Der Standard für einen normalen API-Call |
| $0.10 / $0.60 | Batch- und Flex-Tarife | Exakt die Hälfte des Standardpreises, für asynchrone und weniger priorisierte Arbeit |
| $0.40 / $2.40 | Fast mode | Doppelter Standardpreis |
| $1.00 / $6.00 | Standardtarif vor dem 30. Juli | Bis zur Senkung korrekt |
Zwei weitere Faktoren stehen in derselben Preisdokumentation: Langer Kontext wird beim Input mit dem 2×-Preis für kurzen Kontext und beim Output mit 1.5× abgerechnet. Lunas Zeile für langen Kontext lautet damit $0.40 / $1.80, nicht $0.40 / $2.40. Außerdem nennen die Dokumente einen Aufschlag von 10 % für berechtigte Data-Residency-Endpunkte bei Modellen, die am oder nach dem 2026-03-05 veröffentlicht wurden. Das betrifft die gesamte GPT-5.6-Reihe.
Wenn eine Preisseite von der Rechnung abweicht, helfen zwei Prüfungen: Erst das angegebene Verifizierungsdatum der Seite kontrollieren, dann mit der offiziellen Preisdokumentation für die tatsächlich genutzte Tarifstufe abgleichen. Aggregatoren und Reseller veröffentlichen außerdem eigene Preise. Das ist nochmals eine eigene Kategorie – nicht unbedingt veraltet, sondern schlicht anders.
Bei AIReiter kosten die drei GPT-5.6-Stufen 50 % von OpenAIs Listenpreis. Das folgte auch der Senkung vom 30. Juli: GPT-5.6 Luna kostet $0.10 / $0.60, Terra $1.00 / $6.00 und Sol $2.50 / $15.00. Dieselbe Halbierung gilt für gecachten Input und Cache Writes.
Für einen Terra-Agenten mit täglich 1 Mio. Input- und 200K Output-Tokens sind das zum Listenpreis $4.40 pro Tag, bei AIReiter $2.20 – bei identischem Call und derselben Modell-ID.
Wo Luna im breiteren Markt einzuordnen ist, ist eine andere Frage. Im Vergleich von 30 Modellen von VentureBeat vom 30. Juli unterbietet Lunas kombinierter Preis von $1.40 Gemini 3.5 Flash-Lite ($2.80) und Gemini 3.1 Flash-Lite ($1.75), liegt aber über DeepSeek v4-flash ($0.42). Wer ausschließlich auf die Kosten schaut, findet die günstigsten LLM-APIs nicht bei OpenAI.
FAQ
Ist GPT-5.6 Sol ebenfalls günstiger geworden?
Nein. Sol bleibt im Standardtarif bei $5.00 für Input und $30.00 für Output pro 1 Mio. Tokens. Neu ist lediglich ein Fast mode zum doppelten Preis, der bis zu 2.5× mehr Durchsatz bietet.
Ist GPT-5.6 Luna jetzt das günstigste API-Modell?
Nein. Mit kombiniert $1.40 pro 1 Mio. Tokens gehört es zu den günstigeren Modellen der Frontier-Serie. In der VentureBeat-Tabelle vom 30. Juli liegen jedoch DeepSeek v4-flash ($0.42), Xiaomis MiMo-V2.5 Flash ($0.40) und DeepSeek v4-pro ($1.305) darunter.
Warum steht auf manchen Seiten noch $1 / $6 für GPT-5.6 Luna?
Das war der Standardpreis vor dem 30. Juli 2026. Prüfe das auf der Seite angegebene Verifizierungsdatum und gleiche anschließend mit der offiziellen Preisdokumentation für deine genutzte Tarifstufe ab.
Gilt die Preissenkung auch für Batch und Flex?
Ja. Batch und Flex kosten jeweils die Hälfte des Standardtarifs. Luna liegt dort also bei $0.10 / $0.60 und Terra bei $1.00 / $6.00; das gilt auch für gecachten Input und Cache Writes.
Muss ich meinen Code ändern, um den neuen Preis zu bekommen?
Nein. Die Preissenkung gilt ohne Migration für die bestehenden Modell-IDs gpt-5.6-luna und gpt-5.6-terra. Sinnvoll ist allerdings ein Audit der Cache-Read-Quote, denn dort geht der Preisvorteil am häufigsten verloren.
Die passende GPT-5.6-Stufe nach Workload
| Workload | Stufe | Begründung |
|---|---|---|
| Extraktion, Tagging und Zusammenfassungen mit hohem Volumen | Luna | Bestand beide Testaufgaben; kombiniert $1.40 pro 1 Mio., jetzt unter gpt-5.4-nano |
| Latenzkritische, nutzernahe Aufrufe | Terra | Bei der Extraktion schneller gemessen als Luna (2.1s gegenüber 3.5–4.0s) |
| Erste Eskalationsstufe, wenn Luna die Qualitätsanforderung verfehlt | Terra | Kombiniert $14 gegenüber $35 bei Sol |
| Aufgaben, bei denen Terra im eigenen Traffic messbar schlechter abschneidet | Sol | Einzige Rechtfertigung für die gemessenen Kosten von 6× gegenüber Terra pro Aufgabe |
| Multi-Turn-Agenten auf jeder Stufe | Zuerst das Caching reparieren | Cache Writes kosten 12.5× so viel wie Reads; ein schlechtes Präfix wiegt stärker als die Stufenwahl |