AIREITER

KI-Bild

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Mehr

KI-Video

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Mehr

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Mehr
DemnächstSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
API-DOKSPREISE
BlogUpdatesLLM API GuideClaude API GuideKimi K3 API Guide
VORLAGEN
  • AIReiter
  • Blog
  • GPT-5.6-Preissenkung: Was Luna und Terra jetzt wirklich kosten

GPT-5.6-Preissenkung: Was Luna und Terra jetzt wirklich kosten

Zuletzt aktualisiert: 2026-07-31 10:58:53

OpenAI hat die Preise für GPT-5.6 Luna am 30. Juli 2026 um 80 % und für Terra um 20 % gesenkt. Beim Standardtarif von Sol bleibt alles beim Alten. Für Multi-Turn-Agenten gibt es allerdings einen Haken: Cache Writes können einen großen Teil der Ersparnis wieder zunichtemachen, noch bevor sie auf der Rechnung sichtbar wird.

Die neuen GPT-5.6-Preise seit dem 30. Juli 2026

Die reduzierten Preise gelten seit dem 30. Juli 2026 für die bisherigen Modell-IDs. OpenAI begründete die Senkung mit effizienteren Serving-Systemen. Der Standardpreis von GPT-5.6 Sol wurde dagegen nicht verändert.

ModellModell-IDInput vorherInput jetztOutput vorherOutput jetzt
GPT-5.6 Lunagpt-5.6-luna$1.00$0.20$6.00$1.20
GPT-5.6 Terragpt-5.6-terra$2.50$2.00$15.00$12.00
GPT-5.6 Solgpt-5.6-sol$5.00$5.00$30.00$30.00

Preise pro 1 Mio. Tokens im Standardtarif bei kurzem Kontext, laut OpenAI API-Preisdokumentation (überprüft am 2026-07-31).

OpenAI-API-Preistabelle mit den Tarifen für gpt-5.6-sol, gpt-5.6-terra und gpt-5.6-luna pro 1 Mio. Tokens

Die Aussage „Die GPT-5.6-Reihe ist günstiger geworden“ stimmt damit nur zu zwei Dritteln. Parallel zur Preissenkung führte OpenAI für Sol einen Fast mode ein: $10.00 für Input und $60.00 für Output. Das ist doppelt so teuer wie der Standardtarif, soll aber bei unverändertem zugrunde liegenden Modell bis zu 2.5× mehr Durchsatz liefern. Laut Preisdokumentation hieß Fast mode zuvor priority processing. Am selben Tag wurden also zwei günstigere Stufen billiger, während das Flaggschiff eine teurere Option bekam.

Gruppiertes Balkendiagramm zum kombinierten GPT-5.6-Preis für Input und Output pro 1 Mio. Tokens vor und nach dem 30. Juli

Verwende die vollständige Modell-ID statt nur den Namen der Serie. Im Modellkatalog von OpenAI ist gpt-5.6 als Alias für gpt-5.6-sol aufgeführt. Wer über den Kurznamen versehentlich die günstige Stufe erwartet, zahlt Flaggschiffpreise. Bei Resellern kann dieser Alias sogar ganz fehlen: Über den AIReiter-Endpunkt liefert gpt-5.6 den Fehler Model 'gpt-5.6' not found (getestet am 2026-07-31).

In der Entwickler-Community geht es weniger um die Höhe der Senkung als um die Frage, ob sie dauerhaft tragfähig ist:

There's no way OpenAI's 5.6 models actually cost that little to run — Titel eines r/Anthropic-Threads

Luna ist günstiger als GPT-5.4 nano – welche Stufe lohnt sich jetzt?

Mit $0.20 für Input und $1.20 für Output ist GPT-5.6 Luna pro Output-Token jetzt günstiger als gpt-5.4-nano ($0.20 / $1.25) und deutlich günstiger als gpt-5.4-mini ($0.75 / $4.50). Wer ältere nano- oder mini-Aufrufe ausschließlich aus Kostengründen beibehalten hat, hat dafür keinen Grund mehr.

Um zu prüfen, wie sich die günstige Stufe schlägt, habe ich am 2026-07-31 zwei Aufgaben über den OpenAI-kompatiblen Endpunkt von AIReiter gegen alle drei GPT-5.6-Modelle laufen lassen: die Extraktion eines Support-Tickets in JSON mit festem Schema sowie eine Rechenaufgabe zur Tokenabrechnung mit genau einer richtigen Lösung ($23.71). Jeweils zwei Durchläufe, max_tokens: 4000, keine Retries und eine Pass/Fail-Bewertung gegenüber dem erwarteten Ergebnis.

AufgabeModellInput-TokensOutput-TokensLatenz (Lauf 1 / Lauf 2)Korrekt
Ticket → JSONLuna13577–784.0s / 3.5sJa
Terra135462.1s / 2.1sJa
Sol135462.3s / 2.2sJa
AbrechnungsrechnungLuna119111–1223.1s / 4.3sJa
Terra11987–893.8s / 2.8sJa
Sol4,48884–873.5s / 3.2sJa

Zwei Beobachtungen stechen dabei heraus.

Bei der Extraktion war Luna die langsamste der drei Stufen, nicht die schnellste: 3.5–4.0s gegenüber 2.1s bei Terra. Günstig bedeutet also nicht automatisch niedrige Latenz.

Sol meldete 4,488 Input-Tokens für einen Prompt, den Terra und Luna beide mit 119 Tokens abrechneten. Davon waren 3,840 als cached_tokens markiert. Das ließ sich in beiden Durchläufen exakt reproduzieren. Bei einem trivialen Prompt („Reply with only the word OK.“) meldeten alle drei Modelle identische 24 Tokens. Die Aufblähung hängt damit offenbar am Prompt und nicht am Modell. Sichtbar sind die Token-Zahlen, nicht ihre Ursache. Das ist gemessenes Abrechnungsverhalten an einem Endpunkt, keine dokumentierte Modelleigenschaft.

Zu den offiziellen Standardtarifen kostete dieselbe korrekte Antwort:

Balkendiagramm der gemessenen Kosten pro 1.000 Durchläufe für Luna, Terra und Sol bei derselben Aufgabe

Pro 1.000 Durchläufe: Luna $0.16, Terra $1.29, Sol $7.73. Für dieselbe dreistellige Zahl berechnete Sol ungefähr das 6× von Terra und das 47× von Luna.

Das ist eine kleine Stichprobe mit zwei Durchläufen auf zwei einfachen Aufgaben, kein Benchmark. Sie misst auch keine Reasoning-Qualität. Sie stützt aber eine klare Regel: Mit Luna starten und nur dann eskalieren, wenn die eigene Produktion messbare Fehler zeigt. In diesen Tests brachte die Bezahlung für Sol keinen Zusatznutzen, wenn Terra bereits korrekt geantwortet hatte. Die vollständige Aufteilung nach Workload steht in der Tabelle am Ende.

Warum 80 % weniger Listenpreis nicht automatisch 80 % weniger Rechnung bedeuten

Der beworbene Preis gilt für frische Input- und Output-Tokens. Bei Multi-Turn-Agenten dominiert jedoch oft eine dritte Position: Cache Writes. In allen drei GPT-5.6-Stufen kostet ein Cache Write 12.5× so viel wie ein Cache Read.

ModellGecachter Input (Read)Cache WriteVerhältnis
GPT-5.6 Luna$0.02$0.2512.5×
GPT-5.6 Terra$0.20$2.5012.5×
GPT-5.6 Sol$0.50$6.2512.5×

Wie stark das ins Gewicht fällt, zeigt ein kontrollierter Test, der am 2026-07-11 in der OpenAI Developer Community veröffentlicht wurde. Über sechs aufeinanderfolgende Responses-API-Turns, verbunden über previous_response_id, verbrauchte Luna 3 % weniger Input-Tokens und 29 % weniger Output-Tokens als gpt-5.4-mini, kostete pro Unterhaltung aber dennoch 96 % mehr ($0.0651 statt $0.0332). Etwa 70 % von Lunas Input wurden als Cache Writes abgerechnet. Die Zahlen stammen zwar aus der Zeit vor der Preissenkung, der Mechanismus ist aber unverändert.

Der Auslöser war in dieser Implementierung behebbar – und genau das ist der wichtige Punkt. Der GPT-5.6-Cache bewertet keine Teilübereinstimmungen. Jede Änderung am gecachten Präfix erzwingt daher einen vollständigen Rewrite. Der Autor baute einen wachsenden Snapshot des Gesprächsverlaufs in instructions neu auf und invalidierte damit das Präfix bei jedem Turn.

Die Diagnose ist eindeutig: Stabile Instructions trafen bei 15 von 15 späteren User-Turns den Cache, veränderliche Instructions bei 0 von 15. Nachdem der Kontext in ein Developer-Input-Item verschoben wurde, sank Lunas Aufpreis von 96 % auf 16.7 %. Luna lief anschließend schneller und erzielte in der verblindeten Bewertung des Autors bessere Ergebnisse als mini. Weder prompt_cache_key noch explizite Cache-Breakpoints halfen.

Bevor du davon ausgehst, dass die Preissenkung bei dir angekommen ist, solltest du zwei Dinge tun:

  1. Alles Veränderliche aus dem gecachten Präfix herausnehmen. Systemtext, Tool-Definitionen und Persona stehen am Anfang und müssen byte-identisch bleiben; der Gesprächszustand gehört in Input-Items.
  2. Die Aufschlüsselung direkt aus der API auslesen. Das Verhältnis von usage.prompt_tokens_details.cached_tokens zu usage.prompt_tokens zeigt bei jedem Call den Read-Anteil. Bei einem langlebigen Agenten ist ein niedriger Wert der größte einzelne Kostenfehler dieser Modellreihe.

Drei GPT-5.6-Preise kursieren – welcher gilt für dich?

Wer nach dem Preis von GPT-5.6 Luna sucht, findet mindestens drei unterschiedliche Angaben. Jede davon ist oder war für einen bestimmten Tarif korrekt. Die vermeintlichen Widersprüche lösen sich meist auf, sobald klar ist, auf welche Stufe sich ein Preis bezieht.

Wo der Preis auftauchtLuna Input / OutputEinordnung
$0.20 / $1.20Standardtarif, kurzer KontextDer Standard für einen normalen API-Call
$0.10 / $0.60Batch- und Flex-TarifeExakt die Hälfte des Standardpreises, für asynchrone und weniger priorisierte Arbeit
$0.40 / $2.40Fast modeDoppelter Standardpreis
$1.00 / $6.00Standardtarif vor dem 30. JuliBis zur Senkung korrekt

Zwei weitere Faktoren stehen in derselben Preisdokumentation: Langer Kontext wird beim Input mit dem 2×-Preis für kurzen Kontext und beim Output mit 1.5× abgerechnet. Lunas Zeile für langen Kontext lautet damit $0.40 / $1.80, nicht $0.40 / $2.40. Außerdem nennen die Dokumente einen Aufschlag von 10 % für berechtigte Data-Residency-Endpunkte bei Modellen, die am oder nach dem 2026-03-05 veröffentlicht wurden. Das betrifft die gesamte GPT-5.6-Reihe.

Wenn eine Preisseite von der Rechnung abweicht, helfen zwei Prüfungen: Erst das angegebene Verifizierungsdatum der Seite kontrollieren, dann mit der offiziellen Preisdokumentation für die tatsächlich genutzte Tarifstufe abgleichen. Aggregatoren und Reseller veröffentlichen außerdem eigene Preise. Das ist nochmals eine eigene Kategorie – nicht unbedingt veraltet, sondern schlicht anders.

Bei AIReiter kosten die drei GPT-5.6-Stufen 50 % von OpenAIs Listenpreis. Das folgte auch der Senkung vom 30. Juli: GPT-5.6 Luna kostet $0.10 / $0.60, Terra $1.00 / $6.00 und Sol $2.50 / $15.00. Dieselbe Halbierung gilt für gecachten Input und Cache Writes.

AIReiter-Preistabelle mit einem Vergleich der offiziellen GPT-5.6-API-Preise und AIReiter-Tarife für Luna, Terra und Sol

Für einen Terra-Agenten mit täglich 1 Mio. Input- und 200K Output-Tokens sind das zum Listenpreis $4.40 pro Tag, bei AIReiter $2.20 – bei identischem Call und derselben Modell-ID.

Wo Luna im breiteren Markt einzuordnen ist, ist eine andere Frage. Im Vergleich von 30 Modellen von VentureBeat vom 30. Juli unterbietet Lunas kombinierter Preis von $1.40 Gemini 3.5 Flash-Lite ($2.80) und Gemini 3.1 Flash-Lite ($1.75), liegt aber über DeepSeek v4-flash ($0.42). Wer ausschließlich auf die Kosten schaut, findet die günstigsten LLM-APIs nicht bei OpenAI.

FAQ

Ist GPT-5.6 Sol ebenfalls günstiger geworden?

Nein. Sol bleibt im Standardtarif bei $5.00 für Input und $30.00 für Output pro 1 Mio. Tokens. Neu ist lediglich ein Fast mode zum doppelten Preis, der bis zu 2.5× mehr Durchsatz bietet.

Ist GPT-5.6 Luna jetzt das günstigste API-Modell?

Nein. Mit kombiniert $1.40 pro 1 Mio. Tokens gehört es zu den günstigeren Modellen der Frontier-Serie. In der VentureBeat-Tabelle vom 30. Juli liegen jedoch DeepSeek v4-flash ($0.42), Xiaomis MiMo-V2.5 Flash ($0.40) und DeepSeek v4-pro ($1.305) darunter.

Warum steht auf manchen Seiten noch $1 / $6 für GPT-5.6 Luna?

Das war der Standardpreis vor dem 30. Juli 2026. Prüfe das auf der Seite angegebene Verifizierungsdatum und gleiche anschließend mit der offiziellen Preisdokumentation für deine genutzte Tarifstufe ab.

Gilt die Preissenkung auch für Batch und Flex?

Ja. Batch und Flex kosten jeweils die Hälfte des Standardtarifs. Luna liegt dort also bei $0.10 / $0.60 und Terra bei $1.00 / $6.00; das gilt auch für gecachten Input und Cache Writes.

Muss ich meinen Code ändern, um den neuen Preis zu bekommen?

Nein. Die Preissenkung gilt ohne Migration für die bestehenden Modell-IDs gpt-5.6-luna und gpt-5.6-terra. Sinnvoll ist allerdings ein Audit der Cache-Read-Quote, denn dort geht der Preisvorteil am häufigsten verloren.

Die passende GPT-5.6-Stufe nach Workload

WorkloadStufeBegründung
Extraktion, Tagging und Zusammenfassungen mit hohem VolumenLunaBestand beide Testaufgaben; kombiniert $1.40 pro 1 Mio., jetzt unter gpt-5.4-nano
Latenzkritische, nutzernahe AufrufeTerraBei der Extraktion schneller gemessen als Luna (2.1s gegenüber 3.5–4.0s)
Erste Eskalationsstufe, wenn Luna die Qualitätsanforderung verfehltTerraKombiniert $14 gegenüber $35 bei Sol
Aufgaben, bei denen Terra im eigenen Traffic messbar schlechter abschneidetSolEinzige Rechtfertigung für die gemessenen Kosten von 6× gegenüber Terra pro Aufgabe
Multi-Turn-Agenten auf jeder StufeZuerst das Caching reparierenCache Writes kosten 12.5× so viel wie Reads; ein schlechtes Präfix wiegt stärker als die Stufenwahl

>_AIReiter Modellverzeichnis

Schneller API-Zugriff auf Modelle zu diesem Guide

GPT-5.6 Luna

Chat

Ein ausgewogenes GPT-5.6-Textmodell für alltägliches Programmieren, Schreiben und Agenten-Workflows.

OpenAIAPI-Key erstellen >

GPT-5.6 Terra

Chat

Ein stärkeres GPT-5.6-Textmodell für reasoning-intensive Coding- und Analyseaufgaben.

OpenAIAPI-Key erstellen >

GPT-5.6 Sol

Chat

Ein Premium-Textmodell auf GPT-5.6-Basis für anspruchsvolle Coding-, Reasoning- und langformatige Agentenarbeit.

OpenAIAPI-Key erstellen >

Gemini 3.1 Pro

Chat
GoogleAPI-Key erstellen >

Gemini 3 Pro

Chat
GoogleAPI-Key erstellen >

Neueste Beiträge

Ungültiger API-Key: 401 und 403 richtig einordnen, bevor du etwas änderst

2026-07-31

OpenRouter 429 beheben: Provider-Fehler oder Rate Limit?

2026-07-31

DeepSeek V4 Flash vs. GLM-5.2: Das 0731-Update im Test

2026-07-31

B2B-Ad-Intelligence gibt es oft nur als HTML: Ein Parser, der Redesigns übersteht

2026-07-31
AIREITER

Fragen? Kontaktieren Sie uns unter
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

KI-Video

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

KI-Bild

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Blog

Alle anzeigen →

Unternehmen

DatenschutzrichtlinieNutzungsbedingungenRückerstattungsrichtlinie

© 2026 AIReiter. Alle Rechte vorbehalten.