AIREITER

Gemini 4 Argon API-Preise und Zugriff: Was jetzt verfügbar ist

Zuletzt aktualisiert: 2026-10-01 07:24:33

Google hat Gemini 4 Argon angekündigt. Das bedeutet allerdings noch lange nicht, dass sich das Modell bereits über eine API aufrufen lässt. Am 1. Oktober 2026 erklärt Google, dass Argon zunächst an vertrauenswürdige Cybersecurity-Verteidiger ausgerollt wird. Bezahlte API-Kunden und Google-AI-Ultra-Abonnenten sollen danach folgen; einen Termin für die allgemeine Verfügbarkeit gibt es nicht. Die sinnvollste Entscheidung ist daher, das Budget einzuplanen und eine Evaluierung vorzubereiten – nicht, eine vermutlich falsche Modellbezeichnung fest zu verdrahten.

Gemini 4 Argon ist angekündigt, aber noch keine allgemein verfügbare API

Gemini 4 Argon ist real und wurde am 30. September 2026 offiziell von Google DeepMind angekündigt. Der öffentliche Status lautet jedoch weiterhin eingeschränkter Zugriff, nicht allgemeine Freigabe. Laut Googles Launch-Ankündigung erhält zunächst eine externe Gruppe aus vertrauenswürdigen Cybersecurity-Verteidigern im Fairwind-Programm Zugang. Entwickler, Unternehmen und Verbraucher sollen „so bald wie möglich“ folgen.

Veröffentlichte Preise bedeuten nicht, dass Argon in deinem API-Konto aktiviert ist. Deploye deshalb nicht gegen einen vermuteten Endpunkt oder eine angenommene Modell-ID.

Was Google am 30. September tatsächlich freigeschaltet hat

Der Rollout lässt sich praktisch in vier Zugriffsstufen einteilen:

ZugriffsgruppeStatus am 1. Oktober 2026Bedeutung
Vertrauenswürdige Cybersecurity-Verteidiger im Fairwind-ProgrammWird ausgerolltFrüher externer Zugriff auf eine Version für defensive Cybersecurity-Arbeit
Interne Google-TeamsBereits intern im EinsatzBeleg für die interne Nutzung, aber kein Anspruch auf eine öffentliche API
Bezahlte Gemini-API-Kunden und AI-Ultra-AbonnentenNächste Gruppe, kein TerminGoogle spricht von „so bald wie möglich“, nennt aber kein konkretes Datum
Allgemeine Entwickler, Unternehmen und VerbraucherOhne TerminKeine Grundlage, um einen Produktionsstart rund um Argon zu planen

Keine dieser Aussagen liefert eine stabile öffentliche Modell-ID, einen Zeitplan für Rate Limits oder einen garantierten Starttermin für Google AI Studio beziehungsweise Vertex AI.

Die offizielle Ankündigung von Gemini 4 Argon ist maßgeblich für die Angaben zum Rollout. Für eine tatsächlich nutzbare öffentliche Preisliste sollte die aktuelle Dokumentation zu den Gemini-API-Preisen als Referenz dienen. Bei der Prüfung war Argon dort noch nicht aufgeführt.

Gemini-4-Argon-API: Preise vor der Verfügbarkeit

Google hat Einführungspreise pro 1 Million Tokens angekündigt. Nach der Einführungsphase, deren Enddatum noch nicht veröffentlicht wurde, sollen sich die Preise verdoppeln.

AbrechnungspostenEinführungspreisSpäterer Preis
Input-Tokens2,00 $ / 1 Mio.4,00 $ / 1 Mio.
Gecachter Input0,10 $ / 1 Mio., angegeben als 95 % RabattNicht angegeben
Output-Tokens10,00 $ / 1 Mio.20,00 $ / 1 Mio.

Bei einem einfachen Agentenaufruf mit 200.000 Input-Tokens, davon 150.000 aus dem Cache, 50.000 nicht gecacht, sowie 40.000 Output-Tokens ergibt sich zum Einführungspreis eine Schätzung von 0,515 $:

  1. 50.000 nicht gecachte Input-Tokens kosten 0,10 $.
  2. 150.000 gecachte Input-Tokens kosten 0,015 $.
  3. 40.000 Output-Tokens kosten 0,40 $.
  4. Gesamtsumme: 0,515 $ vor weiteren Gebühren des Anbieters oder der Plattform.

Zu den später veröffentlichten Input- und Output-Preisen würde der Anteil für nicht gecachte Eingaben und Ausgaben 1,00 $ betragen. Die Gesamtsumme bleibt unbekannt, weil Google keinen späteren Preis für gecachte Eingaben genannt hat. Der Output ist der größte Kostenblock. Eine Ausgabe von 1 Million Tokens ist deshalb eine Budgetobergrenze, aber kein sinnvoller Standard: Sie würde zum Einführungspreis für den Output 10 $ kosten, später 20 $ – jeweils zuzüglich der Eingabekosten.

Plane nicht ausschließlich mit dem Einführungspreis. Wenn ein Feature bei 2/10 $ funktioniert, bei 4/20 $ aber nicht mehr wirtschaftlich ist, ist es noch nicht produktionsreif. Rate Limits, regionale Verfügbarkeit, Batch-Konditionen, das endgültige Cache-Verhalten und das Enddatum der Einführungsphase sind weiterhin offen.

Was die veröffentlichten Argon-Daten belegen – und was nicht

Google positioniert Argon für langfristige Softwareentwicklung, Wissensarbeit in Unternehmen, das Verständnis langer Videos und defensive Cybersecurity. In den Launch-Materialien nennt das Unternehmen folgende Ergebnisse:

BenchmarkGemeldetes ErgebnisEinordnung der Datenlage
DeepSWE v1.177,9 %Von Google gemeldetes Ergebnis für Softwareentwicklung
AutomationBench51,3 %Von Google gemeldetes Ergebnis für durchgängige Geschäftsprozesse
LVBench91,7 %Von Google gemeldetes Ergebnis für lange Videos
CWE-bench v168 %Von Google gemeldetes Ergebnis für die Behebung von Schwachstellen

Artificial Analysis meldete für den Snapshot mit hohem Reasoning-Anteil früh einen Intelligence-Index-Wert von 53. Geschwindigkeitsdaten waren dort nicht verfügbar. Das liefert Kontext, ist aber keine Garantie für die Latenz. Googles Benchmark-Ergebnisse rechtfertigen workload-spezifische Tests – nicht die Annahme, dass Argon bei jeder Aufgabe überlegen ist.

Das Output-Limit von 1 Million Tokens verändert die Architektur

Google zufolge kann Argon bis zu 1 Million Output-Tokens erzeugen – gegenüber 64.000 bei früheren Gemini-Modellen. Dadurch könnte es seltener nötig sein, eine große Migration oder einen umfangreichen Bericht in viele zusammengefügte Antworten aufzuteilen. Gleichzeitig entstehen drei operative Risiken.

Erstens kann eine lange Antwort erst spät fehlschlagen. Streame die Ausgabe und speichere Zwischenstände, damit eine abgebrochene Verbindung nicht aus einem fast fertigen Auftrag eine unbrauchbare Rechnung macht. Zweitens steigt mit der Ausgabemenge auch der Prüfaufwand. Selbst eine große Code-Migration braucht Tests, Diff-Reviews und klar definierte Rollback-Grenzen. Drittens nimmt die Latenz mit der Ausgabelänge zu, wodurch sehr lange Generierungen für interaktive Oberflächen ungeeignet werden.

Setze für jeden Aufruf ein explizites Output-Limit. Für Extraktion und Chat genügt ein niedriger Wert, für begrenzte Codeänderungen ein höherer und für Berichte oder Migrationen ein auf den jeweiligen Auftrag zugeschnittenes Budget. Das Limit von 1 Million Tokens ist nützlich, wenn eine Aufgabe es tatsächlich erfordert. Es ist kein Grund, jeden Agenten ohne Begrenzung laufen zu lassen.

Ein sicherer Migrationsplan für Entwickler

Du kannst dich vorbereiten, ohne so zu tun, als wäre Argon bereits verfügbar.

  1. Lege den Modellnamen in GEMINI_MODEL ab, nicht in der Anwendungslogik.
  2. Halte GEMINI_API_KEY aus der Versionsverwaltung heraus.
  3. Stelle 20–50 repräsentative Aufgaben aus dem eigenen Repository, Dokumentenbestand oder Agenten-Traces zusammen.
  4. Erfasse Tokens, Latenz, Wiederholungen, Tool-Fehler, akzeptierte Ergebnisse, manuelle Nachbearbeitungszeit und abgerechnete Kosten.
  5. Prüfe beim Öffnen des Zugriffs die für dein Konto verfügbaren Modelle über Googles Models-API-Referenz. Rate nicht gemini-4-argon.
  6. Lass denselben Testsatz vor einer Umstellung des Traffics gegen dein aktuelles Produktionsmodell laufen.

Ein minimaler Python-Aufruf kann modellunabhängig aufgebaut sein und folgt dabei Googles Referenz zum Gemini-API-Python-SDK:

import os
from google import genai
from google.genai import types

client = genai.Client()
model = os.environ["GEMINI_MODEL"]

response = client.models.generate_content(
    model=model,
    contents="Review this bounded code change and list concrete risks.",
    config=types.GenerateContentConfig(max_output_tokens=32000),
)
print(response.text)

Dieses Beispiel behauptet nicht, dass GEMINI_MODEL=gemini-4-argon heute funktioniert. Sobald Google die offizielle ID veröffentlicht, solltest du vor einer Deployment-Änderung prüfen, ob die Antwort der Model-List-Abfrage und die API-Dokumentation übereinstimmen.

Wer warten sollte – und wer sich jetzt vorbereiten kann

WorkloadEntscheidung heuteBegründung
Große Refactorings und lang laufende Coding-AgentenEvaluierung vorbereitenDas Output-Limit und das DeepSWE-Ergebnis zielen auf diesen Workload
Analyse mehrerer juristischer oder finanzieller DokumenteEvaluierung vorbereitenWissensarbeit in Unternehmen und anhaltendes Reasoning gehören zur Positionierung des Launchs
Kurzer Support, Extraktion oder KlassifizierungBei einem günstigeren, validierten Modell bleibenArgons Kosten und Latenz auf Frontier-Niveau dürften sich hier kaum rechnen
Defensive SchwachstellenforschungWenn berechtigt, über den dokumentierten Fairwind-Weg bewerbenDer früheste Zugriff ist begrenzt und auf Cybersecurity ausgerichtet
Produktstart, der in diesem Monat von einem Modell abhängtNicht auf Argon setzenEs gibt weder eine öffentliche Modell-ID noch einen Termin für die allgemeine Verfügbarkeit

Die praktische Empfehlung lautet daher: Routing statt automatischer Ablösung. Behalte ein schnelles Basismodell für Routineanfragen und reserviere Argon für lange, schwierige Aufgaben – und zwar erst, nachdem die eigenen Akzeptanztests bestanden sind.

Gemini 4 Argon: Häufige Fragen

Ist Gemini 4 Argon für alle verfügbar?

Nein. Google rollt das Modell zunächst über Fairwind an vertrauenswürdige Cybersecurity-Verteidiger aus. Bezahlte API-Kunden und Google-AI-Ultra-Abonnenten werden als nächste Gruppen genannt, aber einen öffentlichen Termin für die allgemeine Verfügbarkeit gibt es nicht.

Wie lautet die Modell-ID der Gemini-4-Argon-API?

Google hatte in den am 1. Oktober 2026 geprüften Launch-Materialien noch keine stabile öffentliche Modell-ID veröffentlicht. Frage die für deine eigenen Zugangsdaten verfügbaren Modelle ab, statt davon auszugehen, dass gemini-4-argon gültig ist.

Wie viel kostet Gemini 4 Argon?

Der Einführungspreis beträgt 2 $ pro 1 Million Input-Tokens und 10 $ pro 1 Million Output-Tokens. Google zufolge sollen die späteren Preise bei 4 $ beziehungsweise 20 $ liegen. Gecachter Input ist mit einem Rabatt von 95 % auf den Einführungspreis für Input-Tokens angegeben.

Bezieht sich die Angabe von 1 Million Tokens auf das Kontextfenster?

Google beschreibt diesen Wert ausdrücklich als Limit für Output-Tokens. Gehe nicht von einem Kontextfenster mit 1 Million Tokens aus, solange Googles API-Dokumentation kein Input-Limit nennt.

Sollte ich Gemini 3.8 Flash jetzt ersetzen?

Nein. Behalte die validierte Basis, stelle einen repräsentativen Testsatz zusammen und wechsle erst, wenn Argon für dein Konto verfügbar ist, die offizielle Modell-ID dokumentiert wurde und dieselben Aufgaben zu akzeptablen Kosten und mit vertretbarem Nachbearbeitungsaufwand bestehen.