Lässt sich 2026 noch ein echtes Projekt mit einer kostenlosen KI-API betreiben? Ja. Allein Groq erlaubt mit einem 8B-Llama-Modell 14.400 kostenlose Anfragen pro Tag. Zwischen den Anbietern liegen bei den Limits allerdings drei Größenordnungen, während Google seine Zahlen für den Free Tier gar nicht mehr öffentlich nennt. Alle Angaben unten stammen aus den offiziellen Dokumentationen der Anbieter und wurden am 29. Juli 2026 geprüft.
Kostenlose KI-APIs im Überblick: Limits, Kartenpflicht und Datenrichtlinien
Neun Anbieter stellen API-Keys ohne Kreditkarte aus. Sieben davon bieten dauerhaft kostenlose Tarife; bei NVIDIA und Hugging Face gibt es einmalige Credits, die irgendwann aufgebraucht sind.
| Anbieter | Kostenloser Tarif (offizielle Angaben) | Kreditkarte | Training mit deinen Daten im Free Tier |
|---|---|---|---|
| Google Gemini API | Tokens für Flash-/Pro-Textmodelle kostenlos; RPM/RPD je Modell nur im eigenen AI-Studio-Konto sichtbar | Nein | Ja („Used to improve our products: Yes“) |
| Groq | llama-3.1-8b: 30 RPM / 14.400 RPD; llama-3.3-70b: 30 RPM / 1.000 RPD / 100K TPD | Nein | Standardmäßig keine Speicherung; ZDR verfügbar |
| OpenRouter | :free-Modelle: 20 RPM, 50 Anfragen/Tag — nach einer einmaligen Aufladung von $10: 1.000 Anfragen/Tag | Nein (Aufladung optional) | Abhängig vom Upstream-Anbieter; Opt-out-Schalter vorhanden |
| GitHub Models | Low-Tier-Modelle: 15 RPM / 150 RPD; DeepSeek-R1: 1 RPM / 8 RPD | Nein (nur PAT) | In der Dokumentation nicht angegeben |
| Cloudflare Workers AI | 10.000 Neurons/Tag, Reset um 00:00 UTC | Nein | Nein (ausdrückliche Zusage) |
| Cohere | Trial-Key: 20 Anfragen/Min., 1.000 Aufrufe/Monat | Nein | Auf der Rate-Limits-Seite nicht angegeben |
| Mistral | Free Mode vorhanden; Limits nur im eigenen Admin Panel sichtbar | Nein | Nicht angegeben; kostenlose Zero-Retention-Option angekündigt |
| Hugging Face Inference Providers | $0.10 Credits/Monat („subject to change“) | Nein | Richtlinie des jeweils weiterleitenden Anbieters |
| NVIDIA NIM | 1.000 Credits bei Anmeldung, bis zu 5.000 mit geschäftlicher E-Mail-Adresse | Nein | Nicht angegeben |
Die Tageslimits reichen von 8 Anfragen bei DeepSeek-R1 in GitHub Models bis zu 14.400 bei Groqs 8B-Endpunkt. Die Zeilen lassen sich aber nur bedingt direkt vergleichen: Anfragen, Tokens, Neurons und Dollar-Credits sind unterschiedliche Einheiten.
Google AI Studio: der naheliegende Einstieg — mit zwei Haken
Für die meisten Entwickler bleibt Google AI Studio der erste kostenlose Tarif, den sie ausprobieren sollten. Ohne Billing-Konto stehen Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 2.5 Pro und acht weitere Textmodelle gratis bereit. Für den Free Tier genügt „an active project or free trial“; erst für den kostenpflichtigen Tier 1 muss Billing verknüpft werden.
Die eigene Quote erscheint erst nach der Anmeldung
Auf seiner Rate-Limits-Seite veröffentlicht Google keine Anfragelimits pro Modell mehr. Stattdessen verweist der Anbieter auf das jeweilige Projekt in AI Studio. Zwei Regeln gelten dennoch für alle: Die Kontingente zählen pro Projekt, nicht pro API-Key, und die Tageszähler werden um Mitternacht pazifischer Zeit zurückgesetzt. Konkrete RPM-Werte aus anderen Quellen sollten deshalb als veraltet gelten, bis das eigene Dashboard sie bestätigt.
Im kostenlosen Tarif fließen Prompts in Googles Produktverbesserung ein
Jede Free-Tier-Zeile auf Googles Preisseite trägt den Hinweis „Used to improve our products: Yes“; bezahlter Traffic ist mit No markiert. Wer Kundendaten oder Inhalte unter NDA verarbeitet, kann den kostenlosen Tarif unabhängig von der verfügbaren Quote nicht nutzen. Bildgenerierung ist ebenfalls ausgeschlossen: Kostenloses Gemini deckt nur Text und Embeddings ab.
Groq: transparente tägliche Limits, öffentlich dokumentiert
Groq veröffentlicht seine Free-Tier-Limits modellweise und ohne Login:
| Modell | RPM | Anfragen/Tag | Tokens/Tag |
|---|---|---|---|
| llama-3.1-8b-instant | 30 | 14.400 | 500K |
| llama-3.3-70b-versatile | 30 | 1.000 | 100K |
| openai/gpt-oss-120b | 30 | 1.000 | 200K |
| whisper-large-v3 | 20 | 2.000 | 28.800 Audio-Sek. |
Der Engpass sind die Tokens pro Minute: llama-3.3-70b ist auf 12K TPM begrenzt. Aufgaben mit langem Kontext werden also gedrosselt, obwohl die tägliche Zahl an Anfragen großzügig wirkt. Bei den Daten gilt: Groq speichert Inferenz-Eingaben und -Ausgaben standardmäßig nicht und bietet auf Anfrage Zero Data Retention an.
Für kurze Prompts mit hoher Frequenz — etwa Klassifizierung, Extraktion oder Webhook-Anreicherung — ist Groqs 8B-Endpunkt mit 14.400 Anfragen pro Tag hier das beste kostenlose Angebot. Voraussetzung: Ein 8B-Modell reicht aus und du bleibst unter 6K Tokens pro Minute.
OpenRouter: 50 Gratisanfragen täglich — 1.000 nach einer Aufladung von $10
Bei OpenRouter bekommst du nicht die Modellauswahl eines einzelnen Anbieters, sondern alles mit dem Suffix :free. Am 29. Juli 2026 umfasste dieser Pool 15 Textmodelle, darunter NVIDIA Nemotron 3 Ultra und Ling-3.0-flash.
Die Limits gelten kontoweit über alle kostenlosen Modelle hinweg: 20 Anfragen pro Minute und 50 pro Tag. Wer einmalig Credits im Wert von $10 kauft, erhöht das tägliche Limit dauerhaft auf 1.000; die $10 bleiben dabei für kostenpflichtige Modelle nutzbar. Praktisch kostet der brauchbare kostenlose Tarif von OpenRouter somit einmalig $10.
Der Traffic für Gratismodelle wird gemäß den jeweiligen Richtlinien an Upstream-Anbieter geroutet. Standardmäßig werden Anbieter, die mit Eingaben trainieren, nicht blockiert. In den Datenschutzeinstellungen lässt sich das ändern, getrennt für kostenlose und kostenpflichtige Modelle. Zur tatsächlichen Qualität des Pools schrieb ein Entwickler in r/ChatGPTCoding:
„I recommend using the Openrouter API Key with the unlimited and not rate limited Deepseek/Deepseek R1 0528 - free model. It's intelligent, strong reasoning.“
Der Pool ändert sich monatlich; aktuelle Empfehlungen fürs Programmieren bewerten die Modelle einzeln.
Sechs weitere kostenlose Tarife, die man kennen sollte
GitHub Models: kostenlose Spielwiese mit echter API
Jedes GitHub-Konto erhält API-Zugang allein über einen Personal Access Token: keine Karte, keine separate Registrierung. Ohne Copilot-Abonnement gilt die Spalte Copilot Free: 15 RPM / 150 Anfragen pro Tag für Low-Tier-Modelle, 10 RPM / 50 RPD für High-Tier-Modelle. Pro Anfrage sind maximal 8.000 Input- plus 4.000 Output-Tokens möglich. Bei Reasoning-Modellen sind die Grenzen deutlich enger: DeepSeek-R1 erlaubt lediglich 8 Anfragen täglich. GitHub weist darauf hin, dass diese Limits ohne Vorankündigung geändert werden können.
Cloudflare Workers AI: 10.000 Neurons täglich und kein Training mit Kundendaten
Cloudflare rechnet in Neurons ab: 10.000 pro Tag, mit Reset um 00:00 UTC, sowohl im Free- als auch im Paid-Workers-Plan. Nach Cloudflares Umrechnungstabelle entspricht das bei llama-3.1-8b-fast ungefähr 280K Output-Tokens pro Tag. Zudem erklärt der Anbieter ausdrücklich, dass er Kundeninhalte ohne Einwilligung weder zum Training von Modellen noch zur Verbesserung seiner Dienste verwendet. Das ist die stärkste Datenzusage unter den neun Anbietern und der Grund, bei datenschutzsensiblen Aufgaben standardmäßig hier zu starten.
Cohere, NVIDIA, Hugging Face und Mistral: kleiner oder intransparent
| Anbieter | Kostenloses Kontingent | Der Haken |
|---|---|---|
| Cohere | Trial-Key: 20 Anfragen/Min. | Insgesamt 1.000 Aufrufe/Monat: für Evaluation, nicht für den Betrieb |
| NVIDIA build.nvidia.com | 1.000 Credits bei Anmeldung, bis zu 5.000 mit geschäftlicher E-Mail-Adresse | Einmalige Credits statt eines dauerhaften Tarifs; kein veröffentlichtes Verhältnis von Credits zu Anfragen |
| Hugging Face Inference Providers | $0.10 Credits/Monat für mehr als 200 Modelle | Reicht nur für Demos und ist als „subject to change“ gekennzeichnet |
| Mistral | Free Mode für API-Keys | Keine veröffentlichten Limits; sie erscheinen nur im eigenen Admin Panel |
Neben Text: Bilder, Sprache und Embeddings für $0
Außerhalb von Text sind kostenlose Tarife besonders dünn gesät. Bildgenerierung zeigt das deutlich: Geminis Bildmodelle sind im Free Tier als „Not available“ markiert. Damit bleibt Cloudflares FLUX-Deployment innerhalb derselben 10.000 täglichen Neurons als wichtigste Option ohne Kreditkarte. Besser sieht es bei Speech-to-Text aus: Groq reserviert für whisper-large-v3 ein eigenes kostenloses Kontingent von 2.000 Anfragen und 28.800 Audio-Sekunden pro Tag. Für Embeddings funktionieren sowohl Gemini mit gemini-embedding-001 im Free Tier als auch GitHub Models mit 15 RPM / 150 RPD ohne Bezahlung.
Bei sensiblen Daten bleiben nur zwei Anbieter übrig
Cloudflare und Groq sind die einzigen beiden Anbieter in diesem Vergleich, die schriftlich zusagen, Free-Tier-Eingaben weder zum Training zu nutzen noch zu speichern. Google erklärt ausdrücklich das Gegenteil. Die übrigen fünf äußern sich auf den Seiten, auf denen man diese Information erwarten würde, nicht dazu — bei echten Nutzerdaten bedeutet das ungeklärt statt sicher.
Ein geteilter oder weitergeleiteter Key aus einem GitHub-Repository oder Discord-Server gehört gar nicht erst auf diese Liste: Der Traffic läuft über das Konto einer fremden Person, und der Zugang endet, sobald dieses Konto wegfällt.
Woran du merkst, dass der Free Tier nicht mehr reicht
Die kostenlosen Tarife sind überschritten, sobald einer dieser Punkte zum Alltag wird:
- Ein Tageslimit unterbricht echte Arbeit: Groq 70B mit 100K Tokens/Tag reicht für einen moderaten Batch-Job.
- Du benötigst eine Modellklasse, die kein Free Tier anbietet. Frontier-Reasoning-Modelle und Bildgenerierung fehlen in den neun Tarifen oben oder sind eingeschränkt.
- Du verbringst Entwicklungszeit damit, zwischen Anbietern zu wechseln, um Limits zu umgehen.
Zusätzlicher Verbrauch ist günstiger, als es zunächst wirkt: Abgerechnete Flash-Modelle kosten pro Million Tokens, sodass ein Tag über Groqs kostenlosen 100K bei einem Aggregator wie AIReiter nur Cent kostet. Groq, OpenRouter, Cloudflare und Gemini bieten alle OpenAI-kompatible Endpunkte; meist genügt daher eine Änderung der Base-URL.
| Deine Situation | Kostenlos bleiben oder zahlen? |
|---|---|
| Prototyp, keine echten Nutzerdaten | Kostenlos: Google AI Studio für Modellvielfalt oder Groq für Durchsatz |
| Datenschutzsensibel, geringes Volumen | Kostenlos: Cloudflare Workers AI mit No-Training-Zusage |
| Viele Modelle günstig ausprobieren | OpenRouter: 50 Anfragen/Tag kostenlos; ein einmaliger Kauf von $10 schaltet 1.000/Tag frei |
| Tageslimits unterbrechen echte Arbeit | Nutzungsbasiert zahlen; kostenlose Tarife als Fallback |
FAQ
Gibt es eine vollständig kostenlose KI-API?
Ja. Google AI Studio, Groq, GitHub Models und Cloudflare Workers AI bieten Stand 29. Juli 2026 funktionsfähigen API-Zugang ohne hinterlegte Zahlungsmethode. Jeder Anbieter setzt tägliche oder minutenbasierte Limits durch. Googles Free Tier verwendet Prompts zusätzlich zur Verbesserung eigener Produkte.
Welche KI-API ist ohne Kreditkarte kostenlos?
Alle neun Anbieter aus der Vergleichstabelle oben stellen Keys ohne Karte aus. Entscheidend sind die Höhe der Limits und die Datenrichtlinie: Groqs 14.400 Anfragen/Tag stehen Coheres 1.000 Aufrufen/Monat gegenüber; Cloudflares Zusage, nicht mit Daten zu trainieren, steht im Kontrast zu Googles gegenteiliger Position.
Welche GPT-API ist kostenlos?
OpenAIs eigene API hat keinen kostenlosen Tarif. Die Open-Weight-Modelle gpt-oss von OpenAI sind jedoch auf drei Plattformen gratis verfügbar: bei Groq mit gpt-oss-120b und 1.000 Anfragen/Tag, bei Cloudflare Workers AI innerhalb von 10.000 täglichen Neurons sowie bei OpenRouter als openai/gpt-oss-20b:free. GitHub Models bietet außerdem Azure-gehostete OpenAI-GPT-Modelle im Free Tier an, ausgenommen die o-Serie und die GPT-5-Klasse.
Welcher kostenlose KI-API-Tarif ist am großzügigsten?
Das hängt vom Maßstab ab. Nach reiner Anzahl an Anfragen führt Groqs llama-3.1-8b-instant mit 14.400 pro Tag. Beim Tokenvolumen liegt Cloudflare mit 10.000 Neurons/Tag vorn. Die beste Modellqualität für $0 bietet Google AI Studio mit Gemini 2.5 Pro — allerdings mit der Bedingung, dass die Daten fürs Training verwendet werden.
