Kostenlose KI-API-Limits im Überblick
„Kostenlos“ bedeutet bei KI-APIs fast nie unbegrenzt. In der Praxis bekommst du ein kontingentiertes Angebot: manchmal mit dauerhaftem Tageslimit, manchmal in Form von Aktionsguthaben, das irgendwann aufgebraucht ist. Alle hier vorgestellten Anbieter geben API-Schlüssel ohne Kreditkarte aus. Wie viel du damit tatsächlich anfangen kannst, reicht allerdings von wenigen Anfragen pro Tag bis zu Zehntausenden.
Die Angaben in diesem Ratgeber haben wir im August 2026 anhand der offiziellen Dokumentation der jeweiligen Anbieter geprüft. Da sich Rate-Limits häufig ändern, solltest du die Werte vor einer Produktionsplanung immer noch einmal in der Konsole des Anbieters kontrollieren.
| Anbieter | Wichtige Fakten zum Gratis-Kontingent | Wichtiger Punkt zur Datenrichtlinie | Besonders geeignet für |
|---|---|---|---|
| Google AI Studio | Keine Kreditkarte oder Abrechnungskonto nötig; Gemini-Modelle; Kontingente pro Projekt, Reset um Mitternacht Pacific Time | Eingaben im Gratis-Tarif trainieren Google-Produkte | Große Modellauswahl, Prototyping |
| Groq | 14.400 RPD bei Llama 3.1 8B; 70K TPM bei Compound-Modellen | Standardmäßig keine Speicherung; ZDR verfügbar | Viele kurze Anfragen |
| OpenRouter | 50 kostenlose Anfragen pro Tag; mehr als 25 Gratis-Modelle; BYOK unterstützt | Hängt vom Upstream-Anbieter ab | Viele Modelle ausprobieren |
| GitHub Models | 15 RPM / 150 RPD (niedrige Stufe); 8.000 Input- plus 4.000 Output-Tokens | Microsoft-Datenbedingungen | Schnelle Experimente mit einem PAT |
| Cloudflare Workers AI | 10.000 Neurons pro Tag (~280K Output-Tokens bei Llama 3.1 8B Fast) | Ausdrückliche Zusage, nicht zu trainieren | Datenschutzsensible Anwendungen |
| Cohere | 20 Anfragen/Minute; 1.000 Aufrufe/Monat | Evaluierungslizenz | Tests mit Embeddings und Reranking |
| NVIDIA NIM | 1.000 Guthaben bei der Anmeldung; bis zu 5.000 mit geschäftlicher E-Mail-Adresse | Nutzung kostenloser Endpunkte wird protokolliert | Einmalige Modellentests |
| Hugging Face | $0.10/Monat für mehr als 200 Modelle | Zuteilung kann sich ändern | Inference im Demo-Maßstab |
| Mistral | Kostenloser API-Key-Modus; Limits im Admin Panel | Option zur vollständigen Datenlöschung erwähnt | Europäisch gehostete Modelle |
Neun Anbieter stellen Schlüssel ohne Kreditkarte aus. Sieben davon bieten wiederkehrende Gratis-Kontingente, während NVIDIA und Hugging Face einmalig nutzbares Guthaben bereitstellen, das sich nicht erneuert. Die Unterschiede sind erheblich: GitHub Models erlaubt 8 Anfragen pro Tag mit DeepSeek-R1, während Groq bei Llama 3.1 8B täglich 14.400 Anfragen freischaltet.
Google AI Studio: der naheliegende Gratis-Einstieg
Wer aktuelle Spitzenmodelle kostenlos nutzen möchte, ohne Zahlungsdaten zu hinterlegen, landet meist zuerst bei Google AI Studio. Eine Kreditkarte oder ein Abrechnungskonto brauchst du nicht: Mit einem Google-Konto anmelden, API-Schlüssel erzeugen und loslegen.
Im kostenlosen Angebot steckt die Gemini-Familie, darunter Gemini 3.6 Flash, 3.5 Flash, 2.5 Pro und weitere Modelle. Text- und Embedding-Endpunkte sind enthalten. Die Kontingente gelten jeweils pro Projekt und werden um Mitternacht Pacific Time zurückgesetzt.
Wie viel du nutzen darfst, erfährst du erst nach der Anmeldung
Google veröffentlicht keine einheitliche Übersicht mit festen Gratis-Limits, wie man sie etwa von Groq oder OpenRouter kennt. Die konkreten Werte für Anfragen pro Minute, Tokens pro Minute und Tokens pro Tag erscheinen erst in der AI-Studio-Konsole, sobald du ein Projekt angelegt hast. Das erschwert die Kapazitätsplanung. Der pragmatische Weg: Projekt erstellen, die Quotas-Seite öffnen und die Anwendung auf das dort angezeigte Limit auslegen.
Google darf Eingaben aus dem Gratis-Tarif zum Training verwenden
Das ist der entscheidende Haken. Laut Googles Bedingungen für den kostenlosen Tarif dürfen deine Eingaben und die erzeugten Inhalte zur Verbesserung von Google-Produkten verwendet werden. Für vertrauliche, geschützte oder personenbezogene Daten scheidet der Gratis-Tarif damit aus. Bei der kostenpflichtigen Nutzung der Gemini API über Google Cloud mit Abrechnungskonto gilt diese Trainingsklausel nicht – dafür ist allerdings eine Kreditkarte erforderlich.
Auch die kostenlose Bilderzeugung mit Gemini ist nicht verfügbar; der Gratis-Umfang beschränkt sich auf Text und Embeddings.
Groq: klare Tagesobergrenzen
Für viele kurze Anfragen ist Groqs kostenloses Kontingent besonders großzügig. Die Limits stehen explizit in der Groq-Dokumentation und gelten pro Organisation, nicht pro Nutzer. Bereits im Cache vorhandene Tokens werden nicht auf die Rate-Limits angerechnet.
| Modell | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
| Llama 3.1 8B Instant | 30 | 14.400 | 6.000 | 500.000 |
| Llama 3.3 70B Versatile | 30 | 1.000 | 12.000 | 100.000 |
| GPT-OSS-120B | 30 | 1.000 | 8.000 | 200.000 |
| GPT-OSS-20B | 30 | 1.000 | 8.000 | 200.000 |
| Qwen 3.6-27B | 30 | 1.000 | 8.000 | 200.000 |
| Groq Compound | 30 | 250 | 70.000 | — |
| Groq Compound Mini | 30 | 250 | 70.000 | — |
| Whisper Large V3 | 20 | 2.000 | — | 28.800 Audi Sekunden/Tag |
Der Spitzenwert kommt von Llama 3.1 8B mit 14.400 Anfragen pro Tag – genug für ernsthafte Prototypen oder einen Produktions-Endpunkt mit wenig Traffic. Die Compound-Modelle erlauben mit 70.000 TPM die meisten Tokens pro Minute, haben dafür mit 250 RPD ein deutlich niedrigeres Tageslimit.
Groq speichert Inferenzdaten standardmäßig nicht und bietet zusätzlich eine Zero Data Retention (ZDR)-Option. Damit gehört der Dienst zu den datenschutzfreundlicheren kostenlosen Anbietern. Der Engpass liegt beim 8B-Modell vor allem bei 6.000 TPM: Lange Kontexte und umfangreiche Generierung können dadurch ausgebremst werden.
OpenRouter: 50 kostenlose Anfragen pro Tag
OpenRouter hostet die Modelle nicht selbst, sondern fungiert als API-Gateway. Im Gratis-Tarif greifst du auf eine wechselnde Auswahl von Modellen zu, die OpenRouter subventioniert. Dafür hängst du :free an den Modellnamen oder verwendest den automatischen Router openrouter/free.
Rate-Limits: Kostenlose Modelle sind auf 20 RPM und 50 Anfragen pro Tag begrenzt. Ein einmaliger Kauf von $10 Guthaben erhöht das dauerhafte Tageslimit für Gratis-Modelle auf 1.000 Anfragen. Zusätzlich können die Limits des jeweiligen Upstream-Anbieters greifen.
Auswahl an Gratis-Modellen: Im August 2026 listet OpenRouter mehr als 25 kostenlose Modelle – im Juli waren es noch 15. Darunter finden sich Modelle für Textgenerierung, Embeddings und Reranking. Die Auswahl umfasst unter anderem NVIDIA (Nemotron-3-Ultra-, Super- und Nano-Familien mit bis zu 1M Tokens Kontext), Google (Gemma 4), Cohere (North Mini Code), OpenAI (gpt-oss-20b) und mehrere weitere Modelle. Die Liste ändert sich regelmäßig, wenn Anbieter kostenlose Endpunkte hinzufügen oder entfernen.
BYOK (Bring Your Own Key): OpenRouter unterstützt BYOK für mehr als 60 Inference-Anbieter. Verwendest du deine eigenen API-Schlüssel, rechnet der jeweilige Anbieter die Inferenzkosten direkt ab; OpenRouter berechnet nur die Routing-Schicht. Das kostenlose BYOK-Kontingent hängt inzwischen vom Tarif ab und wird anhand der Inferenzkosten zum Listenpreis statt über eine feste Zahl von Anfragen ermittelt. Die aktuellen Bedingungen findest du auf der OpenRouter-Preisseite.
Wichtig ist die Unterscheidung: „Kostenlos“ bedeutet bei OpenRouter, dass keine Tokenkosten anfallen – nicht automatisch, dass Daten nicht gespeichert werden. Die Upstream-Anbieter bestimmen ihre eigenen Datenrichtlinien. Einige, darunter NVIDIA und Poolside, protokollieren die Nutzung kostenloser Endpunkte ausdrücklich oder dürfen Eingaben zum Training verwenden. Falls nötig, solltest du die Datenschutzfilter für jeden Anbieter einzeln konfigurieren.
Sechs weitere kostenlose Kontingente
GitHub Models
GitHub Models bietet Playground und API-Endpunkt für beliebte Modelle. Die Anmeldung läuft über einen GitHub Personal Access Token (PAT). Die niedrige Stufe umfasst 15 RPM und 150 RPD, bei der hohen Stufe sinken die Werte auf 10 RPM und 50 RPD. Jede Anfrage darf höchstens 8.000 Input-Tokens und 4.000 Output-Tokens enthalten. DeepSeek-R1 ist verfügbar, aber auf 8 Anfragen pro Tag begrenzt.
Für schnelle Experimente ist GitHub Models praktisch, weil die PAT-basierte Anmeldung keinen zusätzlichen Account erfordert. Die engen Token- und Anfragegrenzen machen den Dienst jedoch ungeeignet für alles, was über Prototyping hinausgeht.
Cloudflare Workers AI
Cloudflare stellt jedem Account 10.000 Neurons pro Tag zur Verfügung; das Kontingent wird um 00:00 UTC zurückgesetzt. Bei Llama 3.1 8B Fast entspricht das ungefähr 280.000 Output-Tokens pro Tag. Außerdem hostet Cloudflare FLUX für kostenlose Bilderzeugung – und damit die wichtigste Option in dieser Liste für Bildgenerierung ohne Kreditkarte.
Beim Datenschutz setzt Cloudflare den klarsten Rahmen in diesem Vergleich: Das Unternehmen verspricht ausdrücklich, Kunden-Prompts und -Outputs ohne Einwilligung weder zum Training noch zur Verbesserung des Dienstes zu verwenden. Für Anwendungen mit sensiblen Daten ist Workers AI deshalb die erste Empfehlung.
Das Neurons-Modell ist weniger intuitiv als Angaben in Anfragen oder Tokens. Im Workers-AI-Dashboard musst du nachsehen, wie viele Neurons ein bestimmtes Modell pro Token verbraucht.
Cohere, NVIDIA, Hugging Face und Mistral
Cohere erlaubt im kostenlosen Tarif 20 Anfragen pro Minute und 1.000 API-Aufrufe pro Monat. Das reicht für Evaluierung und Tests, nicht für hohe laufende Last. Cohere-Command-Modelle und Embedding-Endpunkte sind enthalten.
NVIDIA NIM stellt 1.000 Guthaben bei der Anmeldung bereit, mit geschäftlicher E-Mail-Adresse bis zu 5.000. Dabei handelt es sich um einmalig nutzbares Guthaben, nicht um ein monatlich erneuertes Kontingent. Einen offiziellen Umrechnungsschlüssel von Guthaben zu Anfragen gibt es nicht. Für kostenlose NVIDIA-Modelle auf OpenRouter gilt außerdem: Die Nutzung des Gratis-Endpunkts wird protokolliert, und NVIDIA rät davon ab, vertrauliche oder personenbezogene Daten einzugeben.
Hugging Face bietet über die Serverless Inference API ungefähr $0.10 kostenloses Inferenzguthaben pro Monat für mehr als 200 Modelle. Die Zuteilung kann sich laut Anbieter ändern. Das genügt für Demos und erste Modelltests, nicht als Grundlage für ein Produkt.
Mistral verfügt über einen kostenlosen API-Key-Modus. Die Limits sind allerdings nur im Admin Panel sichtbar. In der Mistral-Dokumentation wird eine Option zur vollständigen Datenlöschung erwähnt, sie ist aber nicht als eindeutig geltende Standardregel des kostenlosen Tarifs ausgewiesen. Für datenschutzsensible Anwendungen bleibt die Lage daher schwer einzuschätzen.
Mehr als Text: Bilder, Sprache und Embeddings
Zwei Anbieter decken auch andere Modalitäten als Text ab:
- Cloudflare Workers AI bietet FLUX kostenlos für die Bilderzeugung an – als einzige Option in dieser Liste ohne Kreditkarte. Geminis Bildmodelle sind im Gratis-Tarif nicht verfügbar.
- Groq Whisper erledigt die Sprach-zu-Text-Umwandlung mit 2.000 Anfragen pro Tag und 28.800 Audi Sekunden pro Tag im kostenlosen Tarif.
Auch OpenRouters Gratis-Katalog ist inzwischen um Embedding- und Reranking-Modelle von NVIDIA gewachsen. Damit stehen im kostenlosen Angebot zusätzlich Bausteine für Retrieval und RAG zur Verfügung.
Bei sensiblen Daten bleiben nur zwei Anbieter übrig
Für vertrauliche, geschützte oder regulierte Daten fallen die meisten Anbieter aus diesem Vergleich aus:
- Google AI Studio verwendet Eingaben aus dem Gratis-Tarif zum Training seiner Produkte.
- NVIDIA protokolliert die Nutzung kostenloser Endpunkte und warnt vor der Eingabe vertraulicher Daten.
- OpenRouter übernimmt bei kostenlosen Modellen die Datenrichtlinie des jeweiligen Upstream-Anbieters. Einige davon, etwa Poolside und Liquid, trainieren ausdrücklich mit Gratis-Prompts.
- Hugging Face und Mistral haben undurchsichtige oder veränderliche Regeln zur Datenspeicherung.
Damit bleiben zwei Anbieter mit klaren, ausdrücklichen Datenschutzversprechen:
- Cloudflare Workers AI – ausdrückliche Zusage, Daten ohne Einwilligung weder zum Training noch zur Verbesserung des Dienstes zu verwenden.
- Groq – keine standardmäßige Speicherung von Inferenzdaten; eine Zero-Data-Retention-Option ist verfügbar.
Bei datenschutzsensiblen Anwendungen mit geringem bis mittlerem Volumen ist Cloudflare die sicherere Wahl. Brauchst du mehr Durchsatz und kommst mit den Token-pro-Minute-Limits von Groq zurecht, ist Groq mit ZDR die Alternative.
Wenn das Gratis-Kontingent nicht mehr reicht
Irgendwann bremst dich jedes kostenlose Angebot in dieser Liste aus. Dann stellt sich vor allem die Frage, wie du sinnvoll weitermachst.
Unsere Empfehlung: Abrechnung nach Verbrauch bei einem einzigen Anbieter statt ständiger Wechsel zwischen Gratisangeboten. Wer Rate-Limits durch Anbieter-Hopping umgeht, handelt sich unterschiedliche SDKs, Datenrichtlinien und Fehlerbilder ein. Der zusätzliche Entwicklungsaufwand übersteigt die API-Ersparnis meist schnell.
Vier der genannten Anbieter unterstützen OpenAI-kompatible Endpunkte: Groq, OpenRouter, Cloudflare Workers AI und Google AI Studio (über den OpenAI-kompatiblen Wrapper). Der Wechsel vom kostenlosen zum kostenpflichtigen Tarif beschränkt sich damit auf eine neue Basis-URL und einen neuen API-Schlüssel, ohne dass du den Anwendungscode umschreiben musst.
Der praktische Weg nach vorn: Starte kostenlos mit Google AI Studio, wenn dir eine breite Modellauswahl wichtig ist, oder mit Groq, wenn du hohen Durchsatz brauchst. Sobald du regelmäßig an die Tageslimits stößt, hinterlegst du beim selben Anbieter ein Abrechnungskonto und wechselst zur nutzungsabhängigen Abrechnung. OpenRouter eignet sich vor allem zum Testen vieler Modelle, während Cloudflare die erste Wahl bleibt, wenn Datenschutz nicht verhandelbar ist.
FAQ
Welche kostenlose KI-API funktioniert ohne Kreditkarte? Alle neun genannten Anbieter stellen API-Schlüssel ohne Kreditkarte aus: Google AI Studio, Groq, OpenRouter, GitHub Models, Cloudflare Workers AI, Cohere, NVIDIA, Hugging Face und Mistral.
Welche kostenlose API hat das höchste Tageslimit für Anfragen? Groq bietet bei Llama 3.1 8B Instant 14.400 Anfragen pro Tag – das höchste wiederkehrende Anfragekontingent unter den hier aufgeführten Anbietern.
Ist OpenRouter wirklich kostenlos? OpenRouters :free-Varianten kosten pro Token nichts, sind aber auf 50 Anfragen pro Tag begrenzt (1.000 nach dem Kauf von $10 Guthaben). Im BYOK-Modus leitest du Anfragen über deine eigenen Anbieter-Schlüssel und erhältst ein vom Tarif abhängiges kostenloses Kontingent. Unbegrenzt ist keines der beiden Angebote.
Kann ich eine kostenlose KI-API produktiv einsetzen? Ja, solange du innerhalb der Rate-Limits bleibst. Groq und Cloudflare bieten für ihre jeweiligen Stärken – Durchsatz und Datenschutz – die produktionsreifsten kostenlosen Tarife. Wenn die Gratislimits deine Anwendung regelmäßig ausbremsen, wechselst du am besten beim selben Anbieter in den kostenpflichtigen Tarif.
Welche kostenlose API eignet sich am besten für datenschutzsensible Daten? Cloudflare Workers AI und Groq sind die einzigen Anbieter mit ausdrücklichen Zusagen, kostenlose Eingaben weder fürs Training zu verwenden noch standardmäßig zu speichern. Bei allen anderen gilt entweder Training mit Gratis-Prompts (Google), Protokollierung der Nutzung (NVIDIA) oder eine vom jeweiligen Anbieter abhängige Datenrichtlinie (OpenRouter).