Kostenlose LLM-APIs im Schnellvergleich
Dieser Überblick wurde am 8. September 2026 geprüft. Limits können je nach Modell, Konto, Region und Auslastung variieren. Maßgeblich sind daher immer die verlinkten Dokumentationen der Anbieter.
Die Angaben zu Karte, kommerzieller Nutzung und OpenAI-Kompatibilität basieren zusätzlich auf dem Vergleich von Free LLM API Hub.
| Anbieter | Kostenloser Zugang und veröffentlichtes Kontingent | Karte/Zahlungsbedingung | API-Form | Hinweis zu den Nutzungsbedingungen | Wichtigster Haken |
|---|---|---|---|---|---|
| Google AI Studio | Gemini-Modelle unterscheiden sich: 5–30 RPM und 15–1.000 RPD; Beispiel Gemini 2.5 Flash: 10 RPM / 250 RPD | Keine Karte angegeben; Konto- und Projektverifizierung kann erforderlich sein | Im geprüften Vergleich OpenAI-kompatibel | Kommerzielle Nutzung als erlaubt aufgeführt; aktuelle Bedingungen prüfen | Google verweist für die aktiven Limits auf AI Studio |
| Groq | Beispiel qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPD | Für den Free Plan ist kein kostenpflichtiges Upgrade nötig; der Developer-Tarif erfordert eine Zahlungsmethode | Ja, weitgehend | Kommerzielle Nutzung als erlaubt aufgeführt; Free-Plan-Limits unterscheiden sich von der kostenpflichtigen Kapazität | Limits gelten auf Organisations- und Modellebene |
| OpenRouter | Kostenlose Varianten: 20 RPM / 50 RPD bei weniger als 10 US-Dollar gekauften Credits; 1.000 RPD ab mindestens 10 US-Dollar Kaufvolumen | Die grundlegende kostenlose Route funktioniert ohne Karte; Credits schalten ein höheres Limit frei | Ja, auf die OpenAI Chat API vereinheitlicht | Kommerzielle Nutzung als erlaubt aufgeführt; Verfügbarkeit kostenloser Modelle ändert sich | Das größere Tageskontingent setzt einen Kauf voraus |
| Cloudflare Workers AI | 10.000 Neurons pro Tag, kontoweit geteilt; Zurücksetzung um 00:00 UTC | Die Grundzuteilung ist kostenlos; ausgewählte Modelle erfordern kostenpflichtiges Billing | Im geprüften Vergleich OpenAI-kompatibel | Kommerzielle Nutzung als erlaubt aufgeführt; Modelleignung variiert | Neurons messen Rechenaufwand, kein festes Token-Kontingent |
| Cerebras Inference | Free Trial: 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD für die aufgeführten Modelle | Verifizierte Zahlungsmethode erforderlich | In den zitierten Dokumenten nicht geklärt | Testzugang; Credits verfallen nach 30 Tagen | Das Testguthaben von 5 US-Dollar ist nicht dauerhaft |
| SambaNova Cloud | Free Tier: 20 RPM / 20 RPD / 200.000 TPD für die aufgeführten Modelle | Im Free Tier keine Zahlungsmethode; das Hinterlegen einer Zahlungsmethode aktiviert den kostenpflichtigen Developer-Tarif | Ja, mit dokumentierten Abweichungen | Kommerzielle Nutzung als erlaubt aufgeführt; Modellbedingungen prüfen | Das Limit von 20 RPD ist restriktiv |
| Cohere | 1.000 Aufrufe pro Monat; Chat 20 RPM, Embed 2.000 Eingaben/Minute, Rerank 10 RPM | Im geprüften Vergleich keine Karte angegeben; bei der Anmeldung prüfen | Im geprüften Vergleich OpenAI-kompatibel | Im geprüften Vergleich nur für Evaluierung | Aufrufe sind nicht mit Tokens gleichzusetzen |
| Z.AI | GLM-4.7-Flash und GLM-4.5-Flash werden für die angezeigten Token-Kategorien mit 0 US-Dollar gelistet; öffentliche RPM-/TPM-Werte fehlen | Im geprüften Vergleich keine Karte angegeben | Im geprüften Vergleich OpenAI-kompatibel | Kommerzielle Nutzung als erlaubt aufgeführt; Modellbedingungen prüfen | 0 US-Dollar pro Token sagt nichts über die Kapazität aus |
| NVIDIA NIM | Kostenlose Inference Endpoints für Prototypen; auf der Einstiegsseite kein einheitliches Kontingent | Zahlungsbedingung variiert je Endpoint; Modellseite prüfen | In den zitierten Dokumenten nicht geklärt | Auf der zitierten Seite Hinweis auf Prototyping/Evaluierung | Eine kostenlose Kennzeichnung auf der Landingpage ist kein veröffentlichtes Kontingent |
| Hugging Face Inference Providers | Kostenlose Nutzer erhalten 0,10 US-Dollar pro Monat an Credits, Änderungen vorbehalten; keine veröffentlichten RPM-/TPM-Werte | In den offiziellen Preisdokumenten keine Angabe zur Kartenpflicht | Im geprüften Vergleich OpenAI-kompatibel | Provider- und Modellbedingungen prüfen | Das ist ein kleines Guthaben, kein Request-Kontingent |
| Mistral Studio | Studio-Free-Modus; auf der Dokumentations-Startseite kein öffentliches Kontingent | Auf der Startseite keine Angabe zur Kartenpflicht | OpenAI-ähnlicher Endpoint dokumentiert; vollständige Parität wird nicht behauptet | Hinweis auf Ausprobieren und Evaluierung; Bedingungen prüfen | Der Free-Modus belegt weder unbegrenzten noch produktionsreifen Zugang |
Ordne die Anbieter nicht nach der größten Zahl. Requests, Tokens, Aufrufe, Dollarbeträge und Neurons sind unterschiedliche Einheiten; ein auslaufender Test ist kein sich erneuerndes Kontingent.
Für Bilder, Sprache, Embeddings und weitere Modalitäten gibt es den umfassenderen Vergleich kostenloser AI-APIs. Diese Seite konzentriert sich auf gehostete LLM-Inferenz.
Anbieter mit dem klarsten wiederkehrenden oder kartenlosen Zugang
Google AI Studio: der praktische Einstieg für allgemeine Anwendungen
Googles offizielle Dokumentation zu Rate Limits weist darauf hin, dass Gemini-Kontingente vom Modell und Projekt abhängen. Als übliche Dimensionen nennt sie RPM, Input-TPM und RPD. Die Quoten gelten für das Google-Cloud-Projekt und nicht für jeden einzelnen API-Schlüssel. Für die aktuellen Werte verweist Google auf AI Studio. Tageskontingente werden um Mitternacht Pacific Time zurückgesetzt.
Ein zusätzlich geprüfter Vergleich nennt für Gemini 2.5 Flash 10 RPM und 250 RPD; modellübergreifend werden 5–30 RPM und 15–1.000 RPD angegeben. Diese Werte eignen sich nur als Planungsgrößen, denn Google betont, dass sich aktive Limits unterscheiden und nicht garantiert sind.
Gemini eignet sich für allgemeine und multimodale Prototypen. Bei request-intensiven Workloads können die modellspezifischen Tageslimits jedoch schnell zum Flaschenhals werden.
Groq: die stärkste kartenlose Option nach veröffentlichter Request-Quote
Groqs Dokumentation zu Rate Limits führt die Limits nach Modell und Organisation auf. Für qwen/qwen3.6-27b nennt die aktuelle Free-Plan-Zeile 30 RPM, 1.000 RPD, 8.000 TPM und 200.000 TPD. Andere Modelle haben eigene Tages- und Token-Limits.
„Rate Limits gelten auf Organisationsebene, nicht für einzelne Nutzer.“ – Groq-Dokumentation zu Rate Limits
Mehrere API-Schlüssel schaffen also nicht automatisch unabhängige Kapazität für die gesamte Organisation. Für den Umgang mit HTTP-429-Antworten dokumentiert Groq die Header retry-after und x-ratelimit-*.
Groq ist ein guter Ausgangspunkt für viele kleine Anfragen, sofern das ausgewählte Modell die jeweilige Aufgabe unterstützt. Prüfe immer die Zeile des konkreten Modells, statt das Anbieterlabel als einheitliches Kontingent zu verstehen.
OpenRouter: das flexibelste Gateway für kostenlose Modelle
OpenRouter bündelt eine wechselnde Auswahl kostenloser Modellvarianten hinter einer API. Laut aktuellem Vergleich des kostenlosen Zugangs gelten 20 Anfragen pro Minute und 50 Anfragen pro Tag, solange weniger als 10 US-Dollar an Credits gekauft wurden. Ab mindestens 10 US-Dollar gekauften Credits steigt das Tageslimit auf 1.000 Anfragen. Das höhere Limit setzt somit einen Kauf voraus.
Die offizielle Dokumentation zu Limits erklärt, dass zusätzliche Konten oder API-Schlüssel die globalen Rate Limits der Plattform nicht verändern. Informationen zum Kontingent liefert der Key-Endpoint sowie die Header von Rate-Limit-Fehlern.
Ein Modell lässt sich mit dem Suffix :free fest auswählen. Alternativ kannst du openrouter/free verwenden, das automatisch ein verfügbares kostenloses Modell auswählt. Der Router kann nach Fähigkeiten wie Tool Calling oder Bildverständnis filtern, das zugrunde liegende Modell kann sich jedoch ändern.
OpenRouter eignet sich für Experimente und Fallback-Routing, nicht für Anwendungen, die auf das stabile Verhalten eines bestimmten kostenlosen Modells angewiesen sind.
Cloudflare Workers AI: wiederkehrende Rechenleistung statt kostenloser Tokens
Auf der offiziellen Preisseite gewährt Cloudflare jedem Konto täglich insgesamt 10.000 Neurons kostenlos. Das Kontingent wird von den Workers-AI-Aktivitäten gemeinsam genutzt und um 00:00 UTC zurückgesetzt. Im kostenlosen Workers-Tarif schlagen weitere Vorgänge fehl, sobald das Kontingent aufgebraucht ist.
Ein Neuron steht für die GPU-Rechenleistung, die eine Anfrage benötigt. Cloudflare veröffentlicht modellspezifische Token-Entsprechungen, verspricht aber nicht, dass 10.000 Neurons einer festen Zahl an Prompts entsprechen.
Cloudflare weist außerdem darauf hin, dass ausgewählte neuere Modelle von DeepSeek, GLM und Kimi eine kostenpflichtige Zahlungsmethode erfordern. „10.000 Neurons kostenlos“ bedeutet also nicht, dass jedes Modell ohne Billing verfügbar ist.
Kostenloser Zugang mit Haken
Cerebras: ein brauchbarer Test, aber keine dauerhaft kostenlose API
Die Dokumentation zu Cerebras-Rate-Limits nennt für die aufgeführten Free-Trial-Modelle 5 RPM, 30.000 uncached TPM, 90.000 total TPM und 1 Million TPD. Außerdem wird erklärt, dass der Token-Bucket kontinuierlich aufgefüllt wird und nicht auf einen einfachen täglichen Reset wartet.
Neue Konten erhalten 5 US-Dollar kostenloses Guthaben. Dieses Guthaben verfällt nach 30 Tagen; für die Aktivierung von Playground und API ist eine verifizierte Zahlungsmethode erforderlich. Ist das Guthaben abgelaufen oder aufgebraucht, endet der Zugang, sofern kein weiteres Guthaben gekauft wird. Die geprüfte Dokumentation beschreibt kein dauerhaft erneuertes, öffentliches Gratiskontingent.
Cerebras eignet sich für eine kurze Evaluierung. Als einzige Abhängigkeit für ein Projekt, das auch nach der Testphase laufen muss, solltest du den Dienst nicht einplanen.
SambaNova Cloud: die klarste Grenze zwischen kostenlos und kostenpflichtig
SambaNova definiert den Free Tier über den Zahlungsstatus: Er gilt, wenn keine Zahlungsmethode hinterlegt ist. Für die aufgeführten Free-Tier-Modelle nennt die offizielle Dokumentation 20 RPM, 20 RPD und 200.000 TPD. Das Limit von 20 RPD kann einen polling-intensiven Workflow stoppen, bevor das Token-Kontingent ausgeschöpft ist.
Mit dem Hinterlegen einer Zahlungsmethode wird der kostenpflichtige Developer-Tarif aktiviert. Dieser sollte daher nicht als kostenlos gezählt werden. SambaNova stellt außerdem Informationen zu verbleibenden Anfragen und zum Reset über Response-Header bereit.
Nutze SambaNova nur für Proofs of Concept mit sehr geringem Volumen. Das Limit von 20 RPD muss vor jedem Agenten-Workflow geprüft werden.
Cohere: nützlich für RAG, aber Aufrufe genau mitzählen
Cohere unterscheidet sich mit seinem Trial-Key von einem tokenbasierten Free Tier. Der aktuelle geprüfte Vergleich nennt 1.000 Aufrufe pro Monat sowie Endpoint-spezifische Limits von 20 RPM für Chat, 2.000 Eingaben pro Minute für Embed und 10 RPM für Rerank. In der FAQ beschreibt Cohere Trial-Keys als kostenlos, aber limitiert.
Damit eignet sich Cohere für Experimente mit Retrieval-Augmented Generation: Ein Projekt kann Generierung, Embeddings und Reranking gemeinsam testen. Daraus wird aber kein Chat-Backend für hohe Last. Vergleiche 1.000 Aufrufe/Monat nicht direkt mit 1 Million Tokens/Tag.
Im geprüften Vergleich ist der Trial als ausschließlich für Evaluierungen gedacht gekennzeichnet. Prüfe die aktuellen Nutzungsbedingungen, bevor du ihn in einer öffentlichen oder kommerziellen Anwendung einsetzt.
Z.AI: Ein kostenloser Preis ist noch kein bekanntes Kontingent
In der Preisdokumentation von Z.AI werden GLM-4.7-Flash und GLM-4.5-Flash für die angezeigten Token-Kategorien als kostenlos aufgeführt. Die geprüfte öffentliche Preisseite nennt jedoch keine konkreten Werte für RPM, RPD, TPM oder TPD.
Behandle das Kontingent von Z.AI daher als unbekannt. Für manuelle Tests kann der Dienst ausreichen, für Batch-Verarbeitung eher nicht. Prüfe bei der Anmeldung Endpoint, Modellverfügbarkeit und Nutzungsbedingungen.
NVIDIA, Hugging Face und Mistral: gute Entdeckungswege mit lückenhaften Kontingentdaten
| Anbieter | Hinweis auf kostenlosen Zugang | Fehlendes öffentliches Kontingent | Praktischer Einsatz |
|---|---|---|---|
| NVIDIA NIM | Kostenlose Inference Endpoints für Prototypen | Auf der Landingpage kein einheitlicher RPM-Wert, kein Token-Kontingent, keine Kartenregel und kein Preis für Mehrverbrauch | Einen ausgewählten Endpoint testen und anschließend die modellspezifischen Bedingungen lesen |
| Hugging Face Inference Providers | 0,10 US-Dollar pro Monat an Credits für kostenlose Nutzer, Änderungen vorbehalten | Kein vergleichbares RPM- oder TPM-Kontingent | Kleine Experimente mit gerouteten Modellen ohne eigene GPU-Infrastruktur |
| Mistral Studio | Studio-Free-Modus und API-Schnellstarts | Auf der Dokumentations-Startseite keine Angabe zu Kontingent oder Kartenregel | Mistral-API-Funktionen testen, bevor du dich für ein kostenpflichtiges Setup entscheidest |
Welche kostenlose LLM-API passt zu dir?
| Priorität | Bester Ausgangspunkt | Warum |
|---|---|---|
| Allgemeiner Prototyp | Google AI Studio | Gemini bietet eine klare allgemeine Basis; aktive Limits sind in AI Studio sichtbar |
| Viele kleine Anfragen | Groq | Veröffentlichte, modellspezifische Free-Plan-Werte und ein Beispiel mit 1.000 RPD |
| Viele Modelle über eine API | OpenRouter | Kostenlose Varianten, Routing und eine OpenAI-ähnliche Schnittstelle |
| Cloudflare-native Anwendung | Workers AI | Wiederkehrendes Kontingent von 10.000 Neurons/Tag |
| Größtes genanntes Testkontingent nach Tokens | Cerebras | Bis zu 1M TPD, allerdings nur in einem 30-tägigen, kartenpflichtigen Test |
| Setup ohne Zahlungsmethode | Zuerst Groq; SambaNova bei sehr geringem Volumen | SambaNovas Free Tier ist auf 20 RPD begrenzt |
| RAG-Komponenten | Cohere | Chat, Embed und Rerank gehören zu einem gemeinsamen Trial-Key-Ökosystem |
| GLM Flash testen | Z.AI | Der angezeigte Tokenpreis beträgt 0 US-Dollar, das öffentliche Kontingent ist jedoch unbekannt |
| Open-Modelle ohne eigene GPU entdecken | Hugging Face | Gerouteter Zugang plus 0,10 US-Dollar pro Monat für kostenlose Nutzer |
Starte mit einem Anbieter und protokolliere bei jeder Anfrage vier Felder: Modell-ID, HTTP-Status, Tokenverbrauch und Header mit den verbleibenden Limits. Ergänze erst dann einen zweiten Anbieter, wenn du weißt, welches Limit die erste Route erreicht. Mehrere Schlüssel schaffen nicht automatisch zusätzliche Kapazität.
So prüfst du eine kostenlose LLM-API vor dem Einsatz
Vor dem Produktivstart solltest du fünf Punkte kontrollieren:
- Einheit des Kontingents: Wird das Angebot in Requests, Tokens, Aufrufen, Dollar oder Recheneinheiten gemessen?
- Reset-Verhalten: Wird das Kontingent zu einer UTC- oder Pacific-Time-Grenze zurückgesetzt, kontinuierlich aufgefüllt, monatlich erneuert oder läuft es einmalig ab?
- Geltungsbereich: Gilt das Limit für das Modell, Projekt, Konto oder die Organisation?
- Zahlungsbedingung: Schaltet eine hinterlegte Karte mehr Kapazität frei, aktiviert sie einen kostenpflichtigen Tarif oder ist sie für den Test zwingend erforderlich?
- Bedingungen und Fehlerfall: Ist das Angebot auf Tests oder Evaluierungen beschränkt, und behandelt der Client HTTP 429, ohne eine Retry-Lawine auszulösen?
FAQ zu kostenlosen LLM-APIs
Welche kostenlose LLM-API ist insgesamt die beste?
Google AI Studio eignet sich für allgemeine Prototypen, Groq für ein höheres kostenloses Request-Volumen und OpenRouter für eine große Modellauswahl.
Kann ich eine kostenlose LLM-API ohne Kreditkarte nutzen?
Ja. Google, Groq, OpenRouters grundlegende Route, Cloudflares Basiszuteilung und SambasNovas Free Tier werden im geprüften Vergleich als Optionen ohne Karte aufgeführt. Cerebras verlangt für den Free Trial eine verifizierte Zahlungsmethode.
Sind kostenlose LLM-APIs wirklich dauerhaft kostenlos?
Einige wiederkehrende Tarife bleiben verfügbar, solange ihre Bedingungen gelten. Tests, Aktionspreise und wechselnde :free-Routen sind jedoch keine dauerhaft gültigen, anbieterweiten Kontingente. Prüfe die aktuelle Dokumentation und den Modellstatus, bevor du dich darauf verlässt.
Kann ich eine kostenlose LLM-API produktiv einsetzen?
Verwende sie nicht als einziges Backend, solange ihre aktuellen Bedingungen, Kontingente und die Modellverfügbarkeit nicht deine Anforderungen an den Produktiveinsatz erfüllen.
Was passiert, wenn ich das kostenlose Limit erreiche?
Die Anbieter geben normalerweise einen Drosselungs- oder Kontingentfehler zurück. Groq dokumentiert den Umgang mit HTTP 429, Cloudflare lässt nach Erschöpfung der täglichen Free-Plan-Zuteilung weitere Vorgänge fehlschlagen, und Cerebras beendet den Testzugang, sobald das Guthaben abgelaufen oder aufgebraucht ist.