AIREITER
API-DOKSPREISE
VORLAGEN
  • AIReiter
  • Blog
  • Kostenlose LLM-API-Kontingente im Vergleich: 11 Anbieter (2026)

Kostenlose LLM-API-Kontingente im Vergleich: 11 Anbieter (2026)

Zuletzt aktualisiert: 2026-09-08 08:38:41

Kostenlose LLM-APIs im Schnellvergleich

Dieser Überblick wurde am 8. September 2026 geprüft. Limits können je nach Modell, Konto, Region und Auslastung variieren. Maßgeblich sind daher immer die verlinkten Dokumentationen der Anbieter.

Die Angaben zu Karte, kommerzieller Nutzung und OpenAI-Kompatibilität basieren zusätzlich auf dem Vergleich von Free LLM API Hub.

AnbieterKostenloser Zugang und veröffentlichtes KontingentKarte/ZahlungsbedingungAPI-FormHinweis zu den NutzungsbedingungenWichtigster Haken
Google AI StudioGemini-Modelle unterscheiden sich: 5–30 RPM und 15–1.000 RPD; Beispiel Gemini 2.5 Flash: 10 RPM / 250 RPDKeine Karte angegeben; Konto- und Projektverifizierung kann erforderlich seinIm geprüften Vergleich OpenAI-kompatibelKommerzielle Nutzung als erlaubt aufgeführt; aktuelle Bedingungen prüfenGoogle verweist für die aktiven Limits auf AI Studio
GroqBeispiel qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPDFür den Free Plan ist kein kostenpflichtiges Upgrade nötig; der Developer-Tarif erfordert eine ZahlungsmethodeJa, weitgehendKommerzielle Nutzung als erlaubt aufgeführt; Free-Plan-Limits unterscheiden sich von der kostenpflichtigen KapazitätLimits gelten auf Organisations- und Modellebene
OpenRouterKostenlose Varianten: 20 RPM / 50 RPD bei weniger als 10 US-Dollar gekauften Credits; 1.000 RPD ab mindestens 10 US-Dollar KaufvolumenDie grundlegende kostenlose Route funktioniert ohne Karte; Credits schalten ein höheres Limit freiJa, auf die OpenAI Chat API vereinheitlichtKommerzielle Nutzung als erlaubt aufgeführt; Verfügbarkeit kostenloser Modelle ändert sichDas größere Tageskontingent setzt einen Kauf voraus
Cloudflare Workers AI10.000 Neurons pro Tag, kontoweit geteilt; Zurücksetzung um 00:00 UTCDie Grundzuteilung ist kostenlos; ausgewählte Modelle erfordern kostenpflichtiges BillingIm geprüften Vergleich OpenAI-kompatibelKommerzielle Nutzung als erlaubt aufgeführt; Modelleignung variiertNeurons messen Rechenaufwand, kein festes Token-Kontingent
Cerebras InferenceFree Trial: 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD für die aufgeführten ModelleVerifizierte Zahlungsmethode erforderlichIn den zitierten Dokumenten nicht geklärtTestzugang; Credits verfallen nach 30 TagenDas Testguthaben von 5 US-Dollar ist nicht dauerhaft
SambaNova CloudFree Tier: 20 RPM / 20 RPD / 200.000 TPD für die aufgeführten ModelleIm Free Tier keine Zahlungsmethode; das Hinterlegen einer Zahlungsmethode aktiviert den kostenpflichtigen Developer-TarifJa, mit dokumentierten AbweichungenKommerzielle Nutzung als erlaubt aufgeführt; Modellbedingungen prüfenDas Limit von 20 RPD ist restriktiv
Cohere1.000 Aufrufe pro Monat; Chat 20 RPM, Embed 2.000 Eingaben/Minute, Rerank 10 RPMIm geprüften Vergleich keine Karte angegeben; bei der Anmeldung prüfenIm geprüften Vergleich OpenAI-kompatibelIm geprüften Vergleich nur für EvaluierungAufrufe sind nicht mit Tokens gleichzusetzen
Z.AIGLM-4.7-Flash und GLM-4.5-Flash werden für die angezeigten Token-Kategorien mit 0 US-Dollar gelistet; öffentliche RPM-/TPM-Werte fehlenIm geprüften Vergleich keine Karte angegebenIm geprüften Vergleich OpenAI-kompatibelKommerzielle Nutzung als erlaubt aufgeführt; Modellbedingungen prüfen0 US-Dollar pro Token sagt nichts über die Kapazität aus
NVIDIA NIMKostenlose Inference Endpoints für Prototypen; auf der Einstiegsseite kein einheitliches KontingentZahlungsbedingung variiert je Endpoint; Modellseite prüfenIn den zitierten Dokumenten nicht geklärtAuf der zitierten Seite Hinweis auf Prototyping/EvaluierungEine kostenlose Kennzeichnung auf der Landingpage ist kein veröffentlichtes Kontingent
Hugging Face Inference ProvidersKostenlose Nutzer erhalten 0,10 US-Dollar pro Monat an Credits, Änderungen vorbehalten; keine veröffentlichten RPM-/TPM-WerteIn den offiziellen Preisdokumenten keine Angabe zur KartenpflichtIm geprüften Vergleich OpenAI-kompatibelProvider- und Modellbedingungen prüfenDas ist ein kleines Guthaben, kein Request-Kontingent
Mistral StudioStudio-Free-Modus; auf der Dokumentations-Startseite kein öffentliches KontingentAuf der Startseite keine Angabe zur KartenpflichtOpenAI-ähnlicher Endpoint dokumentiert; vollständige Parität wird nicht behauptetHinweis auf Ausprobieren und Evaluierung; Bedingungen prüfenDer Free-Modus belegt weder unbegrenzten noch produktionsreifen Zugang

Ordne die Anbieter nicht nach der größten Zahl. Requests, Tokens, Aufrufe, Dollarbeträge und Neurons sind unterschiedliche Einheiten; ein auslaufender Test ist kein sich erneuerndes Kontingent.

Für Bilder, Sprache, Embeddings und weitere Modalitäten gibt es den umfassenderen Vergleich kostenloser AI-APIs. Diese Seite konzentriert sich auf gehostete LLM-Inferenz.

Anbieter mit dem klarsten wiederkehrenden oder kartenlosen Zugang

Google AI Studio: der praktische Einstieg für allgemeine Anwendungen

Googles offizielle Dokumentation zu Rate Limits weist darauf hin, dass Gemini-Kontingente vom Modell und Projekt abhängen. Als übliche Dimensionen nennt sie RPM, Input-TPM und RPD. Die Quoten gelten für das Google-Cloud-Projekt und nicht für jeden einzelnen API-Schlüssel. Für die aktuellen Werte verweist Google auf AI Studio. Tageskontingente werden um Mitternacht Pacific Time zurückgesetzt.

Ein zusätzlich geprüfter Vergleich nennt für Gemini 2.5 Flash 10 RPM und 250 RPD; modellübergreifend werden 5–30 RPM und 15–1.000 RPD angegeben. Diese Werte eignen sich nur als Planungsgrößen, denn Google betont, dass sich aktive Limits unterscheiden und nicht garantiert sind.

Gemini eignet sich für allgemeine und multimodale Prototypen. Bei request-intensiven Workloads können die modellspezifischen Tageslimits jedoch schnell zum Flaschenhals werden.

Groq: die stärkste kartenlose Option nach veröffentlichter Request-Quote

Groqs Dokumentation zu Rate Limits führt die Limits nach Modell und Organisation auf. Für qwen/qwen3.6-27b nennt die aktuelle Free-Plan-Zeile 30 RPM, 1.000 RPD, 8.000 TPM und 200.000 TPD. Andere Modelle haben eigene Tages- und Token-Limits.

„Rate Limits gelten auf Organisationsebene, nicht für einzelne Nutzer.“ – Groq-Dokumentation zu Rate Limits

Mehrere API-Schlüssel schaffen also nicht automatisch unabhängige Kapazität für die gesamte Organisation. Für den Umgang mit HTTP-429-Antworten dokumentiert Groq die Header retry-after und x-ratelimit-*.

Groq ist ein guter Ausgangspunkt für viele kleine Anfragen, sofern das ausgewählte Modell die jeweilige Aufgabe unterstützt. Prüfe immer die Zeile des konkreten Modells, statt das Anbieterlabel als einheitliches Kontingent zu verstehen.

OpenRouter: das flexibelste Gateway für kostenlose Modelle

OpenRouter bündelt eine wechselnde Auswahl kostenloser Modellvarianten hinter einer API. Laut aktuellem Vergleich des kostenlosen Zugangs gelten 20 Anfragen pro Minute und 50 Anfragen pro Tag, solange weniger als 10 US-Dollar an Credits gekauft wurden. Ab mindestens 10 US-Dollar gekauften Credits steigt das Tageslimit auf 1.000 Anfragen. Das höhere Limit setzt somit einen Kauf voraus.

Die offizielle Dokumentation zu Limits erklärt, dass zusätzliche Konten oder API-Schlüssel die globalen Rate Limits der Plattform nicht verändern. Informationen zum Kontingent liefert der Key-Endpoint sowie die Header von Rate-Limit-Fehlern.

Ein Modell lässt sich mit dem Suffix :free fest auswählen. Alternativ kannst du openrouter/free verwenden, das automatisch ein verfügbares kostenloses Modell auswählt. Der Router kann nach Fähigkeiten wie Tool Calling oder Bildverständnis filtern, das zugrunde liegende Modell kann sich jedoch ändern.

OpenRouter eignet sich für Experimente und Fallback-Routing, nicht für Anwendungen, die auf das stabile Verhalten eines bestimmten kostenlosen Modells angewiesen sind.

Cloudflare Workers AI: wiederkehrende Rechenleistung statt kostenloser Tokens

Auf der offiziellen Preisseite gewährt Cloudflare jedem Konto täglich insgesamt 10.000 Neurons kostenlos. Das Kontingent wird von den Workers-AI-Aktivitäten gemeinsam genutzt und um 00:00 UTC zurückgesetzt. Im kostenlosen Workers-Tarif schlagen weitere Vorgänge fehl, sobald das Kontingent aufgebraucht ist.

Ein Neuron steht für die GPU-Rechenleistung, die eine Anfrage benötigt. Cloudflare veröffentlicht modellspezifische Token-Entsprechungen, verspricht aber nicht, dass 10.000 Neurons einer festen Zahl an Prompts entsprechen.

Cloudflare weist außerdem darauf hin, dass ausgewählte neuere Modelle von DeepSeek, GLM und Kimi eine kostenpflichtige Zahlungsmethode erfordern. „10.000 Neurons kostenlos“ bedeutet also nicht, dass jedes Modell ohne Billing verfügbar ist.

Kostenloser Zugang mit Haken

Cerebras: ein brauchbarer Test, aber keine dauerhaft kostenlose API

Die Dokumentation zu Cerebras-Rate-Limits nennt für die aufgeführten Free-Trial-Modelle 5 RPM, 30.000 uncached TPM, 90.000 total TPM und 1 Million TPD. Außerdem wird erklärt, dass der Token-Bucket kontinuierlich aufgefüllt wird und nicht auf einen einfachen täglichen Reset wartet.

Neue Konten erhalten 5 US-Dollar kostenloses Guthaben. Dieses Guthaben verfällt nach 30 Tagen; für die Aktivierung von Playground und API ist eine verifizierte Zahlungsmethode erforderlich. Ist das Guthaben abgelaufen oder aufgebraucht, endet der Zugang, sofern kein weiteres Guthaben gekauft wird. Die geprüfte Dokumentation beschreibt kein dauerhaft erneuertes, öffentliches Gratiskontingent.

Cerebras eignet sich für eine kurze Evaluierung. Als einzige Abhängigkeit für ein Projekt, das auch nach der Testphase laufen muss, solltest du den Dienst nicht einplanen.

SambaNova Cloud: die klarste Grenze zwischen kostenlos und kostenpflichtig

SambaNova definiert den Free Tier über den Zahlungsstatus: Er gilt, wenn keine Zahlungsmethode hinterlegt ist. Für die aufgeführten Free-Tier-Modelle nennt die offizielle Dokumentation 20 RPM, 20 RPD und 200.000 TPD. Das Limit von 20 RPD kann einen polling-intensiven Workflow stoppen, bevor das Token-Kontingent ausgeschöpft ist.

Mit dem Hinterlegen einer Zahlungsmethode wird der kostenpflichtige Developer-Tarif aktiviert. Dieser sollte daher nicht als kostenlos gezählt werden. SambaNova stellt außerdem Informationen zu verbleibenden Anfragen und zum Reset über Response-Header bereit.

Nutze SambaNova nur für Proofs of Concept mit sehr geringem Volumen. Das Limit von 20 RPD muss vor jedem Agenten-Workflow geprüft werden.

Cohere: nützlich für RAG, aber Aufrufe genau mitzählen

Cohere unterscheidet sich mit seinem Trial-Key von einem tokenbasierten Free Tier. Der aktuelle geprüfte Vergleich nennt 1.000 Aufrufe pro Monat sowie Endpoint-spezifische Limits von 20 RPM für Chat, 2.000 Eingaben pro Minute für Embed und 10 RPM für Rerank. In der FAQ beschreibt Cohere Trial-Keys als kostenlos, aber limitiert.

Damit eignet sich Cohere für Experimente mit Retrieval-Augmented Generation: Ein Projekt kann Generierung, Embeddings und Reranking gemeinsam testen. Daraus wird aber kein Chat-Backend für hohe Last. Vergleiche 1.000 Aufrufe/Monat nicht direkt mit 1 Million Tokens/Tag.

Im geprüften Vergleich ist der Trial als ausschließlich für Evaluierungen gedacht gekennzeichnet. Prüfe die aktuellen Nutzungsbedingungen, bevor du ihn in einer öffentlichen oder kommerziellen Anwendung einsetzt.

Z.AI: Ein kostenloser Preis ist noch kein bekanntes Kontingent

In der Preisdokumentation von Z.AI werden GLM-4.7-Flash und GLM-4.5-Flash für die angezeigten Token-Kategorien als kostenlos aufgeführt. Die geprüfte öffentliche Preisseite nennt jedoch keine konkreten Werte für RPM, RPD, TPM oder TPD.

Behandle das Kontingent von Z.AI daher als unbekannt. Für manuelle Tests kann der Dienst ausreichen, für Batch-Verarbeitung eher nicht. Prüfe bei der Anmeldung Endpoint, Modellverfügbarkeit und Nutzungsbedingungen.

NVIDIA, Hugging Face und Mistral: gute Entdeckungswege mit lückenhaften Kontingentdaten

AnbieterHinweis auf kostenlosen ZugangFehlendes öffentliches KontingentPraktischer Einsatz
NVIDIA NIMKostenlose Inference Endpoints für PrototypenAuf der Landingpage kein einheitlicher RPM-Wert, kein Token-Kontingent, keine Kartenregel und kein Preis für MehrverbrauchEinen ausgewählten Endpoint testen und anschließend die modellspezifischen Bedingungen lesen
Hugging Face Inference Providers0,10 US-Dollar pro Monat an Credits für kostenlose Nutzer, Änderungen vorbehaltenKein vergleichbares RPM- oder TPM-KontingentKleine Experimente mit gerouteten Modellen ohne eigene GPU-Infrastruktur
Mistral StudioStudio-Free-Modus und API-SchnellstartsAuf der Dokumentations-Startseite keine Angabe zu Kontingent oder KartenregelMistral-API-Funktionen testen, bevor du dich für ein kostenpflichtiges Setup entscheidest

Welche kostenlose LLM-API passt zu dir?

PrioritätBester AusgangspunktWarum
Allgemeiner PrototypGoogle AI StudioGemini bietet eine klare allgemeine Basis; aktive Limits sind in AI Studio sichtbar
Viele kleine AnfragenGroqVeröffentlichte, modellspezifische Free-Plan-Werte und ein Beispiel mit 1.000 RPD
Viele Modelle über eine APIOpenRouterKostenlose Varianten, Routing und eine OpenAI-ähnliche Schnittstelle
Cloudflare-native AnwendungWorkers AIWiederkehrendes Kontingent von 10.000 Neurons/Tag
Größtes genanntes Testkontingent nach TokensCerebrasBis zu 1M TPD, allerdings nur in einem 30-tägigen, kartenpflichtigen Test
Setup ohne ZahlungsmethodeZuerst Groq; SambaNova bei sehr geringem VolumenSambaNovas Free Tier ist auf 20 RPD begrenzt
RAG-KomponentenCohereChat, Embed und Rerank gehören zu einem gemeinsamen Trial-Key-Ökosystem
GLM Flash testenZ.AIDer angezeigte Tokenpreis beträgt 0 US-Dollar, das öffentliche Kontingent ist jedoch unbekannt
Open-Modelle ohne eigene GPU entdeckenHugging FaceGerouteter Zugang plus 0,10 US-Dollar pro Monat für kostenlose Nutzer

Starte mit einem Anbieter und protokolliere bei jeder Anfrage vier Felder: Modell-ID, HTTP-Status, Tokenverbrauch und Header mit den verbleibenden Limits. Ergänze erst dann einen zweiten Anbieter, wenn du weißt, welches Limit die erste Route erreicht. Mehrere Schlüssel schaffen nicht automatisch zusätzliche Kapazität.

So prüfst du eine kostenlose LLM-API vor dem Einsatz

Vor dem Produktivstart solltest du fünf Punkte kontrollieren:

  1. Einheit des Kontingents: Wird das Angebot in Requests, Tokens, Aufrufen, Dollar oder Recheneinheiten gemessen?
  2. Reset-Verhalten: Wird das Kontingent zu einer UTC- oder Pacific-Time-Grenze zurückgesetzt, kontinuierlich aufgefüllt, monatlich erneuert oder läuft es einmalig ab?
  3. Geltungsbereich: Gilt das Limit für das Modell, Projekt, Konto oder die Organisation?
  4. Zahlungsbedingung: Schaltet eine hinterlegte Karte mehr Kapazität frei, aktiviert sie einen kostenpflichtigen Tarif oder ist sie für den Test zwingend erforderlich?
  5. Bedingungen und Fehlerfall: Ist das Angebot auf Tests oder Evaluierungen beschränkt, und behandelt der Client HTTP 429, ohne eine Retry-Lawine auszulösen?

FAQ zu kostenlosen LLM-APIs

Welche kostenlose LLM-API ist insgesamt die beste?

Google AI Studio eignet sich für allgemeine Prototypen, Groq für ein höheres kostenloses Request-Volumen und OpenRouter für eine große Modellauswahl.

Kann ich eine kostenlose LLM-API ohne Kreditkarte nutzen?

Ja. Google, Groq, OpenRouters grundlegende Route, Cloudflares Basiszuteilung und SambasNovas Free Tier werden im geprüften Vergleich als Optionen ohne Karte aufgeführt. Cerebras verlangt für den Free Trial eine verifizierte Zahlungsmethode.

Sind kostenlose LLM-APIs wirklich dauerhaft kostenlos?

Einige wiederkehrende Tarife bleiben verfügbar, solange ihre Bedingungen gelten. Tests, Aktionspreise und wechselnde :free-Routen sind jedoch keine dauerhaft gültigen, anbieterweiten Kontingente. Prüfe die aktuelle Dokumentation und den Modellstatus, bevor du dich darauf verlässt.

Kann ich eine kostenlose LLM-API produktiv einsetzen?

Verwende sie nicht als einziges Backend, solange ihre aktuellen Bedingungen, Kontingente und die Modellverfügbarkeit nicht deine Anforderungen an den Produktiveinsatz erfüllen.

Was passiert, wenn ich das kostenlose Limit erreiche?

Die Anbieter geben normalerweise einen Drosselungs- oder Kontingentfehler zurück. Groq dokumentiert den Umgang mit HTTP 429, Cloudflare lässt nach Erschöpfung der täglichen Free-Plan-Zuteilung weitere Vorgänge fehlschlagen, und Cerebras beendet den Testzugang, sobald das Guthaben abgelaufen oder aufgebraucht ist.

>_AIReiter Modellverzeichnis

Schneller API-Zugriff auf Modelle zu diesem Guide

Gemini 3.6 Flash

Chat

Ein schnelles Gemini-Modell für fortgeschrittenes Reasoning, Coding und agentische Aufgaben.

GoogleAPI-Key erstellen >

Gemini 2.5 Pro

Chat
GoogleAPI-Key erstellen >

Claude Fable 5

Chat

Ein Premium-Claude-Modell für tiefes Denken und komplexe Arbeiten über längere Formate.

AnthropicAPI-Key erstellen >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI-Key erstellen >

Claude Opus 4.8

Chat

Ein leistungsstarkes Claude-Modell für anspruchsvolles Denken und professionelle Arbeit.

AnthropicAPI-Key erstellen >

Neueste Beiträge

DeepSeek in Janitor AI nutzen: Einrichtung 2026

2026-09-08

Muse Spark 1.3 API-Preise: Standard vs. Contributor

2026-09-08

GPT-6 Astra API im Test (2026): Für Agenten gebaut, kein Drop-in-Ersatz

2026-09-07

Kling API: Leitfaden für offizielle und Aggregator-Integration (2026)

2026-09-07
AIREITER

Fragen? Kontaktieren Sie uns unter
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

KI-Video

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

KI-Bild

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Alle anzeigen →

Unternehmen

DatenschutzrichtlinieNutzungsbedingungenRückerstattungsrichtlinie

© 2026 AIReiter. Alle Rechte vorbehalten.