Panoramica: API LLM gratuite a confronto
Questa fotografia è stata verificata l'8 settembre 2026. I limiti possono cambiare in base a modello, account, area geografica e domanda: per il dato definitivo, fai sempre riferimento alla documentazione collegata dal provider.
Le indicazioni su carta, uso commerciale e compatibilità OpenAI sono state ulteriormente verificate tramite il confronto di Free LLM API Hub.
| Provider | Accesso gratuito e quota pubblicata | Condizioni per carta/pagamento | Formato API | Indicazioni sui termini | Limite principale |
|---|---|---|---|---|---|
| Google AI Studio | I modelli Gemini variano: 5–30 RPM e 15–1.000 RPD; esempio Gemini 2.5 Flash: 10 RPM / 250 RPD | Nessuna carta indicata; possono essere richieste verifiche di account e progetto | Compatibile con OpenAI nel confronto verificato | Uso commerciale indicato come consentito; conferma i termini attuali | Google invita a verificare i limiti attivi in AI Studio |
| Groq | Esempio rappresentativo qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPD | Il Free Plan non richiede l'upgrade a pagamento; il tier Developer richiede un metodo di pagamento | Sì, in gran parte | Uso commerciale indicato come consentito; i limiti del Free Plan differiscono dalla capacità a pagamento | I limiti si applicano a livello di organizzazione e modello |
| OpenRouter | Varianti gratuite: 20 RPM / 50 RPD con meno di $10 di crediti acquistati; 1.000 RPD dopo aver acquistato almeno $10 | Il percorso free di base non richiede carta; i crediti sbloccano un limite superiore | Sì, normalizzato sull'OpenAI Chat API | Uso commerciale indicato come consentito; la disponibilità dei modelli gratuiti cambia | La quota giornaliera più alta dipende da un acquisto |
| Cloudflare Workers AI | 10.000 Neuron/giorno, condivisi dall'intero account; reset alle 00:00 UTC | L'allocazione di base è gratuita; alcuni modelli richiedono fatturazione a pagamento | Compatibile con OpenAI nel confronto verificato | Uso commerciale indicato come consentito; l'idoneità varia per modello | I Neuron misurano il calcolo, non una quota fissa di token |
| Cerebras Inference | Free Trial: 5 RPM / 30K TPM senza cache / 90K TPM totali / 1M TPD per i modelli elencati | Metodo di pagamento verificato obbligatorio | Non definito nella documentazione citata | Accesso di prova; i crediti scadono dopo 30 giorni | Il credito di prova da $5 non è permanente |
| SambaNova Cloud | Free Tier: 20 RPM / 20 RPD / 200.000 TPD per i modelli elencati | Nessun metodo di pagamento nel Free Tier; collegarne uno attiva il Developer Tier a pagamento | Sì, con differenze documentate | Uso commerciale indicato come consentito; controlla i termini dei modelli | Il limite di 20 RPD è restrittivo |
| Cohere | 1.000 chiamate/mese; Chat 20 RPM, Embed 2.000 input/min, Rerank 10 RPM | Nessuna carta indicata nel confronto verificato; conferma in fase di registrazione | Compatibile con OpenAI nel confronto verificato | Solo valutazione nel confronto verificato | Le chiamate non sono intercambiabili con i token |
| Z.AI | GLM-4.7-Flash e GLM-4.5-Flash sono indicati a $0 per le categorie di token mostrate; RPM/TPM pubblici non specificati | Nessuna carta indicata nel confronto verificato | Compatibile con OpenAI nel confronto verificato | Uso commerciale indicato come consentito; verifica i termini del modello | $0 per token non indica la capacità disponibile |
| NVIDIA NIM | Free Inference Endpoints per la prototipazione; nessuna quota universale nella landing page | Le condizioni di pagamento variano per endpoint; verifica la pagina del modello | Non definito nella documentazione citata | Indicazione di prototipo/valutazione nella pagina citata | La dicitura gratuita in landing page non equivale a una quota pubblicata |
| Hugging Face Inference Providers | Gli utenti Free ricevono $0.10/mese in crediti, soggetti a modifiche; nessun RPM/TPM pubblicato | La documentazione ufficiale sui prezzi non indica condizioni sulla carta | Compatibile con OpenAI nel confronto verificato | Verifica i termini del provider e del modello | È un piccolo credito, non una quota di richieste |
| Mistral Studio | Free mode di Studio; nessuna quota pubblica nella home della documentazione | La home non indica condizioni sulla carta | È documentato un endpoint in stile OpenAI; non viene dichiarata parità completa | Indicazione di prova/esplorazione o valutazione; verifica i termini | La modalità gratuita non dimostra accesso illimitato o pronto per la produzione |
Non ordinare le righe in base al numero più alto. Richieste, token, chiamate, dollari e Neuron sono unità diverse; una prova in scadenza non è un'allocazione che si rinnova.
Per immagini, voce, embedding e altre modalità, consulta il più ampio confronto sulle API AI gratuite. Questa pagina resta focalizzata sull'inferenza LLM ospitata.
I provider con accesso ricorrente o senza carta più chiaro
Google AI Studio: il punto di partenza più pratico per uso generale
La documentazione ufficiale sui limiti di frequenza di Google spiega che le quote Gemini dipendono da modello e progetto. Indica RPM, TPM in input e RPD come dimensioni comuni, precisa che le quote si applicano al progetto Google Cloud e non a ogni API key, e rimanda ad AI Studio per i valori attivi. Le quote giornaliere di richieste si azzerano a mezzanotte, ora del Pacifico.
Un confronto secondario verificato riporta 10 RPM e 250 RPD per Gemini 2.5 Flash, con valori tra 5–30 RPM e 15–1.000 RPD sui vari modelli. Considerali valori utili per pianificare, perché Google specifica che i limiti attivi variano e non sono garantiti.
Gemini è adatto a prototipi generici e multimodali; i limiti giornalieri specifici del modello possono però frenare i carichi con molte richieste.
Groq: l'opzione senza carta più solida per quota di richieste pubblicata
La documentazione sui limiti di Groq elenca le soglie per modello e organizzazione. La riga attuale del Free Plan per qwen/qwen3.6-27b riporta 30 RPM, 1.000 RPD, 8.000 TPM e 200.000 TPD. Gli altri modelli hanno limiti giornalieri e di token differenti.
“I limiti di frequenza si applicano a livello di organizzazione, non ai singoli utenti.” — documentazione sui limiti di Groq
Usare più API key non crea automaticamente capacità indipendente per l'intera organizzazione. La documentazione Groq descrive gli header retry-after e x-ratelimit-* per gestire le risposte HTTP 429.
Groq è il punto di partenza più chiaro per molte piccole richieste, se il modello scelto supporta il tuo caso d'uso. Controlla la riga del modello specifico invece di considerare il provider come se avesse un'unica quota.
OpenRouter: il gateway più flessibile per modelli gratuiti
OpenRouter offre un'unica superficie API per una selezione variabile di modelli gratuiti. Il confronto attuale sull'accesso gratuito riporta 20 richieste al minuto e 50 richieste al giorno finché l'account ha acquistato meno di $10 in crediti. Dopo almeno $10 di crediti acquistati complessivamente, la quota giornaliera sale a 1.000 richieste. Il limite superiore richiede quindi un acquisto.
La documentazione ufficiale sui limiti chiarisce che account o API key aggiuntivi non modificano i limiti globali della piattaforma. Il servizio espone le informazioni di quota tramite l'endpoint delle chiavi e gli header degli errori di rate limit.
Puoi fissare un modello con il suffisso :free oppure usare openrouter/free, che seleziona automaticamente un modello gratuito disponibile. Il router può filtrare funzionalità come tool calling o comprensione delle immagini, ma il modello sottostante può cambiare.
Usa OpenRouter per esperimenti e routing di fallback, non per un'applicazione che dipende da un comportamento stabile di un singolo modello gratuito.
Cloudflare Workers AI: calcolo ricorrente, non token gratuiti
La pagina ufficiale dei prezzi di Cloudflare assegna a ogni account un totale di 10.000 Neuron al giorno senza costi. L'allocazione è condivisa da tutta l'attività Workers AI e si azzera alle 00:00 UTC. Nel piano Workers Free, le operazioni successive falliscono una volta esaurita l'allocazione.
Un Neuron rappresenta il calcolo GPU necessario per una richiesta. Cloudflare pubblica equivalenze di token specifiche per modello, invece di promettere che 10.000 Neuron corrispondano a un numero fisso di prompt.
Cloudflare specifica inoltre che alcuni modelli più recenti DeepSeek, GLM e Kimi richiedono un metodo di fatturazione a pagamento. “10.000 Neuron gratis” non significa che ogni modello sia disponibile senza fatturazione.
Accesso gratuito, ma con una condizione
Cerebras: una prova utile, non un'API gratuita permanente
La documentazione Cerebras sui limiti di frequenza elenca 5 RPM, 30.000 TPM senza cache, 90.000 TPM totali e 1 milione di TPD per i modelli del Free Trial. Spiega inoltre che il suo token bucket si ricarica continuamente, anziché attendere un semplice reset giornaliero.
I nuovi account ricevono $5 in crediti gratuiti, che scadono dopo 30 giorni, e per attivare Playground e accesso API è richiesto un metodo di pagamento verificato. Alla scadenza o all'esaurimento del credito, l'accesso si interrompe salvo l'acquisto di altri crediti. La documentazione verificata non descrive un'allocazione gratuita pubblica che si rinnovi in modo permanente.
Cerebras funziona bene per una valutazione breve. Non dovrebbe essere l'unica dipendenza di un progetto che deve continuare a funzionare dopo la prova.
SambaNova Cloud: la separazione più netta in base allo stato di fatturazione
SambaNova definisce il proprio Free Tier in base allo stato della fatturazione: si applica quando non è collegato alcun metodo di pagamento. Per i modelli elencati nel Free Tier, la documentazione ufficiale mostra 20 RPM, 20 RPD e 200.000 TPD. Il limite di 20 RPD può bloccare un flusso di lavoro con polling intenso prima di esaurire la quota di token.
Collegare un metodo di pagamento attiva il Developer Tier, che è a pagamento e non va considerato gratuito. SambaNova espone inoltre, tramite gli header di risposta, le informazioni sulle richieste residue e sul reset.
Usa SambaNova solo per proof of concept a basso volume: il tetto di 20 RPD va verificato prima di adottarlo in qualsiasi workflow agentico.
Cohere: utile per RAG, ma le chiamate vanno contate con attenzione
La trial key di Cohere è diversa da un tier gratuito basato sui token. Il confronto verificato attuale riporta 1.000 chiamate al mese, con limiti specifici per endpoint di 20 RPM per Chat, 2.000 input al minuto per Embed e 10 RPM per Rerank. Le FAQ di Cohere descrivono le trial key come gratuite ma limitate.
Questa combinazione rende Cohere utile per esperimenti di retrieval-augmented generation: un singolo progetto può testare generazione, embedding e reranking. Non trasforma però la prova in un backend chat ad alto volume. Non confrontare direttamente 1.000 chiamate/mese con 1 milione di token/giorno.
Il confronto verificato classifica la prova come destinata esclusivamente alla valutazione. Prima di usarla in un'applicazione pubblica o commerciale, conferma la policy d'uso vigente.
Z.AI: prezzo gratuito non significa quota nota
La documentazione sui prezzi di Z.AI indica GLM-4.7-Flash e GLM-4.5-Flash come gratuiti per le categorie di token visualizzate. La pagina pubblica sui prezzi verificata non fornisce valori concreti di RPM, RPD, TPM o TPD.
Considera quindi la quota di Z.AI sconosciuta: può andare bene per test manuali, non per elaborazioni batch; verifica endpoint, disponibilità del modello e termini al momento della registrazione.
NVIDIA, Hugging Face e Mistral: percorsi di scoperta con dati di quota incompleti
| Provider | Segnale di accesso gratuito | Quota pubblica mancante | Uso pratico |
|---|---|---|---|
| NVIDIA NIM | Free Inference Endpoints per la prototipazione | Nessun RPM universale, quota token, regola sulla carta o prezzo per eccedenze nella landing page | Prova un endpoint selezionato, poi leggi i termini specifici del modello |
| Hugging Face Inference Providers | $0.10/mese in crediti per gli utenti Free, soggetti a modifiche | Nessuna quota RPM o TPM comparabile | Piccoli esperimenti con modelli instradati senza gestire infrastruttura GPU |
| Mistral Studio | Free mode di Studio e quickstart API | Nessuna quota o regola sulla carta nella home della documentazione | Prova le funzionalità dell'API Mistral prima di passare a una configurazione a pagamento |
Quale API LLM gratuita scegliere?
| La tua priorità | Miglior punto di partenza | Perché |
|---|---|---|
| Prototipo per uso generale | Google AI Studio | Gemini offre una base chiara per uso generale; i limiti attivi sono visibili in AI Studio |
| Molte piccole richieste | Groq | Righe del Free Plan pubblicate per modello e un esempio da 1.000 RPD |
| Molti modelli attraverso una sola API | OpenRouter | Varianti gratuite, routing e interfaccia in stile OpenAI |
| Applicazione nativa Cloudflare | Workers AI | Allocazione ricorrente di 10.000 Neuron/giorno |
| La maggiore quota token dichiarata per una prova | Cerebras | Fino a 1M TPD, ma solo in una prova di 30 giorni con carta obbligatoria |
| Configurazione rigorosamente senza metodo di pagamento | Prima Groq; SambaNova per volumi molto ridotti | Il Free Tier di SambaNova ha un tetto di 20 RPD |
| Componenti RAG | Cohere | Chat, Embed e Rerank condividono lo stesso ecosistema di trial key |
| Test di GLM Flash | Z.AI | Il prezzo token visualizzato è $0, ma la quota pubblica è sconosciuta |
| Esplorazione di modelli aperti senza GPU | Hugging Face | Accesso instradato più $0.10/mese per gli utenti Free |
Parti da un provider e registra quattro campi per ogni richiesta: ID del modello, stato HTTP, utilizzo dei token e header dei limiti residui. Aggiungi un secondo provider solo dopo aver capito quale soglia raggiunge il primo percorso; più chiavi non creano necessariamente più capacità.
Come verificare un'API LLM gratuita prima di usarla
Prima del lancio, verifica cinque aspetti:
- Unità di quota: L'offerta è misurata in richieste, token, chiamate, dollari o unità di calcolo?
- Modalità di reset: Si azzera a un confine UTC o dell'ora del Pacifico, si ricarica continuamente, si rinnova ogni mese oppure scade una sola volta?
- Ambito: Il limite è associato a modello, progetto, account o organizzazione?
- Condizione di pagamento: Aggiungere una carta sblocca più capacità, attiva un tier a pagamento oppure diventa obbligatorio per la prova?
- Termini e gestione degli errori: L'offerta è limitata a test o valutazione e il client gestisce HTTP 429 senza generare una tempesta di retry?
FAQ sulle API LLM gratuite
Qual è la migliore API LLM gratuita in assoluto?
Google AI Studio è adatto ai prototipi generici; Groq a un volume più alto di richieste gratuite; OpenRouter alla varietà di modelli.
Posso usare un'API LLM gratuita senza carta di credito?
Sì. Nel confronto verificato Google, Groq, il percorso base di OpenRouter, l'allocazione di base di Cloudflare e il Free Tier di SambaNova sono indicati come opzioni senza carta. Cerebras richiede un metodo di pagamento verificato per il suo Free Trial.
Le API LLM gratuite sono davvero permanenti?
Alcuni tier ricorrenti restano disponibili finché ne durano i termini, ma prove, prezzi promozionali e percorsi :free a rotazione non sono allocazioni permanenti valide per l'intero provider. Prima di dipendere da un solo servizio, controlla documentazione e stato attuale del modello.
Posso usare un'API LLM gratuita in produzione?
Non usarla come unico backend a meno che termini attuali, quota e disponibilità del modello soddisfino i requisiti della tua produzione.
Cosa succede quando raggiungo il limite gratuito?
I provider restituiscono normalmente un errore di throttling o di quota. Groq documenta la gestione di HTTP 429, Cloudflare indica che le operazioni successive falliscono dopo l'esaurimento dell'allocazione giornaliera del piano Free e Cerebras interrompe l'accesso di prova quando il credito scade o si esaurisce.