Limiti delle API AI gratuite a colpo d'occhio
Nel mondo delle API AI, "gratuito" non significa quasi mai illimitato. Di solito indica un piano soggetto a limiti: a volte una quota permanente, altre volte crediti promozionali destinati a esaurirsi. Tutti i provider elencati qui rilasciano chiavi API senza chiedere una carta di credito, ma il volume utilizzabile va da poche richieste al giorno a decine di migliaia.
Le cifre riportate in questa guida sono state verificate sulla documentazione ufficiale di ciascun provider nell'agosto 2026. I limiti cambiano spesso: prima di usare un numero per pianificare un progetto in produzione, controlla sempre la console del servizio.
| Provider | Informazioni chiave sul piano gratuito | Elemento distintivo della politica sui dati | Ideale per |
|---|---|---|---|
| Google AI Studio | Nessuna carta o account di fatturazione; modelli Gemini; quote per progetto azzerate a mezzanotte del Pacifico | I prompt gratuiti addestrano i prodotti Google | Ampia scelta di modelli, prototipazione |
| Groq | 14.400 RPD su Llama 3.1 8B; 70K TPM sui modelli Compound | Nessuna conservazione predefinita; disponibile ZDR | Prompt brevi ad alta frequenza |
| OpenRouter | 50 richieste gratuite al giorno; oltre 25 modelli gratuiti; supporto BYOK | Varia in base al provider upstream | Testare molti modelli |
| GitHub Models | 15 RPM / 150 RPD (livello basso); 8.000 token in input + 4.000 in output | Termini sui dati di Microsoft | Esperimenti rapidi con un PAT |
| Cloudflare Workers AI | 10.000 Neurons al giorno (~280K token in output su Llama 3.1 8B Fast) | Impegno esplicito a non usare i dati per l'addestramento | Attività sensibili dal punto di vista della privacy |
| Cohere | 20 richieste/min; 1.000 chiamate/mese | Licenza di valutazione | Test di embedding e reranking |
| NVIDIA NIM | 1.000 crediti alla registrazione; fino a 5.000 con un indirizzo email aziendale | L'utilizzo degli endpoint gratuiti viene registrato | Test occasionali dei modelli |
| Hugging Face | 0,10 $/mese su oltre 200 modelli | La quota può cambiare | Inferenza su scala demo |
| Mistral | Modalità con chiave API gratuita; limiti nel pannello Admin | Viene menzionata un'opzione di conservazione zero | Modelli ospitati in Europa |
Nove provider rilasciano chiavi senza carta di credito. Sette offrono piani gratuiti ricorrenti, mentre NVIDIA e Hugging Face forniscono crediti consumabili che non si rinnovano. La differenza è notevole: GitHub Models permette 8 richieste al giorno con DeepSeek-R1, mentre Groq ne offre 14.400 al giorno su Llama 3.1 8B.
Google AI Studio: il piano gratuito da cui partire
Per chi vuole provare modelli di fascia frontier senza inserire dati di pagamento, Google AI Studio è il punto di partenza più naturale. Non servono né carta di credito né account di fatturazione: basta accedere con un account Google, generare una chiave API e iniziare a fare chiamate.
Il piano gratuito include la famiglia di modelli Gemini: Gemini 3.6 Flash, 3.5 Flash, 2.5 Pro e altri. Sono disponibili gli endpoint per testo ed embedding; le quote vengono definite per progetto e si azzerano a mezzanotte, ora del Pacifico.
La quota si vede solo dopo la registrazione
Google non pubblica una scheda unica con i limiti del piano gratuito, come fanno Groq o OpenRouter. I limiti effettivi — richieste al minuto, token al minuto e token al giorno — compaiono nella console di AI Studio solo dopo la creazione di un progetto. Pianificare la capacità in anticipo diventa quindi difficile: la strada più pratica è creare un progetto, aprire la pagina Quotas e progettare l'applicazione sulla base del limite visualizzato.
Nel piano gratuito i prompt possono addestrare i prodotti Google
È il principale punto critico. I termini del piano gratuito di Google specificano che prompt e contenuti generati possono essere utilizzati per migliorare i prodotti Google. Se lavori con dati sensibili, proprietari o personali, il piano gratuito non è adatto al tuo caso. L'utilizzo a pagamento delle API Gemini, tramite Google Cloud con un account di fatturazione, non prevede questa clausola di addestramento, ma richiede una carta di credito.
Anche la generazione di immagini tramite Gemini non è disponibile nel piano gratuito, che comprende solo testo ed embedding.
Groq: limiti giornalieri chiari e verificabili
Il piano gratuito di Groq è quello più generoso per carichi di lavoro con prompt brevi e frequenti. I limiti sono pubblicati chiaramente nella documentazione Groq e si applicano per organizzazione, non per utente. I token memorizzati nella cache non vengono conteggiati nei limiti.
| Modello | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
| Llama 3.1 8B Instant | 30 | 14.400 | 6.000 | 500.000 |
| Llama 3.3 70B Versatile | 30 | 1.000 | 12.000 | 100.000 |
| GPT-OSS-120B | 30 | 1.000 | 8.000 | 200.000 |
| GPT-OSS-20B | 30 | 1.000 | 8.000 | 200.000 |
| Qwen 3.6-27B | 30 | 1.000 | 8.000 | 200.000 |
| Groq Compound | 30 | 250 | 70.000 | — |
| Groq Compound Mini | 30 | 250 | 70.000 | — |
| Whisper Large V3 | 20 | 2.000 | — | 28.800 secondi audio/giorno |
Il dato più interessante è quello di Llama 3.1 8B: 14.400 richieste al giorno, abbastanza per una prototipazione seria o per un endpoint in produzione con poco traffico. I modelli Compound arrivano invece alla quota più alta di token al minuto, 70.000 TPM, ma hanno un limite giornaliero più stretto, pari a 250 RPD.
Groq non conserva di norma i dati delle inferenze e offre un'opzione Zero Data Retention (ZDR), che lo rende una delle scelte più solide per la privacy tra i provider gratuiti. Il limite principale riguarda il modello 8B: i 6.000 TPM possono rallentare le generazioni con contesti lunghi o volumi elevati.
OpenRouter: 50 richieste gratuite al giorno
OpenRouter è un gateway API, non un provider che ospita direttamente i modelli. Il piano gratuito consente di chiamare un catalogo variabile di modelli sovvenzionati da OpenRouter: basta aggiungere :free al nome del modello oppure usare l'auto-router openrouter/free.
Limiti: i modelli gratuiti sono soggetti a un massimo di 20 RPM e 50 richieste al giorno. Con un acquisto una tantum di 10 $ di credito, il limite giornaliero permanente dei modelli gratuiti sale a 1.000 richieste. A questi limiti si aggiungono eventuali restrizioni applicate dal provider upstream.
Catalogo dei modelli gratuiti: nell'agosto 2026 OpenRouter elenca oltre 25 modelli gratuiti, rispetto ai 15 di luglio, tra generazione di testo, embedding e reranking. Il catalogo comprende modelli NVIDIA (le famiglie Nemotron 3 Ultra, Super e Nano con contesti fino a 1M token), Google (Gemma 4), Cohere (North Mini Code), OpenAI (gpt-oss-20b) e diversi altri. L'elenco cambia spesso, man mano che i provider aggiungono o ritirano gli endpoint gratuiti.
BYOK (Bring Your Own Key): OpenRouter supporta il BYOK per oltre 60 provider di inferenza. Quando inserisci le tue chiavi API, il provider sottostante addebita direttamente il costo dell'inferenza e OpenRouter applica solo il costo del proprio livello di routing. La quota gratuita del BYOK ora dipende dal piano ed è calcolata sul costo di inferenza di listino, non su un numero fisso di richieste: per i termini aggiornati, consulta la pagina dei prezzi di OpenRouter.
Il punto da tenere presente è questo: su OpenRouter "gratuito" significa nessun costo per i token, non necessariamente nessuna conservazione dei dati. Ogni provider upstream applica la propria politica e alcuni, tra cui NVIDIA e Poolside, registrano esplicitamente l'utilizzo degli endpoint gratuiti o possono usare i prompt per l'addestramento. Se necessario, configura i filtri sulla privacy per ciascun provider.
Altri sei piani gratuiti
GitHub Models
GitHub Models offre un playground e un endpoint API per modelli popolari, accessibili tramite un GitHub Personal Access Token (PAT). Il livello basso prevede 15 RPM e 150 RPD; quello alto scende a 10 RPM e 50 RPD. Ogni richiesta è limitata a 8.000 token in input e 4.000 in output. DeepSeek-R1 è disponibile, ma limitato a 8 richieste al giorno.
GitHub Models è comodo per gli esperimenti veloci, perché l'autenticazione tramite PAT non richiede una registrazione separata. I limiti ristretti su token e richieste, però, lo rendono inadatto a qualsiasi utilizzo che vada oltre la prototipazione.
Cloudflare Workers AI
Cloudflare Workers AI assegna a ogni account 10.000 Neurons al giorno, con azzeramento alle 00:00 UTC. Con Llama 3.1 8B Fast, equivalgono all'incirca a 280.000 token generati al giorno. Cloudflare ospita inoltre FLUX per la generazione gratuita di immagini: è la principale opzione per le immagini senza carta di credito presente in questo elenco.
La sua posizione sulla privacy è la più netta tra tutti i provider considerati: Cloudflare si impegna esplicitamente a non usare prompt o output dei clienti per addestrare i modelli o migliorare il servizio senza consenso. Per questo Workers AI è la scelta che consigliamo per i carichi di lavoro con dati sensibili.
L'unità Neurons è meno immediata rispetto a un semplice conteggio di richieste o token: per sapere quanti Neurons consuma un determinato modello per token bisogna consultare la dashboard di Workers AI.
Cohere, NVIDIA, Hugging Face e Mistral
Cohere offre 20 richieste al minuto e 1.000 chiamate API al mese nel piano gratuito. Sono limiti adatti a valutazione e test, non a un utilizzo operativo intenso. Sono inclusi i modelli Command e gli endpoint per gli embedding.
NVIDIA NIM mette a disposizione 1.000 crediti alla registrazione, che diventano fino a 5.000 con un indirizzo email aziendale. Sono crediti consumabili una tantum, non una quota mensile ricorrente, e NVIDIA non pubblica un rapporto tra crediti e richieste. I modelli gratuiti NVIDIA su OpenRouter riportano un avviso: l'uso degli endpoint gratuiti viene registrato e l'azienda sconsiglia di inviare dati riservati o personali.
Hugging Face offre circa 0,10 $ al mese di crediti gratuiti per l'inferenza su oltre 200 modelli tramite la sua Serverless Inference API. La quota è esplicitamente indicata come soggetta a cambiamenti. Si tratta di un'opzione adatta solo a demo: sufficiente per provare un modello, non per costruirci sopra un servizio.
Mistral dispone di una modalità con chiave API gratuita, ma i limiti sono visibili solo nel pannello Admin. La documentazione Mistral menziona un'opzione di conservazione zero, senza però presentarla come una politica predefinita chiara del piano gratuito. Valutare il servizio per scenari sensibili dal punto di vista della privacy è quindi più difficile.
Oltre il testo: immagini, voce ed embedding
Due provider coprono modalità che vanno oltre il testo:
- Cloudflare Workers AI ospita FLUX per generare immagini senza costi: è l'unica opzione di questo elenco che non richiede una carta di credito. I modelli per immagini di Gemini non sono disponibili nel piano gratuito.
- Groq Whisper offre la conversione voce-testo con 2.000 richieste al giorno e 28.800 secondi audio al giorno nel piano gratuito.
Il catalogo gratuito di OpenRouter si è inoltre ampliato con modelli NVIDIA per embedding e reranking, aggiungendo al piano gratuito funzionalità utili per il retrieval e le pipeline RAG.
Se i dati sono importanti, la scelta si riduce a due provider
Per attività che coinvolgono dati sensibili, proprietari o soggetti a regolamentazione, la maggior parte dei provider di questo elenco non è adatta:
- Google AI Studio usa i prompt del piano gratuito per addestrare i propri prodotti.
- NVIDIA registra l'utilizzo degli endpoint gratuiti e sconsiglia l'invio di dati riservati.
- I modelli gratuiti di OpenRouter ereditano la politica sui dati del provider upstream: alcuni, come Poolside e Liquid, dichiarano esplicitamente di addestrare i modelli sui prompt gratuiti.
- Hugging Face e Mistral applicano termini sulla conservazione poco chiari o soggetti a cambiamenti.
Restano due provider con impegni sulla privacy chiari ed espliciti:
- Cloudflare Workers AI — impegno esplicito a non usare i dati per l'addestramento né per migliorare il servizio senza consenso.
- Groq — nessuna conservazione predefinita dei dati di inferenza; disponibile l'opzione Zero Data Retention.
Se il tuo carico di lavoro richiede privacy e ha un volume da basso a moderato, Cloudflare è la scelta più sicura. Se invece ti serve maggiore throughput e puoi lavorare entro i limiti di token al minuto di Groq, Groq con ZDR è l'alternativa.
Quando il piano gratuito non basta più
Prima o poi, ogni piano gratuito di questo elenco inizierà a limitare le richieste. La vera domanda è come muoversi a quel punto.
L'approccio consigliato è passare a un utilizzo a pagamento a consumo con un unico provider, invece di saltare da un servizio gratuito all'altro. Cambiare provider per aggirare i limiti significa introdurre complessità operativa — SDK diversi, politiche sui dati diverse e modalità di errore diverse — che spesso costa più tempo di sviluppo di quanto si risparmi sulle API.
Quattro provider dell'elenco supportano endpoint compatibili con OpenAI: Groq, OpenRouter, Cloudflare Workers AI e Google AI Studio (tramite il wrapper compatibile con OpenAI). Puoi quindi passare dal piano gratuito a quello a pagamento aggiornando base URL e chiave API, senza riscrivere il codice dell'applicazione.
Il percorso più pratico è iniziare gratis con Google AI Studio se ti serve varietà di modelli, oppure con Groq se la priorità è il throughput. Quando raggiungi con regolarità i limiti giornalieri, aggiungi un account di fatturazione allo stesso provider e passa al prezzo a consumo. Tieni OpenRouter per i test multi-modello e scegli Cloudflare quando la privacy dei dati non è negoziabile.
FAQ
Quali API AI gratuite non richiedono una carta di credito? Tutti e nove i provider elencati rilasciano chiavi API senza carta di credito: Google AI Studio, Groq, OpenRouter, GitHub Models, Cloudflare Workers AI, Cohere, NVIDIA, Hugging Face e Mistral.
Quale API gratuita ha il limite giornaliero più alto? Groq offre 14.400 richieste al giorno su Llama 3.1 8B Instant: è il limite ricorrente più alto tra i provider gratuiti inclusi nell'elenco.
OpenRouter è davvero gratuito? Le varianti :free dei modelli OpenRouter non hanno costi per token, ma sono limitate a 50 richieste al giorno, che diventano 1.000 dopo un acquisto di 10 $ di credito. La modalità BYOK permette di usare le proprie chiavi dei provider con una quota gratuita che dipende dal piano. Nessuna delle due opzioni è realmente illimitata.
Posso usare un'API AI gratuita in produzione? Sì, entro i limiti previsti. Groq e Cloudflare offrono i piani gratuiti più adatti alla produzione, rispettivamente per throughput e privacy. Quando i limiti gratuiti iniziano a interrompere regolarmente il tuo carico di lavoro, passa al piano a pagamento dello stesso provider.
Qual è la migliore API gratuita per i dati sensibili? Cloudflare Workers AI e Groq sono gli unici provider con impegni espliciti a non usare i dati per l'addestramento e a non conservarli nei rispettivi piani gratuiti. Gli altri usano i prompt gratuiti per l'addestramento (Google), registrano l'utilizzo (NVIDIA) oppure dipendono dalle politiche dei singoli provider (OpenRouter).