Nel 2026 si può ancora far girare un progetto vero su un'API AI gratuita? Sì. Solo Groq mette a disposizione 14.400 richieste gratuite al giorno su un modello Llama da 8B. Le differenze tra i provider, però, arrivano a tre ordini di grandezza, mentre Google non pubblica più nemmeno i numeri del proprio tier gratuito. Tutti i dati riportati qui arrivano dalla documentazione ufficiale dei provider e sono stati verificati il 29 luglio 2026.
API AI gratuite: limiti a confronto, verificati il 29 luglio 2026
Nove provider rilasciano chiavi API senza richiedere una carta di credito. Sette offrono un tier gratuito ricorrente; NVIDIA e Hugging Face, invece, assegnano crediti una tantum destinati a esaurirsi.
| Provider | Tier gratuito (numeri ufficiali) | Carta di credito | Addestra sui tuoi dati (tier gratuito) |
|---|---|---|---|
| Google Gemini API | Token gratuiti sui modelli testuali flash/pro; RPM/RPD per modello visibili solo nel proprio account AI Studio | No | Sì ("Usati per migliorare i nostri prodotti: Sì") |
| Groq | llama-3.1-8b: 30 RPM / 14.400 RPD; llama-3.3-70b: 30 RPM / 1.000 RPD / 100K TPD | No | Nessuna conservazione predefinita; ZDR disponibile |
| OpenRouter | Modelli :free: 20 RPM, 50 req/giorno — 1.000 req/giorno dopo una ricarica una tantum di $10 | No (ricarica facoltativa) | Dipende dal provider upstream; interruttore di opt-out |
| GitHub Models | Modelli di fascia bassa: 15 RPM / 150 RPD; DeepSeek-R1: 1 RPM / 8 RPD | No (solo PAT) | Non indicato nella documentazione |
| Cloudflare Workers AI | 10.000 Neurons/giorno, reset alle 00:00 UTC | No | No (impegno esplicito) |
| Cohere | Chiave di prova: 20 req/min, 1.000 chiamate/mese | No | Non indicato nella pagina sui limiti |
| Mistral | Esiste una modalità gratuita; i limiti sono visibili solo nell'Admin Panel | No | Non indicato; annunciata un'opzione gratuita senza conservazione |
| Hugging Face Inference Providers | $0.10/mese in crediti (contrassegnati come "soggetti a modifica") | No | In base alla policy del provider che riceve il routing |
| NVIDIA NIM | 1.000 crediti alla registrazione, fino a 5.000 con un'email aziendale | No | Non indicato |
I limiti giornalieri vanno dalle 8 richieste di DeepSeek-R1 su GitHub Models alle 14.400 dell'endpoint 8B di Groq. Attenzione ai confronti: richieste, token, Neurons e crediti in dollari non sono la stessa unità di misura.
Google AI Studio: il punto di partenza gratuito, con due importanti limiti
Per la maggior parte degli sviluppatori, Google AI Studio resta il tier gratuito da provare per primo: offre Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 2.5 Pro e altri otto modelli testuali senza costi e senza bisogno di un account di fatturazione. Per accedere al tier gratuito basta "un progetto attivo o una prova gratuita"; è il Tier 1 a pagamento a richiedere il collegamento della fatturazione.
I limiti della quota si vedono solo dopo l'iscrizione
La pagina di Google sui rate limit non riporta più i limiti di richieste per singolo modello: rimanda direttamente al progetto personale in AI Studio. Restano valide due regole generali: le quote sono calcolate per progetto, non per chiave API, e i contatori giornalieri si azzerano a mezzanotte, ora del Pacifico. Qualsiasi valore RPM specifico trovato altrove va considerato datato finché non viene confermato dalla dashboard.
Nel tier gratuito i prompt contribuiscono ai prodotti Google
Tutte le righe del tier gratuito nella pagina dei prezzi di Google riportano "Used to improve our products: Yes"; il traffico a pagamento è invece segnato come No. Se invii dati dei clienti o informazioni coperte da NDA, questa clausola esclude il tier gratuito, indipendentemente dalla quota disponibile. È inoltre esclusa la generazione di immagini: Gemini gratuito copre soltanto testo ed embedding.
Groq: limiti giornalieri chiari e pubblici
Groq pubblica i propri limiti del tier gratuito modello per modello, senza richiedere il login:
| Modello | RPM | Richieste/giorno | Token/giorno |
|---|---|---|---|
| llama-3.1-8b-instant | 30 | 14.400 | 500K |
| llama-3.3-70b-versatile | 30 | 1.000 | 100K |
| openai/gpt-oss-120b | 30 | 1.000 | 200K |
| whisper-large-v3 | 20 | 2.000 | 28.800 sec audio |
Il collo di bottiglia sono i token al minuto: llama-3.3-70b si ferma a 12K TPM, quindi i flussi con contesto lungo vengono limitati anche quando il numero di richieste giornaliere sembra generoso. Sul fronte dati, Groq non conserva per impostazione predefinita input e output dell'inferenza e mette a disposizione Zero Data Retention su richiesta.
Per prompt brevi e frequenti — classificazione, estrazione, arricchimento di webhook — l'endpoint 8B di Groq, con 14.400 richieste al giorno, è l'offerta gratuita migliore del confronto. A patto che un modello da 8B sia sufficiente e di restare sotto i 6K token al minuto.
OpenRouter: 50 richieste gratuite al giorno, oppure 1.000 con $10 depositati
OpenRouter non offre il catalogo di un singolo fornitore: mette a disposizione i modelli con suffisso :free. Il 29 luglio 2026 il pool includeva 15 modelli testuali, tra cui NVIDIA Nemotron 3 Ultra e Ling-3.0-flash.
I limiti valgono sull'intero account e su tutti i modelli gratuiti: 20 richieste al minuto e 50 al giorno. Un singolo acquisto di $10 in crediti porta permanentemente il tetto giornaliero a 1.000 richieste, e quei $10 restano utilizzabili sui modelli a pagamento. In pratica, il tier gratuito davvero utilizzabile di OpenRouter costa $10 una sola volta.
Il traffico dei modelli gratuiti viene inoltrato a provider upstream secondo le rispettive policy; per impostazione predefinita non vengono esclusi quelli che addestrano sui tuoi input. Le impostazioni sulla privacy permettono però di bloccarli, con opzioni separate per modelli gratuiti e a pagamento. Quanto all'utilità concreta del catalogo, uno sviluppatore su r/ChatGPTCoding scrive:
"Consiglio di usare la chiave API di OpenRouter con il modello gratuito Deepseek/Deepseek R1 0528, senza limiti e senza rate limit. È intelligente e ha un ragionamento solido."
Il pool cambia di mese in mese; le scelte attuali per il coding analizzano i modelli uno per uno.
Altri sei tier gratuiti da tenere presenti
GitHub Models: un ambiente di prova gratuito con API reale
Qualsiasi account GitHub può accedere all'API usando soltanto un personal access token: niente carta e nessuna registrazione separata. Senza un abbonamento Copilot si rientra nella colonna Copilot Free: 15 RPM / 150 richieste al giorno per i modelli di fascia bassa, 10 RPM / 50 RPD per quelli di fascia alta, con richieste limitate a 8.000 token in input + 4.000 in output. I modelli di reasoning hanno limiti molto più stretti: DeepSeek-R1 consente 8 richieste al giorno. GitHub specifica che questi limiti possono cambiare senza preavviso.
Cloudflare Workers AI: 10.000 Neurons al giorno e nessun addestramento sui dati
Cloudflare misura il consumo in Neurons: 10.000 al giorno, con reset alle 00:00 UTC, sia nei piani Workers Free sia in quelli Paid. In base alla tabella di conversione di Cloudflare, corrispondono a circa 280K token di output al giorno su llama-3.1-8b-fast. Cloudflare dichiara inoltre per iscritto che non utilizzerà i contenuti dei clienti per addestrare modelli o migliorare i servizi senza consenso: è l'impegno più forte sui dati tra i nove provider e il motivo per cui è la scelta predefinita per attività sensibili sul piano della privacy.
Cohere, NVIDIA, Hugging Face e Mistral: quote più piccole o poca trasparenza
| Provider | Allocazione gratuita | Il limite |
|---|---|---|
| Cohere | Chiave di prova: 20 req/min | 1.000 chiamate/mese complessive: per valutazione, non per operatività |
| NVIDIA build.nvidia.com | 1.000 crediti alla registrazione; fino a 5.000 con email aziendale | Crediti una tantum, non un tier ricorrente, senza un tasso pubblicato di conversione crediti-richieste |
| Hugging Face Inference Providers | $0.10/mese in crediti su oltre 200 modelli | Sufficienti solo per demo e contrassegnati come "soggetti a modifica" |
| Mistral | Modalità gratuita per chiavi API | I limiti non sono pubblici: compaiono solo nell'Admin Panel |
Oltre il testo: immagini, voce ed embedding a $0
I tier gratuiti diventano più scarni fuori dal testo. La generazione di immagini è il caso più evidente: i modelli immagini di Gemini sono segnati come "Not available" nel tier gratuito, e questo lascia il deployment FLUX di Cloudflare, incluso negli stessi 10.000 Neurons giornalieri, come principale opzione senza carta. La trascrizione audio è messa meglio: Groq assegna a whisper-large-v3 una quota gratuita dedicata di 2.000 richieste e 28.800 secondi audio al giorno. Per gli embedding funzionano senza pagare sia Gemini, con gemini-embedding-001 nel tier gratuito, sia GitHub Models, con 15 RPM / 150 RPD.
Se i dati sono sensibili, la scelta si riduce a due
Cloudflare e Groq sono gli unici due provider qui elencati a impegnarsi per iscritto a non addestrare sui dati del tier gratuito o a non conservarne gli input. Google dichiara apertamente il contrario; gli altri cinque non dicono nulla nelle pagine dove ci si aspetterebbe di trovare questa informazione. Con dati reali degli utenti, quindi, la situazione resta irrisolta e non può essere considerata sicura.
Una chiave condivisa o instradata tramite proxy, trovata in un repository GitHub o su un server Discord, non dovrebbe nemmeno entrare nella lista: il traffico passa dall'account di uno sconosciuto e l'accesso termina quando termina il suo account.
Quando il gratuito non basta più
Hai superato i tier gratuiti quando una di queste situazioni diventa abituale:
- Un limite giornaliero interrompe il lavoro reale: i 100K token/giorno di Groq 70B equivalgono a un solo job batch di dimensioni moderate.
- Ti serve una classe di modelli che nessun tier gratuito offre. I modelli frontier di reasoning e la generazione di immagini sono assenti o limitati in tutti i nove tier sopra elencati.
- Stai investendo tempo di engineering nel passare da un provider all'altro per aggirare i limiti.
L'overflow costa meno di quanto sembri: i modelli misurati a consumo della classe flash sono tariffati per milione di token, quindi una giornata oltre i 100K gratuiti di Groq costa pochi centesimi su un aggregatore come AIReiter. Groq, OpenRouter, Cloudflare e Gemini espongono tutti endpoint compatibili con OpenAI: nella maggior parte dei casi, il passaggio richiede solo di cambiare la base URL.
| La tua situazione | Restare gratis o pagare? |
|---|---|
| Prototipo, senza dati reali degli utenti | Gratis: Google AI Studio per ampiezza o Groq per throughput |
| Dati sensibili, volume ridotto | Gratis: Cloudflare Workers AI, con garanzia di nessun addestramento |
| Provare molti modelli spendendo poco | OpenRouter: 50 req/giorno gratis; un acquisto una tantum da $10 sblocca 1.000/giorno |
| I limiti giornalieri interrompono il lavoro reale | Pay-as-you-go a consumo; tier gratuiti come fallback |
FAQ
Esiste un'API AI completamente gratuita?
Sì. Al 29 luglio 2026, Google AI Studio, Groq, GitHub Models e Cloudflare Workers AI offrono accesso API funzionante senza un metodo di pagamento registrato. Ciascuno applica limiti giornalieri o al minuto. Il tier gratuito di Google utilizza inoltre i prompt per migliorare i suoi prodotti.
Quale API AI è gratuita senza carta di credito?
Tutti e nove i provider della tabella comparativa sopra rilasciano chiavi senza carta. A distinguerli sono la dimensione della quota e la policy sui dati: basti confrontare le 14.400 richieste/giorno di Groq con le 1.000 chiamate/mese di Cohere, oppure l'impegno di Cloudflare a non addestrare sui dati con la posizione opposta di Google.
Quale API GPT è gratuita?
L'API di OpenAI non ha un tier gratuito, ma i modelli open-weight gpt-oss di OpenAI sono gratuiti su tre piattaforme: Groq, con gpt-oss-120b a 1.000 richieste/giorno; Cloudflare Workers AI, entro i 10.000 Neurons giornalieri; e OpenRouter, con openai/gpt-oss-20b:free. GitHub Models espone inoltre modelli OpenAI GPT ospitati su Azure nel proprio tier gratuito, esclusi la serie o e la classe GPT-5.
Qual è il tier API AI gratuito più generoso?
Dipende dal criterio. Per numero assoluto di richieste, llama-3.1-8b-instant di Groq con 14.400 al giorno. Per volume di token, i 10.000 Neurons/giorno di Cloudflare. Per qualità dei modelli a $0, Google AI Studio con Gemini 2.5 Pro incluso, pur con la condizione dell'utilizzo dei dati per l'addestramento.
