AIREITER
DOC APIPREZZI
TEMPLATE
  • AIReiter
  • Blog
  • Confronto API LLM gratuite: quote di 11 provider (2026)

Confronto API LLM gratuite: quote di 11 provider (2026)

Ultimo Aggiornamento: 2026-09-08 08:39:06

Panoramica: API LLM gratuite a confronto

Questa fotografia è stata verificata l'8 settembre 2026. I limiti possono cambiare in base a modello, account, area geografica e domanda: per il dato definitivo, fai sempre riferimento alla documentazione collegata dal provider.

Le indicazioni su carta, uso commerciale e compatibilità OpenAI sono state ulteriormente verificate tramite il confronto di Free LLM API Hub.

ProviderAccesso gratuito e quota pubblicataCondizioni per carta/pagamentoFormato APIIndicazioni sui terminiLimite principale
Google AI StudioI modelli Gemini variano: 5–30 RPM e 15–1.000 RPD; esempio Gemini 2.5 Flash: 10 RPM / 250 RPDNessuna carta indicata; possono essere richieste verifiche di account e progettoCompatibile con OpenAI nel confronto verificatoUso commerciale indicato come consentito; conferma i termini attualiGoogle invita a verificare i limiti attivi in AI Studio
GroqEsempio rappresentativo qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPDIl Free Plan non richiede l'upgrade a pagamento; il tier Developer richiede un metodo di pagamentoSì, in gran parteUso commerciale indicato come consentito; i limiti del Free Plan differiscono dalla capacità a pagamentoI limiti si applicano a livello di organizzazione e modello
OpenRouterVarianti gratuite: 20 RPM / 50 RPD con meno di $10 di crediti acquistati; 1.000 RPD dopo aver acquistato almeno $10Il percorso free di base non richiede carta; i crediti sbloccano un limite superioreSì, normalizzato sull'OpenAI Chat APIUso commerciale indicato come consentito; la disponibilità dei modelli gratuiti cambiaLa quota giornaliera più alta dipende da un acquisto
Cloudflare Workers AI10.000 Neuron/giorno, condivisi dall'intero account; reset alle 00:00 UTCL'allocazione di base è gratuita; alcuni modelli richiedono fatturazione a pagamentoCompatibile con OpenAI nel confronto verificatoUso commerciale indicato come consentito; l'idoneità varia per modelloI Neuron misurano il calcolo, non una quota fissa di token
Cerebras InferenceFree Trial: 5 RPM / 30K TPM senza cache / 90K TPM totali / 1M TPD per i modelli elencatiMetodo di pagamento verificato obbligatorioNon definito nella documentazione citataAccesso di prova; i crediti scadono dopo 30 giorniIl credito di prova da $5 non è permanente
SambaNova CloudFree Tier: 20 RPM / 20 RPD / 200.000 TPD per i modelli elencatiNessun metodo di pagamento nel Free Tier; collegarne uno attiva il Developer Tier a pagamentoSì, con differenze documentateUso commerciale indicato come consentito; controlla i termini dei modelliIl limite di 20 RPD è restrittivo
Cohere1.000 chiamate/mese; Chat 20 RPM, Embed 2.000 input/min, Rerank 10 RPMNessuna carta indicata nel confronto verificato; conferma in fase di registrazioneCompatibile con OpenAI nel confronto verificatoSolo valutazione nel confronto verificatoLe chiamate non sono intercambiabili con i token
Z.AIGLM-4.7-Flash e GLM-4.5-Flash sono indicati a $0 per le categorie di token mostrate; RPM/TPM pubblici non specificatiNessuna carta indicata nel confronto verificatoCompatibile con OpenAI nel confronto verificatoUso commerciale indicato come consentito; verifica i termini del modello$0 per token non indica la capacità disponibile
NVIDIA NIMFree Inference Endpoints per la prototipazione; nessuna quota universale nella landing pageLe condizioni di pagamento variano per endpoint; verifica la pagina del modelloNon definito nella documentazione citataIndicazione di prototipo/valutazione nella pagina citataLa dicitura gratuita in landing page non equivale a una quota pubblicata
Hugging Face Inference ProvidersGli utenti Free ricevono $0.10/mese in crediti, soggetti a modifiche; nessun RPM/TPM pubblicatoLa documentazione ufficiale sui prezzi non indica condizioni sulla cartaCompatibile con OpenAI nel confronto verificatoVerifica i termini del provider e del modelloÈ un piccolo credito, non una quota di richieste
Mistral StudioFree mode di Studio; nessuna quota pubblica nella home della documentazioneLa home non indica condizioni sulla cartaÈ documentato un endpoint in stile OpenAI; non viene dichiarata parità completaIndicazione di prova/esplorazione o valutazione; verifica i terminiLa modalità gratuita non dimostra accesso illimitato o pronto per la produzione

Non ordinare le righe in base al numero più alto. Richieste, token, chiamate, dollari e Neuron sono unità diverse; una prova in scadenza non è un'allocazione che si rinnova.

Per immagini, voce, embedding e altre modalità, consulta il più ampio confronto sulle API AI gratuite. Questa pagina resta focalizzata sull'inferenza LLM ospitata.

I provider con accesso ricorrente o senza carta più chiaro

Google AI Studio: il punto di partenza più pratico per uso generale

La documentazione ufficiale sui limiti di frequenza di Google spiega che le quote Gemini dipendono da modello e progetto. Indica RPM, TPM in input e RPD come dimensioni comuni, precisa che le quote si applicano al progetto Google Cloud e non a ogni API key, e rimanda ad AI Studio per i valori attivi. Le quote giornaliere di richieste si azzerano a mezzanotte, ora del Pacifico.

Un confronto secondario verificato riporta 10 RPM e 250 RPD per Gemini 2.5 Flash, con valori tra 5–30 RPM e 15–1.000 RPD sui vari modelli. Considerali valori utili per pianificare, perché Google specifica che i limiti attivi variano e non sono garantiti.

Gemini è adatto a prototipi generici e multimodali; i limiti giornalieri specifici del modello possono però frenare i carichi con molte richieste.

Groq: l'opzione senza carta più solida per quota di richieste pubblicata

La documentazione sui limiti di Groq elenca le soglie per modello e organizzazione. La riga attuale del Free Plan per qwen/qwen3.6-27b riporta 30 RPM, 1.000 RPD, 8.000 TPM e 200.000 TPD. Gli altri modelli hanno limiti giornalieri e di token differenti.

“I limiti di frequenza si applicano a livello di organizzazione, non ai singoli utenti.” — documentazione sui limiti di Groq

Usare più API key non crea automaticamente capacità indipendente per l'intera organizzazione. La documentazione Groq descrive gli header retry-after e x-ratelimit-* per gestire le risposte HTTP 429.

Groq è il punto di partenza più chiaro per molte piccole richieste, se il modello scelto supporta il tuo caso d'uso. Controlla la riga del modello specifico invece di considerare il provider come se avesse un'unica quota.

OpenRouter: il gateway più flessibile per modelli gratuiti

OpenRouter offre un'unica superficie API per una selezione variabile di modelli gratuiti. Il confronto attuale sull'accesso gratuito riporta 20 richieste al minuto e 50 richieste al giorno finché l'account ha acquistato meno di $10 in crediti. Dopo almeno $10 di crediti acquistati complessivamente, la quota giornaliera sale a 1.000 richieste. Il limite superiore richiede quindi un acquisto.

La documentazione ufficiale sui limiti chiarisce che account o API key aggiuntivi non modificano i limiti globali della piattaforma. Il servizio espone le informazioni di quota tramite l'endpoint delle chiavi e gli header degli errori di rate limit.

Puoi fissare un modello con il suffisso :free oppure usare openrouter/free, che seleziona automaticamente un modello gratuito disponibile. Il router può filtrare funzionalità come tool calling o comprensione delle immagini, ma il modello sottostante può cambiare.

Usa OpenRouter per esperimenti e routing di fallback, non per un'applicazione che dipende da un comportamento stabile di un singolo modello gratuito.

Cloudflare Workers AI: calcolo ricorrente, non token gratuiti

La pagina ufficiale dei prezzi di Cloudflare assegna a ogni account un totale di 10.000 Neuron al giorno senza costi. L'allocazione è condivisa da tutta l'attività Workers AI e si azzera alle 00:00 UTC. Nel piano Workers Free, le operazioni successive falliscono una volta esaurita l'allocazione.

Un Neuron rappresenta il calcolo GPU necessario per una richiesta. Cloudflare pubblica equivalenze di token specifiche per modello, invece di promettere che 10.000 Neuron corrispondano a un numero fisso di prompt.

Cloudflare specifica inoltre che alcuni modelli più recenti DeepSeek, GLM e Kimi richiedono un metodo di fatturazione a pagamento. “10.000 Neuron gratis” non significa che ogni modello sia disponibile senza fatturazione.

Accesso gratuito, ma con una condizione

Cerebras: una prova utile, non un'API gratuita permanente

La documentazione Cerebras sui limiti di frequenza elenca 5 RPM, 30.000 TPM senza cache, 90.000 TPM totali e 1 milione di TPD per i modelli del Free Trial. Spiega inoltre che il suo token bucket si ricarica continuamente, anziché attendere un semplice reset giornaliero.

I nuovi account ricevono $5 in crediti gratuiti, che scadono dopo 30 giorni, e per attivare Playground e accesso API è richiesto un metodo di pagamento verificato. Alla scadenza o all'esaurimento del credito, l'accesso si interrompe salvo l'acquisto di altri crediti. La documentazione verificata non descrive un'allocazione gratuita pubblica che si rinnovi in modo permanente.

Cerebras funziona bene per una valutazione breve. Non dovrebbe essere l'unica dipendenza di un progetto che deve continuare a funzionare dopo la prova.

SambaNova Cloud: la separazione più netta in base allo stato di fatturazione

SambaNova definisce il proprio Free Tier in base allo stato della fatturazione: si applica quando non è collegato alcun metodo di pagamento. Per i modelli elencati nel Free Tier, la documentazione ufficiale mostra 20 RPM, 20 RPD e 200.000 TPD. Il limite di 20 RPD può bloccare un flusso di lavoro con polling intenso prima di esaurire la quota di token.

Collegare un metodo di pagamento attiva il Developer Tier, che è a pagamento e non va considerato gratuito. SambaNova espone inoltre, tramite gli header di risposta, le informazioni sulle richieste residue e sul reset.

Usa SambaNova solo per proof of concept a basso volume: il tetto di 20 RPD va verificato prima di adottarlo in qualsiasi workflow agentico.

Cohere: utile per RAG, ma le chiamate vanno contate con attenzione

La trial key di Cohere è diversa da un tier gratuito basato sui token. Il confronto verificato attuale riporta 1.000 chiamate al mese, con limiti specifici per endpoint di 20 RPM per Chat, 2.000 input al minuto per Embed e 10 RPM per Rerank. Le FAQ di Cohere descrivono le trial key come gratuite ma limitate.

Questa combinazione rende Cohere utile per esperimenti di retrieval-augmented generation: un singolo progetto può testare generazione, embedding e reranking. Non trasforma però la prova in un backend chat ad alto volume. Non confrontare direttamente 1.000 chiamate/mese con 1 milione di token/giorno.

Il confronto verificato classifica la prova come destinata esclusivamente alla valutazione. Prima di usarla in un'applicazione pubblica o commerciale, conferma la policy d'uso vigente.

Z.AI: prezzo gratuito non significa quota nota

La documentazione sui prezzi di Z.AI indica GLM-4.7-Flash e GLM-4.5-Flash come gratuiti per le categorie di token visualizzate. La pagina pubblica sui prezzi verificata non fornisce valori concreti di RPM, RPD, TPM o TPD.

Considera quindi la quota di Z.AI sconosciuta: può andare bene per test manuali, non per elaborazioni batch; verifica endpoint, disponibilità del modello e termini al momento della registrazione.

NVIDIA, Hugging Face e Mistral: percorsi di scoperta con dati di quota incompleti

ProviderSegnale di accesso gratuitoQuota pubblica mancanteUso pratico
NVIDIA NIMFree Inference Endpoints per la prototipazioneNessun RPM universale, quota token, regola sulla carta o prezzo per eccedenze nella landing pageProva un endpoint selezionato, poi leggi i termini specifici del modello
Hugging Face Inference Providers$0.10/mese in crediti per gli utenti Free, soggetti a modificheNessuna quota RPM o TPM comparabilePiccoli esperimenti con modelli instradati senza gestire infrastruttura GPU
Mistral StudioFree mode di Studio e quickstart APINessuna quota o regola sulla carta nella home della documentazioneProva le funzionalità dell'API Mistral prima di passare a una configurazione a pagamento

Quale API LLM gratuita scegliere?

La tua prioritàMiglior punto di partenzaPerché
Prototipo per uso generaleGoogle AI StudioGemini offre una base chiara per uso generale; i limiti attivi sono visibili in AI Studio
Molte piccole richiesteGroqRighe del Free Plan pubblicate per modello e un esempio da 1.000 RPD
Molti modelli attraverso una sola APIOpenRouterVarianti gratuite, routing e interfaccia in stile OpenAI
Applicazione nativa CloudflareWorkers AIAllocazione ricorrente di 10.000 Neuron/giorno
La maggiore quota token dichiarata per una provaCerebrasFino a 1M TPD, ma solo in una prova di 30 giorni con carta obbligatoria
Configurazione rigorosamente senza metodo di pagamentoPrima Groq; SambaNova per volumi molto ridottiIl Free Tier di SambaNova ha un tetto di 20 RPD
Componenti RAGCohereChat, Embed e Rerank condividono lo stesso ecosistema di trial key
Test di GLM FlashZ.AIIl prezzo token visualizzato è $0, ma la quota pubblica è sconosciuta
Esplorazione di modelli aperti senza GPUHugging FaceAccesso instradato più $0.10/mese per gli utenti Free

Parti da un provider e registra quattro campi per ogni richiesta: ID del modello, stato HTTP, utilizzo dei token e header dei limiti residui. Aggiungi un secondo provider solo dopo aver capito quale soglia raggiunge il primo percorso; più chiavi non creano necessariamente più capacità.

Come verificare un'API LLM gratuita prima di usarla

Prima del lancio, verifica cinque aspetti:

  1. Unità di quota: L'offerta è misurata in richieste, token, chiamate, dollari o unità di calcolo?
  2. Modalità di reset: Si azzera a un confine UTC o dell'ora del Pacifico, si ricarica continuamente, si rinnova ogni mese oppure scade una sola volta?
  3. Ambito: Il limite è associato a modello, progetto, account o organizzazione?
  4. Condizione di pagamento: Aggiungere una carta sblocca più capacità, attiva un tier a pagamento oppure diventa obbligatorio per la prova?
  5. Termini e gestione degli errori: L'offerta è limitata a test o valutazione e il client gestisce HTTP 429 senza generare una tempesta di retry?

FAQ sulle API LLM gratuite

Qual è la migliore API LLM gratuita in assoluto?

Google AI Studio è adatto ai prototipi generici; Groq a un volume più alto di richieste gratuite; OpenRouter alla varietà di modelli.

Posso usare un'API LLM gratuita senza carta di credito?

Sì. Nel confronto verificato Google, Groq, il percorso base di OpenRouter, l'allocazione di base di Cloudflare e il Free Tier di SambaNova sono indicati come opzioni senza carta. Cerebras richiede un metodo di pagamento verificato per il suo Free Trial.

Le API LLM gratuite sono davvero permanenti?

Alcuni tier ricorrenti restano disponibili finché ne durano i termini, ma prove, prezzi promozionali e percorsi :free a rotazione non sono allocazioni permanenti valide per l'intero provider. Prima di dipendere da un solo servizio, controlla documentazione e stato attuale del modello.

Posso usare un'API LLM gratuita in produzione?

Non usarla come unico backend a meno che termini attuali, quota e disponibilità del modello soddisfino i requisiti della tua produzione.

Cosa succede quando raggiungo il limite gratuito?

I provider restituiscono normalmente un errore di throttling o di quota. Groq documenta la gestione di HTTP 429, Cloudflare indica che le operazioni successive falliscono dopo l'esaurimento dell'allocazione giornaliera del piano Free e Cerebras interrompe l'accesso di prova quando il credito scade o si esaurisce.

>_Directory modelli AIReiter

Accesso API rapido ai modelli collegati a questa guida

Gemini 3.6 Flash

Chat

Un modello Gemini veloce per ragionamento avanzato, coding e attività agentiche.

GoogleCrea API Key >

Gemini 2.5 Pro

Chat
GoogleCrea API Key >

Claude Fable 5

Chat

Un modello Claude premium per il ragionamento profondo e il lavoro complesso su contenuti lunghi.

AnthropicCrea API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCrea API Key >

Claude Opus 4.8

Chat

Un modello Claude ad alte prestazioni per ragionamenti impegnativi e lavoro professionale.

AnthropicCrea API Key >

Post recenti

Come usare DeepSeek su Janitor AI (configurazione 2026)

2026-09-08

Prezzi API Muse Spark 1.3: Standard vs Contributor

2026-09-08

Recensione dell’API GPT-6 Astra (2026): pensata per gli agenti, non per il semplice drop-in

2026-09-07

Kling API: guida all'integrazione ufficiale e tramite aggregatori (2026)

2026-09-07
AIREITER

Domande? Contattaci a
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Immagine IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Vedi Tutto →

Azienda

Informativa sulla privacyTermini di servizioPolitica di rimborso

© 2026 AIReiter. Tutti i diritti riservati.