AIREITER
openaiText Chat

GPT-6 Luna

Esegui GPT-6 Luna online e tramite API per riassunti, estrazione e classificazione al 30% delle tariffe ufficiali dei token di OpenAI. Contesto da 1M di token.

Token inputInputOutputLettura cacheCreazione cache
≤ 271,999$0.03 per 1 M di token$0.15 per 1 M di token$0.003 per 1 M di token$0.0375 per 1 M di token
> 271,999$0.06 per 1 M di token$0.225 per 1 M di token$0.006 per 1 M di token$0.075 per 1 M di token

Prezzi per milione di token. La fascia si applica all’intera richiesta in base ai token di input totali, incluse letture e scritture nella cache.

Esegui con API

INPUT

OUTPUT

Example
Generated in
10.6 seconds
Token input
494
Token output
204
Tokens per second
19.25 tokens / second
Time to first token
-

Dettagli del modello

Usa la stessa chiave del modello nel Playground, nelle richieste API e nei flussi di lavoro interni.

ID modello
gpt-6-luna
Provider
openai
Protocollo
OpenAI Chat Completions
Finestra di contesto
1,050,000 token
Output massimo
128,000 token

Cosa puoi fare con GPT-6 Luna

GPT-6 Luna è il modello veloce ed economico della famiglia GPT-6. Quattro sue caratteristiche cambiano il modo di progettare le soluzioni, e nessuna di queste è presente nei testi promozionali.

L'output costa 5 volte più dell'input

$0,03 per 1M di input contro $0,15 per 1M di output. I prompt lunghi sono quasi gratuiti; le risposte lunghe no. Limitare i token massimi di completamento incide sulla spesa molto più che accorciare il prompt.

Una finestra da 1M con una soglia critica a 272K

La finestra di contesto è di 1.050.000 token, ma il superamento di 272K token di input comporta il ricalcolo del prezzo dell'intera richiesta a 2x sull'input e 1,5x sull'output, non solo della parte eccedente. Un prompt da 280K token costa più di due da 140K.

Ragiona prima di rispondere

Nei nostri test, il primo token in streaming ha impiegato da 5,0 a 5,6 secondi su una risposta complessiva di 7,2 - 7,4 secondi. Lo streaming non nasconde questo intervallo. Se hai bisogno del testo a schermo più rapidamente, riduci il reasoning effort anziché il limite di output.

L'output strutturato regge senza uno schema

Avendo richiesto in semplice testo quattro campi specifici in formato JSON, ha restituito esattamente quelle quattro chiavi in un blocco delimitato, senza alcuno schema, senza definizione di funzioni e senza tentativi ripetuti. L'esempio sopra è la risposta non modificata.

Prezzi di GPT-6 Luna

AIReiter offre GPT-6 Luna al 30% delle tariffe API ufficiali di OpenAI. Tariffe verificate rispetto al listino prezzi di OpenAI il 23 settembre 2026; le tariffe live per token sono indicate sopra il playground.
01

Token di input

$0,03 per 1M di token, contro i $0,10 ufficiali di OpenAI.

02

Token di output

$0,15 per 1M di token, contro i $0,50 ufficiali di OpenAI.

03

Letture di input in cache

$0,003 per 1M di token, contro i $0,01 ufficiali di OpenAI.

04

Fascia di contesto esteso

Le richieste superiori a 272K token di input applicano il sovrapprezzo previsto da OpenAI: 2x sull'input e 1,5x sull'output.

Casi d'uso di GPT-6 Luna

Luna trova la sua collocazione ideale ovunque il costo per record rappresenti un vincolo. Le cifre seguenti provengono dal test misurato mostrato nel playground: 494 token di input e 204 di output per ticket.
01

Triage dell'assistenza a $0,05 per 1.000 ticket

Riepilogo, gravità, area di prodotto, versione interessata ed etichetta di priorità in una sola chiamata per ticket. Un backlog di 50.000 ticket viene rielaborato per circa $2,30.

02

Arricchimento batch con prefisso in cache

I processi batch ripetono le stesse istruzioni per ogni riga. Mantenendo quel prefisso identico a livello di byte, la parte ripetuta viene tariffata a $0,003 per 1M invece di $0,03: un decimo del costo di input sull'intera esecuzione.

03

Livello predefinito dietro un router

Invia tutto a Luna ed effettua l'escalation solo per ciò che non supera un controllo. Poiché Sol costa circa 20 volte di più, un router che mantiene il 95% del traffico su Luna costa circa un decimo di una pipeline basata esclusivamente su Sol: il 5% inoltrato costituisce metà della spesa rimanente.

04

Interi documenti sotto la soglia di 272K

Report, trascrizioni e contratti rientrano comodamente nella finestra da 1M, ma rimanere sotto i 272K token di input per richiesta evita il raddoppio del prezzo. Suddividere in blocchi al di sotto di tale soglia è generalmente più economico di una singola grande chiamata.

Come utilizzare GPT-6 Luna

Luna è un modello pensato per i volumi elevati, quindi testalo nello stesso modo in cui lo eseguirai: su un record reale, con le impostazioni sostenibili su larga scala.

01

Incolla un record reale

Usa un ticket, una trascrizione o un documento reale invece di un prompt di prova. La modalità di errore di Luna risiede nell'input disordinato, non nel ragionamento complesso.

02

Regola al ribasso, non al rialzo

Inizia con un livello di reasoning effort basso e un limite stringente di max completion tokens. L'output costa 5 volte l'input, quindi il limite di output è la leva che determina la tua spesa.

03

Moltiplica il conteggio dei token

Prendi l'utilizzo riportato sotto la risposta, moltiplicalo per il tuo volume giornaliero e otterrai il costo mensile prima ancora di scrivere una sola riga di codice di integrazione.

Sviluppa con l'API GPT-6 Luna

Ciò che conta in un'integrazione batch non è la prima chiamata, ma la decimillesima: costo per record, comportamento della cache e cosa succede quando una riga fallisce.

Model ID drop-in

Punta un client compatibile con OpenAI esistente su gpt-6-luna senza modificare nient'altro. Streaming, system prompt e output in formato JSON funzionano esattamente come upstream.

I prefissi in cache fanno la differenza

I job batch ripetono le stesse istruzioni per ogni riga. Le letture in cache costano 0,003 $ per 1M rispetto a 0,03 $ per i nuovi input, quindi vale la pena strutturare un prefisso di prompt stabile.

Rendicontazione dei costi per risposta

Ogni risposta riporta input, output, letture in cache e crediti consumati, consentendo a una pipeline di registrare l'unit economics per record invece di scoprirla solo in fattura.

Passa a GPT-6 Sol senza rifare l'infrastruttura

Sol e Luna condividono lo stesso endpoint, la stessa chiave e lo stesso saldo, quindi reindirizzare una riga complessa al livello flagship richiede solo la modifica del model-ID, non una seconda integrazione.

GPT-6 Luna vs GPT-6 Sol vs GPT-5.6 Luna

La stessa attività su ticket di supporto (riassunto più estrazione di quattro campi) misurata su AIReiter il 23 settembre 2026 con 494 token di input e 204 di output, completata in 10,6 secondi su Luna. I tier differiscono di circa un fattore venti nel prezzo, non nella capacità di svolgere questo compito.
01

GPT-6 Luna - circa 0,05 $ per 1.000 ticket

0,03 $ per l'input e 0,15 $ per l'output per 1M di token su AIReiter, a fronte dei prezzi ufficiali di OpenAI pari a 0,10 $ e 0,50 $. Il tier GPT-6 più economico, nonché quello che rende davvero sostenibili i calcoli dell'automazione per singolo record.

02

GPT-6 Sol - circa 0,91 $ per 1.000 ticket

0,60 $ per l'input e 3,00 $ per l'output per 1M di token, circa 20 volte Luna. Ne vale la pena quando un'attività richiede un ragionamento di livello flagship; sprecato quando l'attività è un'estrazione che Luna gestisce già correttamente.

03

GPT-5.6 Luna - la generazione precedente

Prezzo ufficiale di 0,20 $ per l'input e 1,20 $ per l'output per 1M di token. GPT-6 Luna dimezza il prezzo ufficiale di input e riduce l'output a meno della metà, nella stessa fascia ad alta efficienza di costo.

04

Come scegliere

Esegui il tuo record più complesso su entrambi i tier nel playground qui sopra. Se la risposta di Luna regge, il divario di 20 volte significa che Sol deve giustificare la differenza su quella specifica attività, piuttosto che per semplice reputazione.

FAQ su GPT-6 Luna

Domande frequenti sul playground online, sui prezzi e sull'accesso API.

/ 01

Quando dovrei scegliere GPT-6 Luna?

Scegli Luna per attività ad alto volume e ben definite come riassunti, estrazione e classificazione. Passa a GPT-6 Sol solo quando un'attività richiede capacità di ragionamento di punta.

/ 02

Quanto costa GPT-6 Luna su AIReiter?

AIReiter applica il 30% delle tariffe ufficiali di OpenAI: $0.03 per 1M di token di input e $0.15 per 1M di token di output, rispetto ai $0.10 e $0.50 ufficiali. Le letture di input in cache costano $0.003 per 1M.

/ 03

In cosa differisce GPT-6 Luna da GPT-5.6 Luna?

GPT-6 Luna è la generazione più recente, con la metà del prezzo ufficiale di input e un quinto del prezzo ufficiale di output rispetto a GPT-5.6 Luna, all'interno della stessa fascia ad alta convenienza economica.

/ 04

Qual è la finestra di contesto?

GPT-6 Luna supporta circa 1M di token di input e fino a 128K token di output. Le richieste superiori a 272K token di input vengono fatturate a 2x per l'input e 1.5x per l'output, in conformità con la policy di OpenAI.

/ 05

Quanto è veloce GPT-6 Luna?

Su AIReiter, una richiesta di riassunto ed estrazione su un ticket di assistenza da 494 token ha restituito 204 token di output in 10,6 secondi senza streaming e da 7,2 a 7,4 secondi end-to-end con streaming. Nota che Luna ragiona prima di rispondere: il primo token trasmesso in streaming ha richiesto tra 5,0 e 5,6 secondi nei vari test, quindi la maggior parte dell'attesa avviene prima che appaia qualsiasi testo. Riduci il reasoning effort se hai bisogno che la risposta inizi prima.

/ 06

Quanto costa GPT-6 Luna per 1.000 record?

Utilizzando la stessa richiesta misurata (494 token di input e 204 di output), circa $0.05 per 1.000 ticket con le tariffe di AIReiter. Lo stesso carico di lavoro su GPT-6 Sol costa circa $0.91 per 1.000.

/ 07

Posso chiamare GPT-6 Luna tramite un'API?

Sì. Segui la documentazione API collegata e utilizza l'ID modello gpt-6-luna con l'endpoint compatibile con OpenAI.