Cosa puoi fare con GPT-6 Luna
GPT-6 Luna è il modello veloce ed economico della famiglia GPT-6. Quattro sue caratteristiche cambiano il modo di progettare le soluzioni, e nessuna di queste è presente nei testi promozionali.
L'output costa 5 volte più dell'input
$0,03 per 1M di input contro $0,15 per 1M di output. I prompt lunghi sono quasi gratuiti; le risposte lunghe no. Limitare i token massimi di completamento incide sulla spesa molto più che accorciare il prompt.
Una finestra da 1M con una soglia critica a 272K
La finestra di contesto è di 1.050.000 token, ma il superamento di 272K token di input comporta il ricalcolo del prezzo dell'intera richiesta a 2x sull'input e 1,5x sull'output, non solo della parte eccedente. Un prompt da 280K token costa più di due da 140K.
Ragiona prima di rispondere
Nei nostri test, il primo token in streaming ha impiegato da 5,0 a 5,6 secondi su una risposta complessiva di 7,2 - 7,4 secondi. Lo streaming non nasconde questo intervallo. Se hai bisogno del testo a schermo più rapidamente, riduci il reasoning effort anziché il limite di output.
L'output strutturato regge senza uno schema
Avendo richiesto in semplice testo quattro campi specifici in formato JSON, ha restituito esattamente quelle quattro chiavi in un blocco delimitato, senza alcuno schema, senza definizione di funzioni e senza tentativi ripetuti. L'esempio sopra è la risposta non modificata.
Prezzi di GPT-6 Luna
Token di input
$0,03 per 1M di token, contro i $0,10 ufficiali di OpenAI.
Token di output
$0,15 per 1M di token, contro i $0,50 ufficiali di OpenAI.
Letture di input in cache
$0,003 per 1M di token, contro i $0,01 ufficiali di OpenAI.
Fascia di contesto esteso
Le richieste superiori a 272K token di input applicano il sovrapprezzo previsto da OpenAI: 2x sull'input e 1,5x sull'output.
Casi d'uso di GPT-6 Luna
Triage dell'assistenza a $0,05 per 1.000 ticket
Riepilogo, gravità, area di prodotto, versione interessata ed etichetta di priorità in una sola chiamata per ticket. Un backlog di 50.000 ticket viene rielaborato per circa $2,30.
Arricchimento batch con prefisso in cache
I processi batch ripetono le stesse istruzioni per ogni riga. Mantenendo quel prefisso identico a livello di byte, la parte ripetuta viene tariffata a $0,003 per 1M invece di $0,03: un decimo del costo di input sull'intera esecuzione.
Livello predefinito dietro un router
Invia tutto a Luna ed effettua l'escalation solo per ciò che non supera un controllo. Poiché Sol costa circa 20 volte di più, un router che mantiene il 95% del traffico su Luna costa circa un decimo di una pipeline basata esclusivamente su Sol: il 5% inoltrato costituisce metà della spesa rimanente.
Interi documenti sotto la soglia di 272K
Report, trascrizioni e contratti rientrano comodamente nella finestra da 1M, ma rimanere sotto i 272K token di input per richiesta evita il raddoppio del prezzo. Suddividere in blocchi al di sotto di tale soglia è generalmente più economico di una singola grande chiamata.
Come utilizzare GPT-6 Luna
Luna è un modello pensato per i volumi elevati, quindi testalo nello stesso modo in cui lo eseguirai: su un record reale, con le impostazioni sostenibili su larga scala.
Incolla un record reale
Usa un ticket, una trascrizione o un documento reale invece di un prompt di prova. La modalità di errore di Luna risiede nell'input disordinato, non nel ragionamento complesso.
Regola al ribasso, non al rialzo
Inizia con un livello di reasoning effort basso e un limite stringente di max completion tokens. L'output costa 5 volte l'input, quindi il limite di output è la leva che determina la tua spesa.
Moltiplica il conteggio dei token
Prendi l'utilizzo riportato sotto la risposta, moltiplicalo per il tuo volume giornaliero e otterrai il costo mensile prima ancora di scrivere una sola riga di codice di integrazione.
Sviluppa con l'API GPT-6 Luna
Ciò che conta in un'integrazione batch non è la prima chiamata, ma la decimillesima: costo per record, comportamento della cache e cosa succede quando una riga fallisce.
Model ID drop-in
Punta un client compatibile con OpenAI esistente su gpt-6-luna senza modificare nient'altro. Streaming, system prompt e output in formato JSON funzionano esattamente come upstream.
I prefissi in cache fanno la differenza
I job batch ripetono le stesse istruzioni per ogni riga. Le letture in cache costano 0,003 $ per 1M rispetto a 0,03 $ per i nuovi input, quindi vale la pena strutturare un prefisso di prompt stabile.
Rendicontazione dei costi per risposta
Ogni risposta riporta input, output, letture in cache e crediti consumati, consentendo a una pipeline di registrare l'unit economics per record invece di scoprirla solo in fattura.
Passa a GPT-6 Sol senza rifare l'infrastruttura
Sol e Luna condividono lo stesso endpoint, la stessa chiave e lo stesso saldo, quindi reindirizzare una riga complessa al livello flagship richiede solo la modifica del model-ID, non una seconda integrazione.
GPT-6 Luna vs GPT-6 Sol vs GPT-5.6 Luna
GPT-6 Luna - circa 0,05 $ per 1.000 ticket
0,03 $ per l'input e 0,15 $ per l'output per 1M di token su AIReiter, a fronte dei prezzi ufficiali di OpenAI pari a 0,10 $ e 0,50 $. Il tier GPT-6 più economico, nonché quello che rende davvero sostenibili i calcoli dell'automazione per singolo record.
GPT-6 Sol - circa 0,91 $ per 1.000 ticket
0,60 $ per l'input e 3,00 $ per l'output per 1M di token, circa 20 volte Luna. Ne vale la pena quando un'attività richiede un ragionamento di livello flagship; sprecato quando l'attività è un'estrazione che Luna gestisce già correttamente.
GPT-5.6 Luna - la generazione precedente
Prezzo ufficiale di 0,20 $ per l'input e 1,20 $ per l'output per 1M di token. GPT-6 Luna dimezza il prezzo ufficiale di input e riduce l'output a meno della metà, nella stessa fascia ad alta efficienza di costo.
Come scegliere
Esegui il tuo record più complesso su entrambi i tier nel playground qui sopra. Se la risposta di Luna regge, il divario di 20 volte significa che Sol deve giustificare la differenza su quella specifica attività, piuttosto che per semplice reputazione.
FAQ su GPT-6 Luna
Domande frequenti sul playground online, sui prezzi e sull'accesso API.
/ 01Quando dovrei scegliere GPT-6 Luna?
Scegli Luna per attività ad alto volume e ben definite come riassunti, estrazione e classificazione. Passa a GPT-6 Sol solo quando un'attività richiede capacità di ragionamento di punta.
/ 02Quanto costa GPT-6 Luna su AIReiter?
AIReiter applica il 30% delle tariffe ufficiali di OpenAI: $0.03 per 1M di token di input e $0.15 per 1M di token di output, rispetto ai $0.10 e $0.50 ufficiali. Le letture di input in cache costano $0.003 per 1M.
/ 03In cosa differisce GPT-6 Luna da GPT-5.6 Luna?
GPT-6 Luna è la generazione più recente, con la metà del prezzo ufficiale di input e un quinto del prezzo ufficiale di output rispetto a GPT-5.6 Luna, all'interno della stessa fascia ad alta convenienza economica.
/ 04Qual è la finestra di contesto?
GPT-6 Luna supporta circa 1M di token di input e fino a 128K token di output. Le richieste superiori a 272K token di input vengono fatturate a 2x per l'input e 1.5x per l'output, in conformità con la policy di OpenAI.
/ 05Quanto è veloce GPT-6 Luna?
Su AIReiter, una richiesta di riassunto ed estrazione su un ticket di assistenza da 494 token ha restituito 204 token di output in 10,6 secondi senza streaming e da 7,2 a 7,4 secondi end-to-end con streaming. Nota che Luna ragiona prima di rispondere: il primo token trasmesso in streaming ha richiesto tra 5,0 e 5,6 secondi nei vari test, quindi la maggior parte dell'attesa avviene prima che appaia qualsiasi testo. Riduci il reasoning effort se hai bisogno che la risposta inizi prima.
/ 06Quanto costa GPT-6 Luna per 1.000 record?
Utilizzando la stessa richiesta misurata (494 token di input e 204 di output), circa $0.05 per 1.000 ticket con le tariffe di AIReiter. Lo stesso carico di lavoro su GPT-6 Sol costa circa $0.91 per 1.000.
/ 07Posso chiamare GPT-6 Luna tramite un'API?
Sì. Segui la documentazione API collegata e utilizza l'ID modello gpt-6-luna con l'endpoint compatibile con OpenAI.