Il prezzo di Qwen3.8-Omni-Flash cambia in base alla modalità dell’input e al tipo di output. Le tariffe riportate qui provengono dal listino internazionale/Singapore pubblicato da Alibaba Cloud, dove l’audio in ingresso costa quasi nove volte più del testo.
Il listino in una sola tabella
La documentazione di Alibaba Cloud dedicata a modelli e prezzi è il riferimento ufficiale per le tariffe dei singoli endpoint. Nel listino internazionale, Qwen3.8-Omni-Flash non ha un unico prezzo per token: testo, audio, immagini/video e output vengono conteggiati separatamente.
| Voce di fatturazione | Prezzo Singapore/internazionale per 1 milione di token |
|---|---|
| Testo in ingresso | $0.43 |
| Audio in ingresso | $3.81 |
| Immagini o video in ingresso | $0.78 |
| Testo in uscita con input solo testuale | $1.66 |
| Testo in uscita dopo un input multimodale | $3.06 |
I dati provengono dalla documentazione ufficiale sui prezzi di Alibaba Cloud Model Studio. Prima di preparare il budget, verifica nella console che ID modello e regione coincidano: un altro modello Qwen o un’altra modalità di deployment possono avere una tariffa diversa.
Qwen3.8-Omni-Flash non è Qwen3.8-Flash
Nei risultati di ricerca compaiono tre nomi molto simili, ma tariffe e funzionalità non sono intercambiabili. Prima di usare un valore preso da una tabella prezzi, controlla sempre l’ID completo del modello.
| Nome | Come considerarlo | Conseguenza sul prezzo |
|---|---|---|
| Qwen3.8-Omni-Flash | Il modello analizzato in questo articolo | Applica tariffe separate per testo, audio, immagini/video e output |
| Qwen3-Omni-Flash | Una generazione differente | Non riutilizzare il suo listino |
| Qwen3.8-Flash | Una linea Flash distinta | Il prezzo dei token testuali non corrisponde a quello di Omni |
L’annuncio di lancio di Qwen identifica Qwen3.8-Omni-Flash come un modello nativamente multimodale. Per gli acquisti e le decisioni di deployment, però, è la documentazione dell’endpoint a fare fede per limiti e funzionalità supportate.
Come stimare il costo di una richiesta multimediale
Per ottenere una stima utile bisogna applicare una tariffa distinta a ogni categoria conteggiata. Immaginiamo una richiesta Singapore con 100.000 token testuali in ingresso, 20.000 token audio in ingresso e 10.000 token in uscita dopo aver ricevuto un input multimodale.
- Testo in ingresso: 0.1 x $0.43 = $0.043.
- Audio in ingresso: 0.02 x $3.81 = $0.0762.
- Output di una richiesta multimodale: 0.01 x $3.06 = $0.0306.
- Totale stimato: $0.1498, prima di imposte o rettifiche specifiche dell’account.
L’audio in ingresso costa circa 8.9 volte la tariffa del testo ($3.81 / $0.43). Una stima basata solo sul testo sottovaluta quindi un carico di lavoro incentrato sulla voce, anche quando l’output è breve.
Le voci che possono far cambiare il totale
Il prezzo dell’API Qwen3.8-Omni-Flash non dipende soltanto dal numero complessivo di token. A determinare la riga corretta del listino sono anche il tipo di input e la presenza di contenuti multimodali.
L’audio va stimato separatamente
L’audio ha la tariffa di input più alta tra quelle pubblicate. In un flusso per analizzare riunioni o telefonate, registra separatamente i token audio e quelli del prompt testuale: non moltiplicare tutto l’input per $0.43/M.
L’input multimodale aumenta il costo dell’output
Il testo in uscita costa $1.66/M dopo un input solo testuale e $3.06/M dopo un input con immagini, audio o video. Un budget che considera soltanto l’input ignora questo aumento dell’84% della tariffa di output.
La regione fa parte del modello dei costi
Alibaba Cloud indica informazioni di deployment specifiche per regione, quindi il foglio dei costi dovrebbe riportare la regione accanto all’ID completo del modello. Considera le cifre Singapore riportate sopra come tariffe Singapore, non come un prezzo universale di Qwen.
Il prezzo pubblico non coincide necessariamente con la fattura finale
Imposte, crediti, promozioni e condizioni dell’account possono modificare l’importo addebitato. Il listino pubblico citato fornisce le tariffe base per token; per sconti o quote gratuite, controlla il pannello dell’account invece di dare per scontato che siano applicabili.
Prima della produzione controlla quattro elementi
Qwen3.8-Omni-Flash merita una valutazione quando il carico di lavoro richiede di comprendere insieme testo, audio, immagini o video. Prima di affidargli richieste reali, fissa questi quattro elementi per evitare che un modello o un endpoint errato renda inutilizzabile la stima:
- L’ID completo del modello, inclusi generazione e punteggiatura.
- La regione e l’endpoint associati alla chiave API.
- I limiti di contesto, output, velocità delle richieste e supporto agli strumenti indicati per quell’endpoint.
- I crediti attivi dell’account, le promozioni e le relative date di scadenza.
Esegui una richiesta rappresentativa e usa i dati di utilizzo restituiti o le metriche della console per registrare separatamente token testuali, audio, immagini/video e output. Applicare il listino ai consumi osservati è più affidabile che convertire i minuti di contenuti multimediali in token basandosi su un’ipotesi non documentata.
FAQ sull’API Qwen3.8-Omni-Flash
Quanto costa l’API Qwen3.8-Omni-Flash?
Per Singapore, il listino ufficiale indica $0.43/M per il testo in ingresso, $3.81/M per l’audio in ingresso, $0.78/M per immagini/video in ingresso e $1.66/M o $3.06/M per il testo in uscita, a seconda che l’input sia solo testuale o multimodale.
Qwen3.8-Omni-Flash è lo stesso modello di Qwen3-Omni-Flash o Qwen3.8-Flash?
No. Sono linee di modelli o generazioni distinte. Controlla l’ID completo del modello prima di applicare una tariffa del listino.
Come viene fatturato l’audio?
Nel listino Singapore citato, l’audio in ingresso viene fatturato a token, al prezzo di $3.81/M. Non è indicato come tariffa fissa al minuto.
L’input con immagini o video modifica il prezzo dell’output?
Sì. La tariffa indicata per l’output passa da $1.66/M con input solo testuale a $3.06/M quando la richiesta include immagini, audio o video.
La scelta pratica
Usa Qwen3.8-Omni-Flash quando la comprensione multimodale giustifica le tariffe più alte per audio e output multimodale. Testa un carico di lavoro rappresentativo, analizza i consumi per modalità e confronta il costo per attività completata, invece di guardare soltanto il prezzo del testo in ingresso.