Un modello Qwen veloce per coding e task lunghi
Qwen3.8 Flash è la versione ad alta velocità di Qwen3.8 sviluppata da Alibaba. È progettato per coding, agenti basati su tool e documenti che non rientrano in una chat breve.
Grande modello, costo ridotto
125 miliardi di parametri totali, con circa 6 miliardi utilizzati per ogni token. Ecco perché rimane veloce ed economico per carichi di lavoro ad alto volume.
1 milione di token di contesto
Includi una specifica dettagliata, una serie di file o una lunga traccia dell'agente in una sola richiesta. Una singola risposta può arrivare fino a 131.072 token.
Legge sia immagini che testo
Il modello comprende screenshot, grafici e documenti, non solo testo semplice. Usalo quando l'attività parte da un elemento visualizzato sullo schermo.
Circa $0.057 / $0.193
Per milione di token, l'input costa circa $0.057 e l'output circa $0.193, all'incirca la metà del listino ufficiale. L'input memorizzato nella cache costa meno. La barra dei prezzi in alto mostra la tariffa in tempo reale.
I punti di forza di Qwen3.8 Flash
La model card ufficiale di Qwen, pubblicata con la release di agosto 2026, assegna a Flash i punteggi più alti nel coding e nell'uso di tool tra i modelli messi a confronto.
Lavoro su repository
SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Usalo per trovare bug, modificare più file e verificare il risultato.
Agenti che richiamano tool
DeepSWE 58.7. Toolathlon 73.5. Gestisce cicli multi-step: analizza l'errore, richiama un tool e riprova.
Codice e quesiti complessi
LiveCodeBench v6 a 91.9. GPQA Diamond a 91.7. Programmazione competitiva e quesiti scientifici alla sua portata.
Analisi visiva dello schermo
Punteggio parziale OSWorld 52.3. MathVision 90.6, o 95.7 quando può eseguire codice. Screenshot e grafici possono essere inviati insieme alla domanda.
Flash o Max
Scegli Flash
Agenti di coding, cicli di test-and-fix, documenti lunghi e qualsiasi carico di lavoro in cui il budget è una priorità. La finestra da 1M copre una lunga traccia senza doverla suddividere.
Scegli Max
Qwen3.8 Max è il modello di punta da 2,4 trilioni. Usalo quando desideri il modello Qwen più potente e il prezzo per token è secondario. Provalo su /chat/qwen3-8-max.
Stessa struttura di richiesta
Entrambi i modelli accettano una normale chat completion. Per Flash, imposta il modello su qwen3.8-flash. Aumenta i max token quando la risposta richiede una traccia lunga. Il valore predefinito è 8.192 e il limite massimo è 131.072.
Domande
Contesto, prezzo, immagini e confronto con Max.
/ 01A cosa serve Qwen3.8 Flash?
Coding rapido, agenti con uso di strumenti e documenti lunghi. È la versione di Qwen3.8 più economica e veloce, non una copia ridotta di Max.
/ 02Quanto è lungo il contesto?
1 milione di token. Una singola risposta può arrivare fino a 131.072 token.
/ 03Quanto costa?
Circa 0,057 $ in input e 0,193 $ in output per milione di token, circa la metà del listino ufficiale. La lettura dalla cache costa meno. Non sono previsti costi aggiuntivi per tool call. La barra dei prezzi mostra la tariffa in tempo reale.
/ 04Può leggere le immagini?
Sì. Screenshot, grafici e immagini di documenti sono supportati dal modello, insieme al testo.
/ 05Quando dovrei usare invece Qwen3.8 Max?
Quando desideri il modello di punta e puoi spendere di più per token. Max è il modello da 2.4T. Flash è quello ideale per i grandi volumi.