AIREITER
QwenText Chat

Qwen3.8 Flash

Qwen3.8 Flash è un modello veloce per coding, agenti e documenti lunghi. Contesto da 1M. Circa $0.057 in input e $0.193 in output per milione di token.

InputUfficiale $0.1143 per 1 M di tokenAIReiter $0.0571 per 1 M di tokenOutputUfficiale $0.3857 per 1 M di tokenAIReiter $0.1929 per 1 M di tokenLettura cacheUfficiale $0.0143 per 1 M di tokenAIReiter $0.0071 per 1 M di tokenCreazione cacheUfficiale $0.1429 per 1 M di tokenAIReiter $0.0714 per 1 M di token
Esegui con API

INPUT

OUTPUT

Example
Generated in
42.7 seconds
Token input
134
Token output
2354
Tokens per second
55.13 tokens / second
Time to first token
-

Dettagli del modello

Usa la stessa chiave del modello nel Playground, nelle richieste API e nei flussi di lavoro interni.

ID modello
qwen3.8-flash
Provider
Qwen
Protocollo
OpenAI Chat Completions
Finestra di contesto
1,000,000 token
Output massimo
131,072 token
Token input
5.7143 crediti / 1 M token
Token output
19.2857 crediti / 1 M token
Lettura cache
0.7143 crediti / 1 M token
Scrittura cache
7.1429 crediti / 1 M token

Un modello Qwen veloce per coding e task lunghi

Qwen3.8 Flash è la versione ad alta velocità di Qwen3.8 sviluppata da Alibaba. È progettato per coding, agenti basati su tool e documenti che non rientrano in una chat breve.

Grande modello, costo ridotto

125 miliardi di parametri totali, con circa 6 miliardi utilizzati per ogni token. Ecco perché rimane veloce ed economico per carichi di lavoro ad alto volume.

1 milione di token di contesto

Includi una specifica dettagliata, una serie di file o una lunga traccia dell'agente in una sola richiesta. Una singola risposta può arrivare fino a 131.072 token.

Legge sia immagini che testo

Il modello comprende screenshot, grafici e documenti, non solo testo semplice. Usalo quando l'attività parte da un elemento visualizzato sullo schermo.

Circa $0.057 / $0.193

Per milione di token, l'input costa circa $0.057 e l'output circa $0.193, all'incirca la metà del listino ufficiale. L'input memorizzato nella cache costa meno. La barra dei prezzi in alto mostra la tariffa in tempo reale.

I punti di forza di Qwen3.8 Flash

La model card ufficiale di Qwen, pubblicata con la release di agosto 2026, assegna a Flash i punteggi più alti nel coding e nell'uso di tool tra i modelli messi a confronto.

Lavoro su repository

SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Usalo per trovare bug, modificare più file e verificare il risultato.

Agenti che richiamano tool

DeepSWE 58.7. Toolathlon 73.5. Gestisce cicli multi-step: analizza l'errore, richiama un tool e riprova.

Codice e quesiti complessi

LiveCodeBench v6 a 91.9. GPQA Diamond a 91.7. Programmazione competitiva e quesiti scientifici alla sua portata.

Analisi visiva dello schermo

Punteggio parziale OSWorld 52.3. MathVision 90.6, o 95.7 quando può eseguire codice. Screenshot e grafici possono essere inviati insieme alla domanda.

Flash o Max

Flash è il modello da lasciare in esecuzione tutto il giorno. Max è il top di gamma per quando la complessità del task supera i vincoli di budget.
01

Scegli Flash

Agenti di coding, cicli di test-and-fix, documenti lunghi e qualsiasi carico di lavoro in cui il budget è una priorità. La finestra da 1M copre una lunga traccia senza doverla suddividere.

02

Scegli Max

Qwen3.8 Max è il modello di punta da 2,4 trilioni. Usalo quando desideri il modello Qwen più potente e il prezzo per token è secondario. Provalo su /chat/qwen3-8-max.

03

Stessa struttura di richiesta

Entrambi i modelli accettano una normale chat completion. Per Flash, imposta il modello su qwen3.8-flash. Aumenta i max token quando la risposta richiede una traccia lunga. Il valore predefinito è 8.192 e il limite massimo è 131.072.

Domande

Contesto, prezzo, immagini e confronto con Max.

/ 01

A cosa serve Qwen3.8 Flash?

Coding rapido, agenti con uso di strumenti e documenti lunghi. È la versione di Qwen3.8 più economica e veloce, non una copia ridotta di Max.

/ 02

Quanto è lungo il contesto?

1 milione di token. Una singola risposta può arrivare fino a 131.072 token.

/ 03

Quanto costa?

Circa 0,057 $ in input e 0,193 $ in output per milione di token, circa la metà del listino ufficiale. La lettura dalla cache costa meno. Non sono previsti costi aggiuntivi per tool call. La barra dei prezzi mostra la tariffa in tempo reale.

/ 04

Può leggere le immagini?

Sì. Screenshot, grafici e immagini di documenti sono supportati dal modello, insieme al testo.

/ 05

Quando dovrei usare invece Qwen3.8 Max?

Quando desideri il modello di punta e puoi spendere di più per token. Max è il modello da 2.4T. Flash è quello ideale per i grandi volumi.