AIREITER
QwenText Chat

Qwen3.8 Flash

Qwen3.8 Flash est un modèle rapide pour le codage, les agents et les longs documents. Contexte de 1M. Environ 0,057 $ en entrée et 0,193 $ en sortie par million de tokens.

EntréeOfficiel $0.1143 par million de tokensAIReiter $0.0571 par million de tokensSortieOfficiel $0.3857 par million de tokensAIReiter $0.1929 par million de tokensLecture cacheOfficiel $0.0143 par million de tokensAIReiter $0.0071 par million de tokensCréation cacheOfficiel $0.1429 par million de tokensAIReiter $0.0714 par million de tokens
Exécuter avec l'API

ENTRÉE

SORTIE

Example
Generated in
42.7 seconds
Token d’entrée
134
Token de sortie
2354
Tokens per second
55.13 tokens / second
Time to first token
-

Détails du modèle

Utilisez la même clé de modèle dans le Playground, les requêtes API et les workflows internes.

ID du modèle
qwen3.8-flash
Fournisseur
Qwen
Protocole
OpenAI Chat Completions
Fenêtre de contexte
1,000,000 tokens
Sortie maximale
131,072 tokens
Token d’entrée
5.7143 crédits / 1 M de tokens
Token de sortie
19.2857 crédits / 1 M de tokens
Lecture du cache
0.7143 crédits / 1 M de tokens
Écriture du cache
7.1429 crédits / 1 M de tokens

Un modèle Qwen rapide pour le codage et les tâches longues

Qwen3.8 Flash est la déclinaison axée sur la vitesse de Qwen3.8 par Alibaba. Il est conçu pour le codage, les agents utilisant des outils et les documents trop volumineux pour un court chat.

Grand modèle, coût réduit

125 milliards de paramètres au total, avec environ 6 milliards utilisés par token. C'est pourquoi il reste rapide et abordable pour les charges de travail à fort volume.

1 million de tokens de contexte

Intégrez une longue spécification, une série de fichiers ou une longue trace d'agent dans une seule requête. Une seule réponse peut atteindre jusqu'à 131 072 tokens.

Lit les images aussi bien que le texte

Le modèle comprend les captures d'écran, les graphiques et les documents, pas seulement le texte brut. Utilisez-le lorsque la tâche part d'un élément affiché à l'écran.

Environ 0,057 $ / 0,193 $

Par million de tokens, l'entrée est d'environ 0,057 $ et la sortie d'environ 0,193 $, soit près de la moitié du tarif officiel. L'entrée mise en cache est encore moins chère. La barre de prix ci-dessus affiche le tarif en direct.

Les points forts de Qwen3.8 Flash

La fiche de modèle de Qwen, publiée avec la version d'août 2026, attribue à Flash les meilleurs scores en codage et en utilisation d'outils parmi les modèles comparés.

Travail sur les dépôts de code

SWE-bench Pro 62,5. SWE-bench Multilingual 81,0. Utilisez-le pour identifier un bug, modifier plusieurs fichiers et vérifier le résultat.

Agents appelant des outils

DeepSWE 58,7. Toolathlon 73,5. Il maintient une boucle multi-étapes : analyser l'erreur, appeler un outil et réessayer.

Code et questions complexes

LiveCodeBench v6 atteint 91,9. GPQA Diamond atteint 91,7. La programmation compétitive et les questions scientifiques sont à sa portée.

Analyse d'écran

Score partiel OSWorld 52,3. MathVision 90,6, ou 95,7 lorsqu'il peut exécuter du code. Les captures d'écran et graphiques peuvent être transmis avec la question.

Flash ou Max

Flash est celui que vous laissez tourner toute la journée. Max est le fleuron lorsque l'exigence de la tâche prime sur le budget.
01

Choisir Flash

Agents de codage, boucles de test et correction, documents longs et toute charge de travail où le coût compte. La fenêtre de 1M couvre une longue trace sans avoir à la découper.

02

Choisir Max

Qwen3.8 Max est le modèle phare à 2,4 billions de paramètres. Utilisez-le quand vous recherchez le Qwen le plus puissant et que le prix du token passe au second plan. Accessible sur /chat/qwen3-8-max.

03

Même structure de requête

Les deux modèles acceptent un chat completion classique. Pour Flash, définissez le modèle sur qwen3.8-flash. Augmentez max tokens lorsque la réponse requiert une longue trace. La valeur par défaut est 8 192 et le plafond est de 131 072.

Questions

Contexte, prix, images et comparaison avec Max.

/ 01

À quoi sert Qwen3.8 Flash ?

Génération de code rapide, agents utilisant des outils et longs documents. C'est la version plus rapide et plus économique de Qwen3.8, et non une copie réduite de Max.

/ 02

Quelle est la longueur du contexte ?

1 million de tokens. Une réponse peut aller jusqu'à 131 072 tokens.

/ 03

Combien cela coûte-t-il ?

Environ 0,057 $ en entrée et 0,193 $ en sortie par million de tokens, soit environ la moitié du tarif officiel. La lecture depuis le cache coûte moins cher. Il n'y a pas de frais supplémentaires par appel d'outil. La barre de prix indique le tarif en direct.

/ 04

Peut-il lire des images ?

Oui. Les captures d'écran, les graphiques et les images de documents sont pris en charge par le modèle, au même titre que le texte.

/ 05

Quand devrais-je plutôt utiliser Qwen3.8 Max ?

Lorsque vous souhaitez le modèle phare et pouvez payer davantage par token. Max est le modèle à 2,4T. Flash est celui conçu pour le volume.