Un modèle Qwen rapide pour le codage et les tâches longues
Qwen3.8 Flash est la déclinaison axée sur la vitesse de Qwen3.8 par Alibaba. Il est conçu pour le codage, les agents utilisant des outils et les documents trop volumineux pour un court chat.
Grand modèle, coût réduit
125 milliards de paramètres au total, avec environ 6 milliards utilisés par token. C'est pourquoi il reste rapide et abordable pour les charges de travail à fort volume.
1 million de tokens de contexte
Intégrez une longue spécification, une série de fichiers ou une longue trace d'agent dans une seule requête. Une seule réponse peut atteindre jusqu'à 131 072 tokens.
Lit les images aussi bien que le texte
Le modèle comprend les captures d'écran, les graphiques et les documents, pas seulement le texte brut. Utilisez-le lorsque la tâche part d'un élément affiché à l'écran.
Environ 0,057 $ / 0,193 $
Par million de tokens, l'entrée est d'environ 0,057 $ et la sortie d'environ 0,193 $, soit près de la moitié du tarif officiel. L'entrée mise en cache est encore moins chère. La barre de prix ci-dessus affiche le tarif en direct.
Les points forts de Qwen3.8 Flash
La fiche de modèle de Qwen, publiée avec la version d'août 2026, attribue à Flash les meilleurs scores en codage et en utilisation d'outils parmi les modèles comparés.
Travail sur les dépôts de code
SWE-bench Pro 62,5. SWE-bench Multilingual 81,0. Utilisez-le pour identifier un bug, modifier plusieurs fichiers et vérifier le résultat.
Agents appelant des outils
DeepSWE 58,7. Toolathlon 73,5. Il maintient une boucle multi-étapes : analyser l'erreur, appeler un outil et réessayer.
Code et questions complexes
LiveCodeBench v6 atteint 91,9. GPQA Diamond atteint 91,7. La programmation compétitive et les questions scientifiques sont à sa portée.
Analyse d'écran
Score partiel OSWorld 52,3. MathVision 90,6, ou 95,7 lorsqu'il peut exécuter du code. Les captures d'écran et graphiques peuvent être transmis avec la question.
Flash ou Max
Choisir Flash
Agents de codage, boucles de test et correction, documents longs et toute charge de travail où le coût compte. La fenêtre de 1M couvre une longue trace sans avoir à la découper.
Choisir Max
Qwen3.8 Max est le modèle phare à 2,4 billions de paramètres. Utilisez-le quand vous recherchez le Qwen le plus puissant et que le prix du token passe au second plan. Accessible sur /chat/qwen3-8-max.
Même structure de requête
Les deux modèles acceptent un chat completion classique. Pour Flash, définissez le modèle sur qwen3.8-flash. Augmentez max tokens lorsque la réponse requiert une longue trace. La valeur par défaut est 8 192 et le plafond est de 131 072.
Questions
Contexte, prix, images et comparaison avec Max.
/ 01À quoi sert Qwen3.8 Flash ?
Génération de code rapide, agents utilisant des outils et longs documents. C'est la version plus rapide et plus économique de Qwen3.8, et non une copie réduite de Max.
/ 02Quelle est la longueur du contexte ?
1 million de tokens. Une réponse peut aller jusqu'à 131 072 tokens.
/ 03Combien cela coûte-t-il ?
Environ 0,057 $ en entrée et 0,193 $ en sortie par million de tokens, soit environ la moitié du tarif officiel. La lecture depuis le cache coûte moins cher. Il n'y a pas de frais supplémentaires par appel d'outil. La barre de prix indique le tarif en direct.
/ 04Peut-il lire des images ?
Oui. Les captures d'écran, les graphiques et les images de documents sont pris en charge par le modèle, au même titre que le texte.
/ 05Quand devrais-je plutôt utiliser Qwen3.8 Max ?
Lorsque vous souhaitez le modèle phare et pouvez payer davantage par token. Max est le modèle à 2,4T. Flash est celui conçu pour le volume.