Быстрая модель Qwen для написания кода и работы с большими объемами данных
Qwen3.8 Flash — это скоростная версия Qwen3.8 от Alibaba. Она создана для кодинга, агентов с вызовом инструментов и документов, которые не помещаются в стандартный чат.
Большая модель, низкая стоимость
Всего 125 миллиардов параметров, при этом на каждый токен используется около 6 миллиардов. Вот почему модель остается быстрой и достаточно дешевой для масштабных задач.
Контекст в 1 миллион токенов
Передавайте длинные спецификации, множество файлов или подробный трейс агента в одном запросе. Один ответ может достигать 131 072 токенов.
Считывает как текст, так и изображения
Модель понимает скриншоты, диаграммы и документы, а не только простой текст. Используйте ее, когда задача начинается с того, что отображается на экране.
Около $0.057 / $0.193
За миллион токенов: ввод около $0.057, вывод около $0.193 — примерно вдвое дешевле официального прайс-листа. Кэшированный ввод еще дешевле. Тарифная шкала выше показывает актуальные цены в реальном времени.
Сильные стороны Qwen3.8 Flash
В карточке модели от самих создателей Qwen, опубликованной к релизу в августе 2026 года, Flash получила наивысшие оценки за кодинг и использование инструментов среди сравниваемых моделей.
Работа с репозиториями
SWE-bench Pro — 62.5. SWE-bench Multilingual — 81.0. Используйте ее для поиска багов, редактирования нескольких файлов и проверки результата.
Агенты с вызовом инструментов
DeepSWE — 58.7. Toolathlon — 73.5. Она удерживает многоэтапный цикл: проанализировать ошибку, вызвать инструмент и повторить попытку.
Код и сложные задачи
LiveCodeBench v6 — 91.9. GPQA Diamond — 91.7. Спортивное программирование и научные вопросы модели вполне по силам.
Работа с экраном
Частичный результат OSWorld — 52.3. MathVision — 90.6 (или 95.7 при возможности выполнения кода). Скриншоты и диаграммы можно передавать прямо вместе с вопросом.
Flash или Max
Выбирайте Flash
Для агентов-разработчиков, циклов тестирования и исправления ошибок, больших документов и любых нагрузок, где важна стоимость. Окно в 1M вмещает длинный трейс без необходимости его разбивать.
Выбирайте Max
Qwen3.8 Max — флагман на 2,4 триллиона параметров. Используйте его, когда нужна самая мощная модель Qwen, а стоимость токенов вторична. Доступно на /chat/qwen3-8-max.
Одинаковый формат запросов
Обе модели используют стандартный формат chat completion. Для Flash укажите модель qwen3.8-flash. Увеличьте max tokens, если ответ требует развернутого трейса. По умолчанию значение составляет 8 192, а максимум — 131 072.
Вопросы
Контекст, цена, работа с изображениями и сравнение с Max.
/ 01Для чего нужен Qwen3.8 Flash?
Быстрое написание кода, агенты с вызовом инструментов и длинные документы. Это более доступная и быстрая модель Qwen3.8, а не уменьшенная копия Max.
/ 02Каков размер контекста?
1 миллион токенов. Один ответ может содержать до 131 072 токенов.
/ 03Сколько это стоит?
Около $0.057 за ввод и $0.193 за вывод за миллион токенов — примерно вдвое дешевле официального прайса. Чтение из кэша стоит еще меньше. Дополнительная плата за вызов инструментов отсутствует. Индикатор цен отображает актуальный тариф.
/ 04Умеет ли модель распознавать изображения?
Да. Скриншоты, диаграммы и изображения документов поддерживаются моделью наряду с текстом.
/ 05Когда лучше выбрать Qwen3.8 Max?
Когда вам нужен флагман и вы готовы платить больше за токен. Max — это модель на 2.4T. Flash создана для работы с большими объемами.