AIREITER

Стоимость API Qwen3.8-Max: $2/$6 за миллион токенов

Последнее обновление: 2026-08-03 04:03:43

Qwen3.8-Max стала доступна в статусе GA с ценой $2 за миллион входных токенов и $6 за миллион выходных. По стоимости генерации она как минимум вчетверо дешевле Claude Opus 4.8, Claude Fable 5 и GPT-5.6 Sol. Однако параметр reasoning_effort по умолчанию установлен в xhigh, поэтому реальные расходы могут заметно отличаться от тарифной витрины уже с первого запроса.

Тарифы Qwen3.8-Max: вход, выход и кэш

Qwen3.8-Max — MoE-модель с 2,4 трлн параметров, из которых на каждый токен активны 95 млрд параметров. Она сменяет Qwen3.7-Max в роли флагманской модели Alibaba. Ниже — цены с страницы модели Alibaba, помеченной датой «Updated: Aug 2, 2026»:

ПозицияЦена за 1 млн токенов
Входные токены$2.00
Выходные токены$6.00
Входные токены с неявным кэшем$0.25
Создание явного кэша$2.50
Чтение явного кэша$0.17
Официальные цены и лимиты Qwen3.8-Max на странице модели QwenCloud

Неявный кэш работает автоматически и не требует изменений в коде: повторяющиеся префиксы тарифицируются по $0,25 — это одна восьмая обычной цены входа. С явным кэшем нужно принимать решение самостоятельно. Запись стоит $2,50, чтение — $0,17: по сравнению с некэшированным вводом схема начинает окупаться со второго чтения. Но неявный тариф $0,25 она обходит лишь примерно на тридцатом повторном чтении одного префикса. Для большинства приложений явный кэш можно просто не включать.

Есть и важное ограничение: API открыт, но веса пока нет. В анонсе Alibaba сказано, что веса Qwen3.8-Max появятся на Hugging Face и ModelScope на следующей неделе. Это первое конкретное обещание по срокам после нескольких недель с неопределённым «coming soon». По состоянию на 3 августа в боковой панели страницы модели всё ещё указано Open Source: No.

Почему $6 за выходной токен — не вся картина

Согласно документации к запуску, у reasoning_effort три режима, а по умолчанию выбран xhigh — самый глубокий из них. Ниже находятся medium, который «балансирует точность и скорость», и low, оптимизированный под скорость и стоимость. Параметр preserve_thinking также включён по умолчанию во всех сценариях. Токены рассуждений оплачиваются как выходные, то есть по ставке $6 ещё до того, как вы составите первый промпт.

Иными словами, оба ключевых параметра стоимости из коробки настроены не в вашу пользу, хотя каждый меняется одним параметром запроса. Переход на medium или low позволяет платить $6 за миллион только в тех задачах, где действительно нужна глубокая проработка, а не использовать её по умолчанию.

Один из первых тестировщиков сформулировал впечатление без дипломатии — прямо в заголовке обсуждения на r/LocalLLaMA:

Первые впечатления от Qwen 3.8 max: модель средняя и ужасна в режиме thinking

Это не бенчмарк и не готовый вывод о модели. Но это веская причина проверить каждый уровень effort на собственной нагрузке, прежде чем закреплять дефолтный режим в продакшене.

Длинный контекст до 1M без отдельной наценки

На странице Qwen3.8-Max указано по одной ставке для ввода и вывода — отдельных ценовых ступеней для контекста нет. У Gemini 3.1 Pro и GPT-5.6 Sol после определённого порога контекста включается более дорогой тариф:

МодельВход (короткий контекст)Выход (короткий контекст)Вход (длинный контекст)Выход (длинный контекст)
Qwen3.8-Max$2.00$6.00$2.00 (до 1M)$6.00 (до 1M)
Gemini 3.1 Pro$2.00 (≤200K)$12.00$4.00 (>200K)$18.00
GPT-5.6 Sol$5.00$30.00$10.00$45.00

До 200K токенов Gemini 3.1 Pro совпадает с Qwen3.8-Max по цене входа, а затем удваивает ставку. У GPT-5.6 Sol при переходе в длинный контекст вход дорожает вдвое, а выход — ещё в полтора раза, причём это происходит поверх уже перестроенной тарифной сетки.

По мере роста контекста разрыв не остаётся прежним, а увеличивается. Входной промпт на 400K токенов обойдётся в $0,80 для Qwen3.8-Max, в $1,60 для Gemini 3.1 Pro и в $4,00 для GPT-5.6 Sol. В пайплайнах обработки документов, длинных агентных сессиях и задачах по целому репозиторию эта разница быстро накапливается. В коротких чат-диалогах она почти незаметна.

Как цена соотносится с моделями из сравнений Alibaba

Цена миллиона выходных токенов у пяти передовых моделей: Qwen3.8-Max дешевле всех — $6

$6 за миллион выходных токенов — это менее четверти от $25 у Claude Opus 4.8 и пятая часть тарифа GPT-5.6 Sol в $30. Claude Fable 5 с ценой $50 стоит более чем в восемь раз дороже. Оправдана ли эта экономия с точки зрения возможностей — зависит от конкретной задачи. Alibaba приводит в пользу Qwen3.8-Max таблицу из 28 бенчмарков:

Сравнение Qwen3.8-Max с Claude Opus 4.8, Claude Fable 5 и GPT-5.6 Sol по пяти официальным бенчмаркам

Qwen3.8-Max лидирует в PaperBench: 93,0 против 90,5 у GPT-5.6 Sol и 88,8 у Fable 5. В JobBench она набирает 53,4 против 48,4 у Opus 4.8, а в Terminal Bench 2.1 с результатом 86,6 немного опережает обе модели Claude. Зато в SWE-bench Pro отставание серьёзное: 80,0 у Fable 5 против 67,7 у Qwen3.8-Max — разрыв превышает двенадцать пунктов. Все эти результаты получены и опубликованы самим вендором на той же странице.

Практический выбор отсюда довольно очевиден. В агентных задачах с большим объёмом генерации — длинных циклах вызова инструментов, подготовке документов, воспроизведении исследований, которое измеряет PaperBench, — скидка на выходные токены в 4–8 раз меняет экономику запуска системы в принципе. В разработке на уровне целого репозитория, которую проверяет SWE-bench Pro, скидка сопровождается ощутимой потерей в возможностях. Здесь тарифы Fable 5 всё ещё могут быть оправданы.

Проверить это на своей нагрузке несложно: в анонсе Alibaba описаны совместимые с OpenAI вызовы chat-completions и responses, а также интерфейс, совместимый с Anthropic. Это те же два формата запросов, которые принимают Claude Opus 4.8 и GPT-5.6 Sol.

Что поменять в коде уже сейчас

Идентификатор модели — qwen3.8-max. На 3 августа это единственная запись серии 3.8 в каталоге моделей Alibaba: предварительный идентификатор qwen3.8-max-preview исчез. Поэтому перед расчётом на сохранившуюся preview-скидку проверьте своего relay-провайдера.

Оба интерфейса доступны через три региональных базовых URL: Пекин, Сингапур и Вирджиния в США. Вот лимиты, в которые вы упрётесь раньше всего:

ЛимитЗначение
Контекстное окно1M
Максимум входных токенов991.80K
Максимум входных токенов с thinking983.61K
Максимум выходных токенов131.07K
Запросов в минуту15K
Токенов в минуту2M

Обратите внимание на разницу примерно в 8K токенов между двумя лимитами входа: включённый thinking забирает не только выходные токены, но и место в контекстном окне. А если обещанные на следующей неделе веса всё же выйдут, то показатель в 95 млрд активных параметров станет отправной точкой для сравнения самостоятельного хостинга с тарифом $2/$6.

FAQ

API Qwen бесплатный?

Нет. Qwen3.8-Max тарифицируется по токенам: $2 за миллион входных и $6 за миллион выходных. Подписка Token Plan, доступная на API-платформе Alibaba, — это отдельный продукт на основе кредитов, не связанный с поминутной тарификацией API по токенам.

Сколько стоит Qwen Max?

Для текущего поколения — $2 за миллион входных токенов и $6 за миллион выходных; неявное кэширование префиксов стоит $0,25. Более старые записи qwen-max в документации Alibaba Cloud относятся к предыдущим поколениям и имеют другие тарифы.

Есть ли у Qwen3.8-Max доплата за контекстное окно 1M?

Нет. Цена входа и выхода одинакова и при 5K токенов, и при 900K. Это главное структурное отличие от GPT-5.6 Sol и Gemini 3.1 Pro.

Qwen3.8-Max дешевле Qwen3.7-Max?

По официальным страницам ответить нельзя. На странице модели Qwen3.7-Max цены за токены отображаются как -- рядом с отметкой о скидке 50%, а не приводятся числом. Сравнивать не с чем.


Читайте также