AIREITER

Qwen 3.8 против Kimi K3 (2026): одна из этих моделей запускается на одной GPU

Последнее обновление: 2026-08-18 07:41:31

В августе 2026 года сравнение Qwen 3.8 и Kimi K3 перестало сводиться к простому выбору лучшей модели. Веса обеих линеек уже можно скачать, флагманы доступны в общем доступе — но оптимальный вариант зависит от сценария. Kimi K3 показывает самый сильный подтверждённый результат в агентном программировании, Qwen 3.8 Max выигрывает по стоимости токенов, а Qwen с Apache-2.0 на 27B запускается на одной потребительской GPU. Впрочем, «открытость» Kimi K3 условна на практике: размер её чекпойнта оценивают в 1,56 ТБ, поэтому скачать веса и реально развернуть модель у себя — совсем не одно и то же.

Что на самом деле выпустили Qwen 3.8 и Kimi K3

Kimi K3 от Moonshot AI вышла 16 июля 2026 года как единый флагман: MoE-модель на 2,8 трлн параметров, из которых на токен активны 104B. Она использует Kimi Delta Attention и Gated MLA, поддерживает контекст в 1 048 576 токенов и нативно работает с изображениями. Веса и технический отчёт появились 27 июля под кастомной Kimi K3 License. Как отмечено в сравнении Emergent, лицензия содержит условия для крупных коммерческих реселлеров и продуктов с аудиторией свыше 100 млн пользователей в месяц.

Alibaba ответила не одной моделью, а целой линейкой. Qwen 3.8 Max была представлена в превью 19 июля, 3 августа стала общедоступна в QwenCloud с 2,4T общих и примерно 95B активных параметров, а около 12 августа её веса появились на Hugging Face под именем Qwen/Qwen3.8-2.4T-A95B и кастомной лицензией qwen3.8-max. Через несколько дней вышла Qwen/Qwen3.8-27B — плотная vision-language-модель на 27B под Apache-2.0. Её нативный контекст составляет 262K, а с YaRN его можно расширить до 1M; даты 13–14 августа приводит Yotta Labs.

Kimi K3Qwen 3.8 MaxQwen3.8-27B
Всего / активных параметров2.8T / 104B2.4T / ~95B27B, плотная
Контекст1,048,5761M (991.8K макс. вход)262K нативно, 1M через YaRN
ЛицензияKimi K3 License (кастомная)Кастомная лицензия qwen3.8-maxApache-2.0
Веса доступны с27 июля 2026 года~12 августа 2026 года~13–14 августа 2026 года
Вход для зренияТекст + изображение (официально)Текст, изображение, видео через APIТекст, изображение, видео

По сообщениям, Moonshot также приостановила новые потребительские подписки менее чем через 48 часов после релиза K3: спрос превысил доступные GPU-мощности. Об этом стоит помнить, прежде чем строить продукт вокруг единственного провайдера.

Бенчмарки: где данные вендора, а где независимая проверка

Обе компании публикуют внушительные таблицы бенчмарков, но в них смешаны разные тестовые обвязки. В карточке Kimi прямо указано, что результаты конкурентов получены в иных агентных harness, а в отдельных строках использовались H20, а не H100. Поэтому общие для моделей строки ниже следует считать заявлениями вендоров, а не аудитом.

Заявленные вендорами результаты на общих бенчмарках: Qwen 3.8 Max против Kimi K3

В общих строках Kimi K3 лидирует именно там, где важнее всего агентное программирование. Согласно её model card, в FrontierSWE она набирает 81.2 против 73.5, а в Terminal-Bench 2.1 — 88.3 против 86.6 у Qwen; со стороны Qwen данные приведены в карточке модели 2.4T. В материалах запуска Qwen заявлен результат 86.1 в OSWorld-Verified против 84.8 в карточке K3. У Qwen также есть сильные одиночные показатели: PaperBench 93.0, IFBench 82.8 и SWE-bench Pro 67.7. K3, в свою очередь, приводит SWE-Marathon 42.0, BrowseComp 91.2 и MCPMark-Verified 94.5 — в тестах, по которым Qwen результатов не публикует.

Независимых данных пока заметно больше у Kimi. Трекер Emergent указывает для Kimi K3 57 баллов в Artificial Analysis Intelligence Index на запуске и 60 в текущей версии индекса; модель расположена позади Claude Fable 5 и GPT-5.6 Sol. В сравнении Orcarouter также указано первое место в Frontend Code Arena с рейтингом 1,679 Elo. Qwen 3.8 Max на момент запуска независимый индекс не получил: трекер cheapestinference.com сообщал о 53 баллах по индексу Artificial Analysis, а сообщения сообщества об обновлении до 56 пока не подтверждены.

Единственное прямое сопоставление на идентичной задаче — анализ архитектур StackPerf от TrilogyAI, который документировал Orcarouter. На превью-эндпойнтах K3 получила 83/100, а Qwen — 80/100. При этом Qwen зафиксировала 354 ссылки на репозиторий против 274 у Kimi, 22 запроса к gateway против 53 и ни одного неудачного вызова инструментов против двух у Kimi.

А теперь показатель, которого нет в общих таблицах. В собственной карточке Qwen модель 27B получает 84.3 в OSWorld-Verified, тогда как у K3 — 84.8. Плотная модель на 27B отстаёт от флагмана на 2,8T всего на полбалла в задачах компьютерного использования. До уровня K3 в программировании ей далеко — 73.0 против 88.3 в Terminal-Bench, — но 90.3 в LiveCodeBench v6 и 61.7 в SWE-bench Pro делают её полноценной рабочей моделью. Практический тред со сравнением на r/AISEOInsider пришёл к тому же выводу: Qwen чаще выигрывает в одноразовых сборках, но Kimi выходит вперёд с ростом контекста и глубины доработок.

Стоимость API: $15 за выходные токены и цена рассуждений

Рекомендованные цены указывают в одну сторону. Фактические расходы — ещё сильнее, поскольку обе модели по умолчанию рассуждают: K3 в режиме reasoning_effort: max, Qwen — xhigh. А токены рассуждений тарифицируются как выходные.

Тарифы API: Qwen 3.8 Max против Kimi K3
За 1M токеновQwen 3.8 Max (QwenCloud)Kimi K3 (Moonshot)
Вход (cache miss)$2.00$3.00
Вход (cache hit)$0.25$0.30
Выход, включая рассуждения$6.00$15.00
Явное создание / чтение кэша$2.50 / $0.17—
Страница тарифов QwenCloud для Qwen3.8-Max

Два расчётных сценария по ценам августа 2026 года:

СессияQwen 3.8 MaxKimi K3Разница
Агентное программирование: 500K входа (60% из кэша), 40K выхода$0.72$1.291.8×
Конвейер документов со свежим контекстом: 2M входа, 100K выхода$4.60$7.501.6×

Из этих цифр следует простое правило маршрутизации: отправляйте задачу в K3, только если её доля принятых результатов на вашей нагрузке превышает показатель Qwen больше чем примерно в 1.8× — настолько отличается цена токенов. Сама Moonshot предлагает более бюджетную альтернативу: Kimi K2.7 Code за $0.95 на входе и $4.00 на выходе при контексте 256K. Поэтому самый дешёвый путь для кодинга внутри семейства Kimi — не K3. Если вы выбираете маршрут для K3 сейчас, её API-эндпойнт указан здесь по опубликованным Moonshot тарифам. Детальная механика ценообразования обеих моделей разобрана в анализе цен Qwen3.8-Max и гайде по ценам Kimi K3.

Самостоятельный запуск: 1,56 ТБ против одной RTX 4090

Именно здесь различие между двумя историями об открытых весах достигает примерно двух порядков.

Размер доступных для скачивания весов: Kimi K3 и квантизации Qwen3.8-27B от сообщества

K3 поставляется с весами MXFP4, рассчитанными на квантизацию, как сказано в model card. Но чекпойнт, который оценивают в 1,56 ТБ, — это проект для кластера: тот же источник рекомендует vLLM на 64 ускорителях или более. Это вполне реальная статья расходов на аренду ещё до выдачи первого токена, а поверх неё действуют условия лицензии для крупных сценариев.

У 27B совсем другой профиль. Сборки GGUF от сообщества занимают примерно от 8.5 ГБ до 28.9 ГБ, а динамические сборки GGUF и NVFP4 от Unsloth укладываются примерно в 17 ГБ как минимум. Для серверного развёртывания есть и официальная версия FP8. Модель работает на железе, которое у многих уже есть:

"Qwen3.8-27B при контексте 160K на ОДНОЙ RTX 4090 — 47–57 ток/с, полный offload на GPU" — пост о развёртывании в r/Qwen_AI

Веса Max занимают промежуточную позицию. Qwen3.8-2.4T-A95B и её FP8-вариант можно скачать под кастомной лицензией qwen3.8-max, но открытый артефакт работает только с текстом, а отключить рассуждения в нём нельзя. Ввод изображений, режим без рассуждений и контекст 1M по умолчанию доступны в API-слое QwenCloud, а не в самом чекпойнте. О возможностях и ограничениях 27B при разных квантизациях, средах запуска и потреблении VRAM читайте в полевом гайде по Qwen3.8-27B; релиз весов K3 подробно разобран в материале об открытых весах Kimi K3.

Нюансы интеграции, которые решают судьбу агентного проекта

Три особенности из карточек моделей способны отнять целый день отладки, если обнаружить их уже в продакшене.

МодельПоведение / ограничениеПоследствие для реализации
Kimi K3Рассуждения всегда включены; клиенты с несколькими ходами и вызовами инструментов обязаны заново передавать полное предыдущее сообщение ассистента, включая reasoning_content и tool_calls (карточка)Если отбросить trace рассуждений, агентные циклы деградируют; если хранить его, расходы растут вместе с длиной цикла
Qwen3.8-27Bpreserve_thinking включён по умолчанию; reasoning_effort можно снизить до medium/low; YaRN после 262K использует статическое масштабирование (карточка)Отключение на уровне отдельного запроса поддерживается; карточка предупреждает, что снижение effort не всегда уменьшает общее время из-за повторных попыток; YaRN стоит включать только для длинных задач
Лимиты Qwen 3.8 Max и K3Max: 991.8K входа / 131.07K выхода (QwenCloud); K3: 1,048,576 входа / 131K выхода по умолчанию с ростом в сторону 1MНи одна формулировка «контекст 1M» не обещает 1M полезного выхода; в стороннем needle-тесте нашли 18/18 фактов на 248K и ничего не тестировали выше

FAQ

Qwen 3.8 лучше Kimi K3 для программирования?

По доступным данным — нет. Kimi K3 лидирует в важных для агентного кодинга строках: FrontierSWE 81.2 против 73.5 и Terminal-Bench 2.1 88.3 против 86.6; кроме того, только у неё есть независимые индексные оценки. Qwen 3.8 Max близка в задачах терминала и дешевле на токен и в расчётных сессиях, а 27B относится к совершенно другому классу по размеру весов.

Что дешевле: Qwen 3.8 или Kimi K3?

Qwen 3.8 Max дешевле по каждой строке прайс-листа: $2 против $3 за вход и $6 против $15 за выход. Поскольку обе модели тарифицируют включённые по умолчанию рассуждения как выходные токены, отставание Kimi по цене растёт вместе со сложностью задачи — в расчёте выше это примерно 1.8× для агентной сессии с кэшем.

Можно ли развернуть их самостоятельно и на каких лицензиях?

Да, все три чекпойнта доступны для скачивания. Qwen3.8-27B распространяется по Apache-2.0 и в квантизованном виде помещается на одной GPU с 24 ГБ; Kimi K3 для своего чекпойнта MXFP4 объёмом около 1,56 ТБ требует кластерного железа и лицензируется по кастомной Kimi K3 License; веса Qwen3.8-Max опубликованы как Qwen3.8-2.4T-A95B под кастомной лицензией qwen3.8-max.

Контекстное окно 1M действительно работает у обеих моделей?

Приблизительно. Для Kimi K3 заявлены 1 048 576 токенов; Qwen 3.8 Max указывает 1M при максимальном входе 991.8K; у 27B нативный лимит — 262,144, а 1M достигается только масштабированием YaRN, которое ухудшает качество на коротком контексте. Независимая проверка существует лишь на уровне 248K.

Что выбрать и что может изменить вывод

Ваш сценарийВыборПричина
API-агенты для кодинга, качество важнее всегоKimi K3FrontierSWE 81.2, Terminal-Bench 88.3, подтверждённые AA 60
Работа через API, где важны расходы, много документов и visionQwen 3.8 Max$6 против $15 за выход, OSWorld 86.1, явное чтение кэша за $0.17
Самостоятельный запуск на собственном железеQwen3.8-27BApache-2.0, квантизации ~17–29 ГБ, контекст 160K на одной RTX 4090
Самостоятельный запуск флагмана frontier-классаKimi K3Единственный здесь открытый чекпойнт с независимыми результатами frontier-класса — закладывайте бюджет на кластер

Два события могут изменить часть этой таблицы: независимая оценка Qwen 3.8 Max, для которой пока есть лишь трекерное значение 53 против подтверждённых 60 у K3 на слабой доказательной базе, и публикация условий кастомной лицензии qwen3.8-max. Пока этого не произошло, в прямом сравнении API Qwen 3.8 Max и Kimi K3 подробнее разобран сценарий работы только через API.

Читайте также: Qwen3.8-27B: что подтверждено и на что реально хватает 17GB · Открытые веса Kimi K3 · Qwen 3.8 Max против Kimi K3: API-версия