Открытые веса Kimi K3 от Moonshot появились 27 июля 2026 года — через одиннадцать дней после запуска модели в API. Скачать их может любой: публичный репозиторий весит 1,56 ТБ и состоит из 96 файлов safetensors. Но именно на этом этапе обычно становится ясно, что «открытые веса» и «можно запустить у себя» — далеко не одно и то же. Ниже — состав релиза, условия лицензии и реальные требования для инференса.
Что вошло в релиз Moonshot
Полный чекпойнт доступен на Hugging Face: moonshotai/Kimi-K3. Для пользователей из Китая есть зеркало на ModelScope. Общий объём репозитория — 1,56 ТБ: 96 шардов safetensors, а также config.json, код модели и токенизатора — modeling_kimi_k3.py, encoding_k3.py и tiktoken-модель со словарём на 160K токенов, — препроцессинг для зрения и файл LICENSE. Одновременно в GitHub-репозитории MoonshotAI появился технический отчёт.
В model card важнее общего числа параметров три детали:
- Подтверждено 104B активных параметров из 2,8T общих. На каждый токен маршрутизируются 16 из 896 экспертов, ещё 2 эксперта являются общими; модель насчитывает 93 слоя. До публикации весов это число активных параметров не раскрывалось.
- Веса изначально представлены в MXFP4. Moonshot использовала quantization-aware training начиная со стадии SFT, а активации работают в MXFP8. Это не BF16-чекпойнт, который позже пережали до 4 бит: опубликованные 4-битные веса и есть исходный релиз.
- Механизмы внимания распределены в пропорции 69/24 между слоями Kimi Delta Attention и Gated MLA при контекстном окне в 1 048 576 токенов.
Сообщество отреагировало быстро. Уже 28 июля 2026 года, через день после первого коммита в истории репозитория, у модели было 6,6 тыс. лайков. Конвертации тоже не заставили ждать: unsloth/Kimi-K3-GGUF создали тем же вечером, а на следующее утро в GrEarl/Kimi-K3-GGUF уже загрузили полную Q2_K-конверсию.
Kimi K3 License: это не MIT
Предыдущие флагманские модели Kimi выпускались по Modified MIT license. Для K3 выбрали другой документ — Kimi K3 License. В его основе лежит MIT: разрешены использование, копирование, изменение, объединение, публикация, распространение, сублицензирование, продажа, дообучение и создание производных работ. Однако перед внедрением модели стоит внимательно прочитать два дополнительных условия.
Условие для Model-as-a-Service. Ключевая формулировка звучит так: «If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose». Под MaaS лицензия понимает предоставление третьей стороне доступа к инференсу или дообучению, при котором она может управлять входными данными, параметрами либо обучающими данными. При этом прямо оговорены два случая, которые не считаются MaaS: пользовательские продукты, где возможности модели встроены в конкретные функции, и простая переадресация запросов к моделям, размещённым у другого поставщика.
Требование об указании модели. Если коммерческий продукт на базе K3 достигает 100 миллионов ежемесячно активных пользователей или 20 миллионов USD ежемесячной выручки, в его интерфейсе должно заметно отображаться название «Kimi K3».
Оба условия не действуют при исключительно внутреннем использовании — то есть когда модель, её ответы и возможности не открываются третьим лицам, — а также при доступе через официальные продукты Moonshot или сертифицированных партнёров по инференсу. Если читать исключения буквально, дообучение K3 на внутренних данных подпадает под исключение для внутреннего использования из Section 4(a), а встраивание модели в функцию продукта прямо названо в Section 2 случаем, не относящимся к MaaS. Дополнительные ограничения написаны прежде всего для тех, кто перепродаёт инференс K3 как сервис: на отметке $20M вопрос лицензии превращается в переговоры о контракте. Прежде чем закладывать модель в дорожную карту, самостоятельно изучите LICENSE: это интерпретация текста, а не юридическая консультация.
1,56 ТБ весов: какое железо потребуется на деле
Скачать открытые веса Kimi K3 может кто угодно. Обслуживать их — совсем другая история.
В официальном рецепте K3 для vLLM требование сформулировано без обиняков: минимум 8× GB300, а для настоящей продакшен-нагрузки понадобится несколько узлов. Для AMD указаны как минимум 8× MI355X или MI350X с ROCm-образом. В cookbook для K3 от SGLang речь идёт о том же классе оборудования.
Если вы действительно собираетесь разворачивать модель, операционные примечания в рецепте стоит перечитать дважды. Инференс запускается из специального образа vllm/vllm-openai:kimi-k3, либо vllm/vllm-openai_rocm:kimi-k3 для AMD, а не из обычного vLLM. Для обмена между узлами нужен --all2all-backend deepep_v2 поверх RDMA либо flashinfer_nvlink_one_sided поверх NVLink; параметр UCX_TLS="rc,cuda_copy" нужен, чтобы перенос KV-кэша оставался на RDMA. Рекомендация по MoE-бэкенду зависит от топологии: deep_gemm_mega_moe для развёртываний с expert parallelism и flashinfer_trtllm при TP>1. В рецепте также отмечено, что K3 иногда генерирует формат tool call, который её собственный парсер не принимает. Поэтому проверку схемы и повторный запрос стоит включить в serving-слой с первого дня.
Обычный запасной план — сильнее квантизировать модель — здесь почти не помогает: MXFP4 уже даёт примерно 4,25 бита на параметр. Резерв сжатия, за счёт которого модели класса 1T ещё удавалось уместить на рабочей станции, был израсходован до скачивания. Первая появившаяся в сообществе 2-битная GGUF-конверсия занимает 928 ГБ в 94 шардах: экономия 40% выглядит заметной, но не устраняет исходное главное ограничение.
| Что загружается | Размер |
|---|---|
| Официальные safetensors в MXFP4 | 1 561 ГБ |
| Пользовательская GGUF Q2_K | 929 ГБ |
| Активных параметров на токен | 104B |
Если добавить KV-кэш для контекста, хотя бы приближающегося к 1 млн токенов, рабочий объём памяти станет ещё больше. Самый примечательный отчёт первого дня пришёл от команды, заявившей о запуске официальных MXFP4-весов на 80× RTX 5090 через обычный Ethernet — без HBM и без повторной квантизации. Они сообщили примерно о 20 токенах в секунду в однопоточном, не оптимизированном режиме. Это неаудированное заявление из одного поста, а не бенчмарк, и одна конфигурация не задаёт минимальные требования. Оно интересно только направлением: самый дешёвый из заявленных вариантов запуска K3 на потребительском железе потребовал восемьдесят флагманских GPU и обеспечил скорость, которую большинство сочтёт медленной.
Отдельно стоит упомянуть Ollama — именно его многие попробуют первым. Запись в библиотеке есть, но она ведёт к kimi-k3:cloud, то есть к хостинговой маршрутизации Ollama, а не к локальной загрузке. Ни ноутбук, ни одна рабочая станция сегодня эту модель не потянут. Поскольку MXFP4 — родной формат, а не удобная дополнительная квантизация, у агрессивной повторной квантизации меньше пространства для манёвра, чем было у линейки K2. Поддержка llama.cpp всё ещё развивается, поэтому проверяйте её актуальный статус, а не исходите из предположений.
Где запустить Kimi K3 уже сейчас
Для почти всех практичный выбор — хостинговый endpoint. Релиз открытых весов сработал как обычно: за сутки модель появилась у сторонних провайдеров. Ниже указаны цены за миллион токенов, входящих/исходящих, опубликованные 28 июля 2026 года.
| Провайдер | Квантизация | Контекст | Цена |
|---|---|---|---|
| Moonshot AI | MXFP4 (родная) | 1M | $3 / $15 |
| Baseten | FP8 | 1M | $3 / $15 |
| Fireworks | не указана | 1M | $3 / $15 (также есть тариф $4.50 / $22.50) |
| Nebius | FP4 | 8K | $3 / $15 |
Перед выбором стоит проверить две вещи. Во-первых, контекстное окно различается радикально. Nebius предлагает ту же базовую цену, но лишь при окне 8K — и это убирает главное преимущество K3. Во-вторых, различается квантизация: Moonshot использует родной MXFP4, Baseten работает в FP8, а некоторые провайдеры вовсе не раскрывают точность. Для агентных задач с длинным горизонтом соответствие эталонной точности и полное окно в 1M обычно важнее разницы в цене. Для коротких массовых запросов выше могут оказаться задержка и доступность в нужном регионе.
Помимо прямых endpoint'ов, OpenRouter собирает их за одним ключом, а мультимодельные шлюзы предлагают K3 наряду с другими передовыми открытыми китайскими моделями. AIReiter даёт доступ к моделям того же класса через Anthropic-совместимый API, если ваш инструментарий уже работает с этим протоколом. У Moonshot есть интерфейсы, совместимые и с OpenAI, и с Anthropic. Полные сведения о лимитах и тарифах приведены в разборе цен Kimi K3.
Разворачивать самостоятельно или пользоваться API?
Сначала посчитайте экономику. При $3/$15 за миллион токенов миллиард выходных токенов обойдётся в $15 000, а миллиард входных — в $3 000. Сопоставьте это с минимально жизнеспособным самостоятельным развёртыванием: узлом класса 8× GB300 — покупкой уровня дата-центра или арендой с почасовой оплатой ускорителей, — плюс интерконнект, электропитание, охлаждение и инженер, который помнит --all2all-backend наизусть. Ни NVIDIA, ни крупнейшие облака не публикуют прайс для такой конфигурации, поэтому сравнивайте с актуальным коммерческим предложением, а не с усреднёнными оценками. И не забывайте: стоимость железа фиксирована, тогда как расходы на API растут только вместе с фактическим потреблением.
Самостоятельный запуск открытых весов Kimi K3 оправдан в трёх случаях — и на практике они уже, чем кажется:
- Изолированная инфраструктура или требования к размещению данных, которым не соответствует ни один сторонний endpoint. Это наиболее веский сценарий: цена здесь не главный фактор.
- Дообучение на проприетарных данных. Лицензия это прямо разрешает, а хостинговые endpoint'ы такой возможности не дают. При этом затраты на обучение считаются отдельно и выше стоимости инференса.
- Постоянная нагрузка на пределе. Если многонодовый кластер загружен круглые сутки, собственное оборудование может оказаться дешевле оплаты за токены. Редкие всплески нагрузки к этому случаю не относятся.
Если ни один из этих сценариев вам не подходит, выбирайте endpoint, а веса воспринимайте как запасной вариант, а не как план внедрения. Ценность открытой frontier-модели для большинства команд не в том, что они обязательно будут запускать её сами. Она в том, что цена хостинговой версии теперь вынуждена конкурировать с возможностью такого запуска.
FAQ
Kimi K3 — это open source?
Это модель с открытыми весами. Полный чекпойнт на 2,8T параметров доступен для скачивания, а Kimi K3 License разрешает использование, модификацию, распространение и дообучение. Но обучающие данные и полный training pipeline не публиковались, а лицензия содержит условие, зависящее от выручки операторов Model-as-a-Service. Поэтому это не open source в смысле OSI.
Можно ли локально запустить Kimi K3 в Ollama?
Нет. Запись kimi-k3 в Ollama соответствует kimi-k3:cloud и направляет запросы на хостинговый endpoint. Родные веса MXFP4 занимают 1,56 ТБ, а даже пользовательская 2-битная GGUF-конверсия весит 928 ГБ, поэтому локального варианта для потребительского железа нет.
По какой лицензии распространяются веса Kimi K3?
По Kimi K3 License: это лицензия на основе MIT, но она требует отдельного соглашения с Moonshot для бизнеса Model-as-a-Service с выручкой свыше $20M за любые 12 месяцев, а также указания модели в UI при превышении 100M MAU или $20M ежемесячной выручки. Внутреннее использование освобождено от обоих условий.
Где пользоваться Kimi K3 без скачивания весов?
В собственном API Moonshot и приложении Kimi, а также у Baseten, Fireworks и Nebius. На 28 июля 2026 года все четыре указывали базовый тариф $3/$15 за миллион токенов, но сравнение требует оговорок: у Fireworks есть также тариф $4.50/$22.50, а Nebius предлагает базовую ставку с контекстным окном 8K вместо 1M. О самой модели и её бенчмарках читайте в обзоре Kimi K3.