AIREITER
ДОКИ APIЦЕНЫ
ШАБЛОНЫ
  • AIReiter
  • Блог
  • Вышли открытые веса Kimi K3: 1,56 ТБ и кому под силу их запустить

Вышли открытые веса Kimi K3: 1,56 ТБ и кому под силу их запустить

Последнее обновление: 2026-07-28 08:18:39

Открытые веса Kimi K3 от Moonshot появились 27 июля 2026 года — через одиннадцать дней после запуска модели в API. Скачать их может любой: публичный репозиторий весит 1,56 ТБ и состоит из 96 файлов safetensors. Но именно на этом этапе обычно становится ясно, что «открытые веса» и «можно запустить у себя» — далеко не одно и то же. Ниже — состав релиза, условия лицензии и реальные требования для инференса.

Что вошло в релиз Moonshot

Полный чекпойнт доступен на Hugging Face: moonshotai/Kimi-K3. Для пользователей из Китая есть зеркало на ModelScope. Общий объём репозитория — 1,56 ТБ: 96 шардов safetensors, а также config.json, код модели и токенизатора — modeling_kimi_k3.py, encoding_k3.py и tiktoken-модель со словарём на 160K токенов, — препроцессинг для зрения и файл LICENSE. Одновременно в GitHub-репозитории MoonshotAI появился технический отчёт.

Список файлов Hugging Face для moonshotai/Kimi-K3: репозиторий объёмом 1,56 ТБ, тег лицензии kimi-k3 и 6,6 тыс. лайков

В model card важнее общего числа параметров три детали:

  • Подтверждено 104B активных параметров из 2,8T общих. На каждый токен маршрутизируются 16 из 896 экспертов, ещё 2 эксперта являются общими; модель насчитывает 93 слоя. До публикации весов это число активных параметров не раскрывалось.
  • Веса изначально представлены в MXFP4. Moonshot использовала quantization-aware training начиная со стадии SFT, а активации работают в MXFP8. Это не BF16-чекпойнт, который позже пережали до 4 бит: опубликованные 4-битные веса и есть исходный релиз.
  • Механизмы внимания распределены в пропорции 69/24 между слоями Kimi Delta Attention и Gated MLA при контекстном окне в 1 048 576 токенов.

Сообщество отреагировало быстро. Уже 28 июля 2026 года, через день после первого коммита в истории репозитория, у модели было 6,6 тыс. лайков. Конвертации тоже не заставили ждать: unsloth/Kimi-K3-GGUF создали тем же вечером, а на следующее утро в GrEarl/Kimi-K3-GGUF уже загрузили полную Q2_K-конверсию.

Kimi K3 License: это не MIT

Предыдущие флагманские модели Kimi выпускались по Modified MIT license. Для K3 выбрали другой документ — Kimi K3 License. В его основе лежит MIT: разрешены использование, копирование, изменение, объединение, публикация, распространение, сублицензирование, продажа, дообучение и создание производных работ. Однако перед внедрением модели стоит внимательно прочитать два дополнительных условия.

Условие для Model-as-a-Service. Ключевая формулировка звучит так: «If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose». Под MaaS лицензия понимает предоставление третьей стороне доступа к инференсу или дообучению, при котором она может управлять входными данными, параметрами либо обучающими данными. При этом прямо оговорены два случая, которые не считаются MaaS: пользовательские продукты, где возможности модели встроены в конкретные функции, и простая переадресация запросов к моделям, размещённым у другого поставщика.

Требование об указании модели. Если коммерческий продукт на базе K3 достигает 100 миллионов ежемесячно активных пользователей или 20 миллионов USD ежемесячной выручки, в его интерфейсе должно заметно отображаться название «Kimi K3».

Оба условия не действуют при исключительно внутреннем использовании — то есть когда модель, её ответы и возможности не открываются третьим лицам, — а также при доступе через официальные продукты Moonshot или сертифицированных партнёров по инференсу. Если читать исключения буквально, дообучение K3 на внутренних данных подпадает под исключение для внутреннего использования из Section 4(a), а встраивание модели в функцию продукта прямо названо в Section 2 случаем, не относящимся к MaaS. Дополнительные ограничения написаны прежде всего для тех, кто перепродаёт инференс K3 как сервис: на отметке $20M вопрос лицензии превращается в переговоры о контракте. Прежде чем закладывать модель в дорожную карту, самостоятельно изучите LICENSE: это интерпретация текста, а не юридическая консультация.

1,56 ТБ весов: какое железо потребуется на деле

Скачать открытые веса Kimi K3 может кто угодно. Обслуживать их — совсем другая история.

В официальном рецепте K3 для vLLM требование сформулировано без обиняков: минимум 8× GB300, а для настоящей продакшен-нагрузки понадобится несколько узлов. Для AMD указаны как минимум 8× MI355X или MI350X с ROCm-образом. В cookbook для K3 от SGLang речь идёт о том же классе оборудования.

Если вы действительно собираетесь разворачивать модель, операционные примечания в рецепте стоит перечитать дважды. Инференс запускается из специального образа vllm/vllm-openai:kimi-k3, либо vllm/vllm-openai_rocm:kimi-k3 для AMD, а не из обычного vLLM. Для обмена между узлами нужен --all2all-backend deepep_v2 поверх RDMA либо flashinfer_nvlink_one_sided поверх NVLink; параметр UCX_TLS="rc,cuda_copy" нужен, чтобы перенос KV-кэша оставался на RDMA. Рекомендация по MoE-бэкенду зависит от топологии: deep_gemm_mega_moe для развёртываний с expert parallelism и flashinfer_trtllm при TP>1. В рецепте также отмечено, что K3 иногда генерирует формат tool call, который её собственный парсер не принимает. Поэтому проверку схемы и повторный запрос стоит включить в serving-слой с первого дня.

Обычный запасной план — сильнее квантизировать модель — здесь почти не помогает: MXFP4 уже даёт примерно 4,25 бита на параметр. Резерв сжатия, за счёт которого модели класса 1T ещё удавалось уместить на рабочей станции, был израсходован до скачивания. Первая появившаяся в сообществе 2-битная GGUF-конверсия занимает 928 ГБ в 94 шардах: экономия 40% выглядит заметной, но не устраняет исходное главное ограничение.

Что загружаетсяРазмер
Официальные safetensors в MXFP41 561 ГБ
Пользовательская GGUF Q2_K929 ГБ
Активных параметров на токен104B

Если добавить KV-кэш для контекста, хотя бы приближающегося к 1 млн токенов, рабочий объём памяти станет ещё больше. Самый примечательный отчёт первого дня пришёл от команды, заявившей о запуске официальных MXFP4-весов на 80× RTX 5090 через обычный Ethernet — без HBM и без повторной квантизации. Они сообщили примерно о 20 токенах в секунду в однопоточном, не оптимизированном режиме. Это неаудированное заявление из одного поста, а не бенчмарк, и одна конфигурация не задаёт минимальные требования. Оно интересно только направлением: самый дешёвый из заявленных вариантов запуска K3 на потребительском железе потребовал восемьдесят флагманских GPU и обеспечил скорость, которую большинство сочтёт медленной.

Отдельно стоит упомянуть Ollama — именно его многие попробуют первым. Запись в библиотеке есть, но она ведёт к kimi-k3:cloud, то есть к хостинговой маршрутизации Ollama, а не к локальной загрузке. Ни ноутбук, ни одна рабочая станция сегодня эту модель не потянут. Поскольку MXFP4 — родной формат, а не удобная дополнительная квантизация, у агрессивной повторной квантизации меньше пространства для манёвра, чем было у линейки K2. Поддержка llama.cpp всё ещё развивается, поэтому проверяйте её актуальный статус, а не исходите из предположений.

Где запустить Kimi K3 уже сейчас

Для почти всех практичный выбор — хостинговый endpoint. Релиз открытых весов сработал как обычно: за сутки модель появилась у сторонних провайдеров. Ниже указаны цены за миллион токенов, входящих/исходящих, опубликованные 28 июля 2026 года.

ПровайдерКвантизацияКонтекстЦена
Moonshot AIMXFP4 (родная)1M$3 / $15
BasetenFP81M$3 / $15
Fireworksне указана1M$3 / $15 (также есть тариф $4.50 / $22.50)
NebiusFP48K$3 / $15

Перед выбором стоит проверить две вещи. Во-первых, контекстное окно различается радикально. Nebius предлагает ту же базовую цену, но лишь при окне 8K — и это убирает главное преимущество K3. Во-вторых, различается квантизация: Moonshot использует родной MXFP4, Baseten работает в FP8, а некоторые провайдеры вовсе не раскрывают точность. Для агентных задач с длинным горизонтом соответствие эталонной точности и полное окно в 1M обычно важнее разницы в цене. Для коротких массовых запросов выше могут оказаться задержка и доступность в нужном регионе.

Помимо прямых endpoint'ов, OpenRouter собирает их за одним ключом, а мультимодельные шлюзы предлагают K3 наряду с другими передовыми открытыми китайскими моделями. AIReiter даёт доступ к моделям того же класса через Anthropic-совместимый API, если ваш инструментарий уже работает с этим протоколом. У Moonshot есть интерфейсы, совместимые и с OpenAI, и с Anthropic. Полные сведения о лимитах и тарифах приведены в разборе цен Kimi K3.

Разворачивать самостоятельно или пользоваться API?

Сначала посчитайте экономику. При $3/$15 за миллион токенов миллиард выходных токенов обойдётся в $15 000, а миллиард входных — в $3 000. Сопоставьте это с минимально жизнеспособным самостоятельным развёртыванием: узлом класса 8× GB300 — покупкой уровня дата-центра или арендой с почасовой оплатой ускорителей, — плюс интерконнект, электропитание, охлаждение и инженер, который помнит --all2all-backend наизусть. Ни NVIDIA, ни крупнейшие облака не публикуют прайс для такой конфигурации, поэтому сравнивайте с актуальным коммерческим предложением, а не с усреднёнными оценками. И не забывайте: стоимость железа фиксирована, тогда как расходы на API растут только вместе с фактическим потреблением.

Самостоятельный запуск открытых весов Kimi K3 оправдан в трёх случаях — и на практике они уже, чем кажется:

  1. Изолированная инфраструктура или требования к размещению данных, которым не соответствует ни один сторонний endpoint. Это наиболее веский сценарий: цена здесь не главный фактор.
  2. Дообучение на проприетарных данных. Лицензия это прямо разрешает, а хостинговые endpoint'ы такой возможности не дают. При этом затраты на обучение считаются отдельно и выше стоимости инференса.
  3. Постоянная нагрузка на пределе. Если многонодовый кластер загружен круглые сутки, собственное оборудование может оказаться дешевле оплаты за токены. Редкие всплески нагрузки к этому случаю не относятся.

Если ни один из этих сценариев вам не подходит, выбирайте endpoint, а веса воспринимайте как запасной вариант, а не как план внедрения. Ценность открытой frontier-модели для большинства команд не в том, что они обязательно будут запускать её сами. Она в том, что цена хостинговой версии теперь вынуждена конкурировать с возможностью такого запуска.

FAQ

Kimi K3 — это open source?

Это модель с открытыми весами. Полный чекпойнт на 2,8T параметров доступен для скачивания, а Kimi K3 License разрешает использование, модификацию, распространение и дообучение. Но обучающие данные и полный training pipeline не публиковались, а лицензия содержит условие, зависящее от выручки операторов Model-as-a-Service. Поэтому это не open source в смысле OSI.

Можно ли локально запустить Kimi K3 в Ollama?

Нет. Запись kimi-k3 в Ollama соответствует kimi-k3:cloud и направляет запросы на хостинговый endpoint. Родные веса MXFP4 занимают 1,56 ТБ, а даже пользовательская 2-битная GGUF-конверсия весит 928 ГБ, поэтому локального варианта для потребительского железа нет.

По какой лицензии распространяются веса Kimi K3?

По Kimi K3 License: это лицензия на основе MIT, но она требует отдельного соглашения с Moonshot для бизнеса Model-as-a-Service с выручкой свыше $20M за любые 12 месяцев, а также указания модели в UI при превышении 100M MAU или $20M ежемесячной выручки. Внутреннее использование освобождено от обоих условий.

Где пользоваться Kimi K3 без скачивания весов?

В собственном API Moonshot и приложении Kimi, а также у Baseten, Fireworks и Nebius. На 28 июля 2026 года все четыре указывали базовый тариф $3/$15 за миллион токенов, но сравнение требует оговорок: у Fireworks есть также тариф $4.50/$22.50, а Nebius предлагает базовую ставку с контекстным окном 8K вместо 1M. О самой модели и её бенчмарках читайте в обзоре Kimi K3.

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Kimi K3

Chat

Модель для рассуждений с длинным контекстом для программирования, письма, анализа и агентных рабочих процессов.

MoonshotСоздать API Key >

GLM-5.3 Flash

Chat

Мультимодальная модель с контекстом 1M для чата с большим объёмом, понимания изображений и извлечения данных.

ZhipuСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicСоздать API Key >

Claude Opus 4.8

Chat

Высокопроизводительная модель Claude для сложных задач, требующих глубоких рассуждений и профессиональной работы.

AnthropicСоздать API Key >

Недавние статьи

Как подключить DeepSeek к Janitor AI: настройка 2026

2026-09-08

Бесплатные квоты LLM API: сравнение 11 провайдеров (2026)

2026-09-08

Цены API Muse Spark 1.3: Standard против Contributor

2026-09-08

Обзор API GPT-6 Astra (2026): для агентов, а не простой замены

2026-09-07
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI-видео

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI-изображения

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.