Линейка из шести моделей — от 0.9B до 375B — выглядит как готовая лестница для любого сценария внедрения. На практике экономика сложнее. Лицензия Apache 2.0 у K2 Horizon избавляет от платы за лицензию модели, а MoVA сокращает объём активных вычислений; но расходы на хранение, KV-кеш, рантайм и железо никуда не исчезают.
Что входит в релиз из шести моделей под Apache 2.0
3 сентября 2026 года IFM представила K2 Horizon — связанную линейку из шести моделей: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B и 0.9B. Сами модели и код выпущены по Apache 2.0, а для датасетов действуют соответствующие им лицензии (анонс IFM).
Одна линейка, шесть моделей и разная степень готовности
В семейство входят следующие модели:
| Модель | Архитектура | Официальное позиционирование | Контекст в официальных материалах |
|---|---|---|---|
| K2 Horizon 0.9B | Плотная | Часы, очки, ограниченные edge-устройства | 128K / 131,072 токена |
| K2 Horizon 3.7B | Плотная | Телефоны, дообучение, лёгкие локальные задачи | 512K / 524,288 токенов |
| K2 Horizon 7B | Плотная | Телефоны, локальные ассистенты, программирование и агенты | 512K / 524,288 токенов |
| K2 Horizon 32B | Плотная | Рабочие станции и on-premises-серверы | 512K / 524,288 токенов |
| K2 Horizon MoVA 36B-A4B | Разреженная MoE + MoVA | Локальный и эффективный инференс | 512K / 524,288 токенов |
| K2 Horizon 375B-A23B | Разреженная MoE | Корпоративные развёртывания и системы с несколькими ускорителями | 512K / 524,288 токенов |
Модели объединяют общая архитектура и инструменты развёртывания; исключение — 0.9B с уменьшенным словарём. Такой общий фундамент должен упростить переход между размерами моделей или маршрутизацию запросов между ними (пресс-релиз IFM).
Есть важная оговорка о зрелости релизов. В официальной карточке K2-Horizon-32B доступный чекпойнт обозначен как Stage1, а финальный чекпойнт ещё только планируется выпустить. Карточки MoVA 36B-A4B и 375B-A23B, напротив, сообщают о выходе финальных чекпойнтов. Формулировка «анонсировано шесть моделей» верна, а вот «доступны шесть одинаково финальных production-чекпойнтов» — нет (карточка 32B, карточка 375B).
Что Apache 2.0 даёт команде, которая хостит модель сама
Apache 2.0 позволяет изменять модель и код, распространять их и использовать в коммерческих продуктах без платы за каждый токен. IFM уточняет, что для датасетов применяются собственные условия — например, ODC-BY, — а источники с ограничениями нельзя напрямую перераспространять (анонс IFM).
Apache 2.0 убирает лицензионный платёж, но не операционные расходы. Аренда или амортизация GPU, хранение весов модели, ёмкость KV-кеша, инженерия рантайма, мониторинг и аудит безопасности остаются частью бюджета. Кроме того, в примерах из рецепта обслуживания 36B и карточки 375B используется trust_remote_code=True.
Шесть размеров: сначала считаем память
Количество параметров удобно для сравнения возможностей моделей, но при самостоятельном хостинге первым ограничением обычно становится объём хранения весов. В оценках ниже предполагается два байта на параметр для BF16 и половина байта для идеализированного 4-битного представления. Метаданные, буферы рантайма, KV-кеш, файлы токенизатора и память ОС не учтены.
| Модель | Всего параметров для планирования | Активных параметров на токен | Минимум для BF16 | Идеализированный минимум для 4 бит | Практический класс |
|---|---|---|---|---|---|
| K2 Horizon 0.9B | 0.9B | 0.9B | ~1.8 GB | ~0.45 GB | Эксперименты на edge- и встраиваемых устройствах |
| K2 Horizon 3.7B | 3.7B | 3.7B | ~7.4 GB | ~1.85 GB | Компактные локальные или мобильные задачи |
| K2 Horizon 7B | Класс 7B | Класс 7B | ~14 GB* | ~3.5 GB* | Первый серьёзный локальный тест |
| K2 Horizon 32B | 32B | 32B | ~64 GB | ~16 GB | Рабочая станция или сервер |
| K2 Horizon MoVA 36B-A4B | 36B | ~4B | ~72 GB | ~18 GB | Рабочая станция с квантизацией или инференс на нескольких GPU |
| K2 Horizon 375B-A23B | 375B | ~23B | ~750 GB | ~187.5 GB | Корпоративный уровень или кластер |
\*В карточке 7B модель названа «7B-core», тогда как метаданные Hugging Face показывают 9B параметров. При планировании ёмкости ориентируйтесь на реальные файлы репозитория, а не только на название семейства (карточка 7B).
Конкретные репозитории хорошо показывают, почему это лишь нижние границы, а не гарантии. BF16 GGUF для 0.9B указан размером 2.16 GB, для 3.7B — 10.1 GB, для 32B Stage1 — 69.6 GB, для MoVA 36B — 74.9 GB (0.9B GGUF, 3.7B GGUF, 32B GGUF, 36B GGUF).
Для edge: 0.9B, 3.7B и 7B
0.9B и 3.7B требуют минимум места для весов и подходят для ограниченных, сфокусированных задач, а не для агентов, которым регулярно приходится восстанавливаться после ошибок (карточка 0.9B, карточка 3.7B GGUF).
Для первого локального эксперимента 7B — наиболее подробно задокументированная модель семейства. В её карточке описаны парсеры для рассуждений и вызовов инструментов, настройка tensor parallelism на одном устройстве и квантизованные варианты. В приведённой там таблице бенчмарков указаны 70.6% на SWE-bench Verified, 39.1% на Terminal-Bench 2.1 и 25.8% на tau3-Banking. Однако все результаты получены с высоким усилием рассуждений, а карточка предупреждает, что детали протоколов могут различаться (карточка 7B).
Для 7B в карточке рекомендованы высокий уровень reasoning effort и не менее 32,768 выходных токенов. Длинные рассуждения увеличивают время генерации: модель может помещаться в память, но всё равно дорого обходиться по фактическому времени работы.
Локальный сервер и рабочая станция: 32B и 36B-A4B
32B — полностью плотная модель, поэтому её поведение проще прогнозировать. Но в реальном планировании важнее статус Stage1 и официальный GGUF размером 69.6 GB (32B Stage1 GGUF).
MoVA 36B-A4B ставит вопрос иначе: способна ли модель с заметно меньшим объёмом активных вычислений приблизиться по возможностям к плотной модели, сохранив при этом большую общую ёмкость? В таблице бенчмарков IFM для GGUF указаны 26.8% на tau3-Banking и 58.6% на Terminal-Bench 2.1, где модель лидирует среди приведённых конкурентов. Но она не занимает первое место по всем метрикам науки, фактологичности и длинного контекста (карточка бенчмарков 36B GGUF).
Когда веса уже загружены в память, меньшее число активных параметров может повысить устойчивую пропускную способность. Но итог зависит от бэкенда, батчинга, межсоединений и квантизации.
Флагман: 375B-A23B
В официальной карточке модели приведена проверенная конфигурация SGLang для K2 Horizon 375B-A23B: восемь GPU H200, tensor parallelism 8, expert parallelism 8, BF16 и FlashAttention-3 (карточка 375B).
Соотношение общих и активных параметров может сократить вычисления относительно плотной 375B-модели, но ориентировочный минимум в 750GB для BF16 по-прежнему задаёт инфраструктурную границу. Artificial Analysis указывает 47 баллов Intelligence Index и позицию #11 из 112 в отображаемом классе, но не приводит ни скорость генерации, ни стоимость задачи (профиль Artificial Analysis).
С учётом документированного и проверенного профиля на восьми H200 эту модель стоит рассматривать как кластерное развёртывание.
MoVA меняет экономику вычислений, но не минимум по хранению
MoVA расшифровывается как Mixture-of-Value Attention. В обычных архитектурах mixture-of-experts разреженная маршрутизация обычно применяется в feed-forward-слоях. IFM описывает MoVA как перенос экспертной маршрутизации и на value-компонент внимания с сохранением совместимости с такими техниками, как FlashAttention и grouped-query attention (объяснение архитектуры IFM).
Что означает обозначение 36B-A4B
Название «36B-A4B» передаёт две разные величины: всего доступно примерно 36B параметров, но на каждый токен активируется около 4B. Это способно сократить число операций умножения и сложения, а также трафик памяти на активном пути — особенно при продолжительной генерации.
Это не означает, что невыбранные эксперты исчезают из памяти. Официальный GGUF-файл занимает 74.9 GB в BF16, а рецепт vLLM описывает модель с 37.44B хранимых параметров с учётом эмбеддингов и 5.95B активных параметров на токен. Это два способа упаковки и учёта одной архитектуры, а не признак существования отдельной 37B-модели (рецепт vLLM).
Удобная ментальная модель выглядит так:
- Резидентная ёмкость: хранилище и память должны вмещать веса, которые потенциально могут быть выбраны.
- Активные вычисления: для каждого токена задействуется только направленное подмножество параметров.
- Состояние рантайма: KV-кеш, временные буферы, батчинг и накладные расходы фреймворка сохраняются.
- Стоимость системы: итоговый счёт определяют межсоединения, электричество, RAM хоста и операционное время.
Почему заявленные 512K контекста — не готовый бюджет
Для старших моделей K2 Horizon заявлен нативный контекст 524,288 токенов. Однако опубликованные рецепты vLLM и для MoVA 36B-A4B, и для 375B-A23B задают --max-model-len 131072 — то есть четверть от заявленного максимума (рецепт vLLM для 36B, карточка 375B).
Рецепты с лимитом 131K показывают: нативный контекст 512K не является бесплатной настройкой по умолчанию. Более длинный контекст расходует KV-кеш, снижает конкурентность и увеличивает задержку обработки промпта.
Сценарии самостоятельного хостинга с учётом затрат
У K2 Horizon нет прозрачной универсальной цены API, которую можно взять за базовую точку сравнения. На официальной странице MoVA GGUF сказано, что модель пока не развёрнута ни одним инференс-провайдером. Artificial Analysis показывает цены $0.00 на входные и выходные токены для профиля 375B, но одновременно помечает скорость и стоимость задачи как недоступные. Это не доказывает существование бесплатного production-эндпоинта (карточка MoVA GGUF, Artificial Analysis).
| Сценарий | Что даёт | Главный экономический риск | Вердикт |
|---|---|---|---|
| GPU класса 24GB с подходящей 4-битной квантизацией 36B | Недорогие эксперименты и приватность | Минимальный запас по контексту и конкурентности; поддержка квантизации и рантайма может быть незрелой | Лучший вариант для пилота, но не гарантированная production-конфигурация |
| Рабочая станция для 32B BF16 или 36B BF16 | Более высокая точность и простое сравнение качества | 64–75GB весов ещё до кеша и памяти рантайма | Обычно понадобится система с несколькими GPU или большим объёмом памяти |
| Инференс 36B на двух H200 | Соответствует документированному профилю обслуживания MoVA | Расходы на аренду, хост, хранилище и загрузка оборудования | Разумный вариант для постоянного сервиса или контролируемой оценки |
| Инференс 375B на восьми H200 | Флагманская ёмкость и корпоративная пропускная способность | Крупные капитальные затраты или высокая почасовая стоимость инфраструктуры | Только для кластерного уровня |
Эксперимент на GPU класса 24GB
Идеализированный минимум для 36B в 4 битах составляет около 18GB. На карте с 24GB остаётся менее 6GB для метаданных квантизации, буферов рантайма и KV-кеша. Такая арифметика делает тест на GPU класса 24GB правдоподобным при умеренном контексте, но не устанавливает универсальный минимум: пригодность запуска определяется конкретной квантизацией, бэкендом, политикой offload и длиной промпта.
Упомянутый официальный артефакт MoVA GGUF представлен в BF16, а не в компактной пользовательской квантизации. Коллекция Hugging Face содержит варианты GGUF и FP8 для всей линейки, но затраты на конвертацию и проверку совместимости в день релиза всё равно нужно закладывать в бюджет развёртывания (коллекция K2 Horizon).
«Полагаю, они всё ещё загружают другие GGUF — пока я вижу только BF16 GGUF» — u/apoptosist в r/LocalLLaMA.
Два H200 для документированного пути 36B
В рецепте IFM для MoVA с vLLM используются tensor parallelism 2, expert parallelism, BF16 и лимит обслуживания в 131,072 токена. В документации SGLang сказано, что конфигурация была проверена на 2× H200. Это более надёжный ориентир по железу, чем одно лишь название модели (рецепт vLLM, официальная карточка GGUF).
Тарифы провайдеров наглядно показывают, почему важна загрузка оборудования. DigitalOcean указывает выделенный NVIDIA H200 за $4.47 за GPU-час и конфигурацию с 8× H200 за $35.78 в час. Google Cloud приводит цену машины A3 Ultra с 8× H200 — $84.806908493 в час; в стоимость типа машины включены подключённые vCPU, память и SSD (цены DigitalOcean, цены Google Cloud).
По указанному тарифу за один GPU два H200 дают примерно $8.94 в час или $6,526 за месяц из 730 часов до расходов на хост и хранилище. Это лишь ориентир, чувствительный к загрузке, а не коммерческое предложение на два GPU.
Восемь H200 для 375B-A23B
В официальном рецепте обслуживания флагмана используются восемь H200, TP=8, EP=8 и BF16. Такая конфигурация соответствует ориентировочному минимуму в 750GB для весов в BF16 и чётко обозначает корпоративную границу модели (карточка 375B).
Указанная Google цена машины с 8× H200 — $84.81 в час — составляет примерно $61,909 за 730 часов, без учёта налогов, передачи данных, постоянного хранилища и эксплуатации приложения. Это ориентир по инфраструктуре, а не цена K2 Horizon и не гарантия конкретной скорости в токенах в секунду для опубликованного рецепта.
Что могут и чего не могут доказать первые тесты самостоятельного хостинга
Первые отчёты подтверждают, что K2 Horizon можно запускать, но разные квантизации и рантаймы пока не дают универсальной кривой цена/производительность.
Один подробный отчёт в X хорошо иллюстрирует, насколько важен выбор бэкенда:
«36B-A4B MoVA выдаёт 131–142 ток/с на 2× 5090 в llama.cpp (форк IFM, Q8_0, контекст 131K) против 52 в vLLM...» — @abtraore_.
Этот полезный, но неконтролируемый отчёт показывает, почему фразы вроде «MoVA быстрее» недостаточно без указания бэкенда и конфигурации.
Обсуждения на Reddit указывают на открытые вопросы по квантизации, малому объёму VRAM, сравнению моделей и вызовам инструментов, но не подтверждают производительность (ветка r/LocalLLaMA).
Для серьёзного решения о покупке не хватает измерений резидентной памяти для разных квантизаций, роста KV-кеша с контекстом, скорости обработки промпта и генерации, надёжности вызова инструментов, энергопотребления и стоимости успешной задачи в одной контролируемой нагрузке.
Выбирайте по загрузке, а не по маркетингу активных параметров
Подходящая модель K2 Horizon зависит от того, как часто она будет работать, какой контекст ей нужен и оправдывает ли качество ответа инфраструктурные расходы. Короткий пилот лучше строить с возможностью легко отступить назад, а постоянно работающий приватный сервис — с прицелом на загрузку оборудования и операционную стабильность.
| Ваша задача | С чего начать | Почему | Когда остановиться или перейти выше |
|---|---|---|---|
| Носимое, встраиваемое устройство или узкая задача уровня классификатора | 0.9B | Минимальный размер и заявленный контекст 128K | Когда узким местом становятся глубина работы с инструментами или покрытие предметной области |
| Компактный локальный ассистент или эксперимент с дообучением | 3.7B | Небольшая нагрузка на хранилище и более широкие возможности рассуждений, чем у 0.9B | Когда начинают доминировать сбои в программировании и восстановлении после ошибок |
| Первый серьёзный локальный пилот для программирования или агентов | 7B | Документированы парсеры, tensor parallelism и квантизованные варианты | Когда для длинных задач требуется более надёжное планирование или работа с инструментами |
| Мощная рабочая станция с плотной базовой моделью | 32B Stage1, с осторожностью | Плотную модель проще сравнивать, но текущий чекпойнт не финальный | Когда финальный чекпойнт и измеренные результаты оправдают требования к памяти |
| Регулярный локальный или серверный инференс, где важны активные вычисления | MoVA 36B-A4B | Меньше активных параметров и документированный путь TP=2/EP | Когда контекст, конкурентность или сложности рантайма съедают выигрыш в эффективности |
| Корпоративные рассуждения и агенты с длинным горизонтом | 375B-A23B | Самая ёмкая модель линейки и документированный путь на 8× H200 | Когда стоимость задачи или загрузка не выдерживают бизнес-обоснования |
Для первого пилота зафиксируйте пять показателей до смены модели: пиковое потребление VRAM/RAM, длину промпта, время до первого токена, скорость генерации токенов и стоимость завершённой задачи. Оставьте лимит контекста на документированном уровне 131,072 токенов, пока рабочая нагрузка не докажет, что более длинный контекст оправдывает цену KV-кеша и задержки.
Если нужно понять, какой представитель семейства подойдёт под конкретную машину, отдельное руководство по подбору размера модели K2 Horizon разбирает именно эту более узкую задачу. Здесь приоритет отдан загрузке и измеренной стоимости задачи, а не ярлыкам активных параметров.
FAQ по моделям K2 Horizon
Означает ли Apache 2.0, что все датасеты K2 Horizon тоже лицензированы по Apache 2.0?
Нет. IFM сообщает, что модели и код распространяются по Apache 2.0, а для датасетов применяются соответствующие лицензии, включая ODC-BY. Перед распространением или коммерческим использованием в обучении проверяйте каждый репозиторий и датасет отдельно (анонс IFM).
Означают ли 4B активных параметров, что K2 Horizon MoVA 36B-A4B требует памяти как 4B-модель?
Нет. На токен модель активирует примерно 4B параметров, но её официальный BF16 GGUF занимает около 74.9GB. Реальные требования к памяти определяют хранение весов, KV-кеш, буферы рантайма, накладные расходы квантизации и конкурентность запросов.
Можно ли запустить K2 Horizon MoVA 36B-A4B на одной GPU с 24GB?
Подходящая 4-битная квантизация может сделать эксперимент с умеренным контекстом правдоподобным, поскольку идеализированный минимум для весов 36B составляет около 18GB. Но официальный артефакт BF16 и проверенный путь обслуживания на двух H200 требуют значительно большего запаса, поэтому результат на 24GB следует считать пилотной конфигурацией, а не универсальной гарантией для production.
Экономично ли обслуживать заявленный контекст 512K?
Не автоматически. В карточках моделей заявлен нативный контекст 524,288 токенов, тогда как в документированных примерах vLLM используется 131,072 токена. Более длинный контекст увеличивает потребность в KV-кеше и задержку, а также часто снижает конкурентность.
Можно ли считать K2 Horizon 375B-A23B обычной моделью для самостоятельного хостинга?
Нет. IFM документирует конфигурацию SGLang на восьми H200, а ориентировочный минимум для весов BF16 составляет около 750GB ещё до накладных расходов рантайма. Считайте её моделью для корпоративного или кластерного развёртывания, если только провайдер не опубликует меньшую проверенную конфигурацию.
Цена $0.00 для K2 Horizon 375B — это реальный бесплатный API?
Такой вывод ничем не подтверждён. Artificial Analysis показывает цены $0.00 на вход и выход, но указывает, что скорость и стоимость задачи недоступны, а на официальной странице модели нет инференс-провайдера Hugging Face. Прежде чем закладывать эту цифру в бюджет, проверьте контракт и тарифы конкретного названного провайдера.