AIREITER
ДОКИ APIЦЕНЫ
ШАБЛОНЫ
  • AIReiter
  • Блог
  • Модели K2 Horizon: Apache 2.0, MoVA и стоимость самостоятельного хостинга

Модели K2 Horizon: Apache 2.0, MoVA и стоимость самостоятельного хостинга

Последнее обновление: 2026-09-04 01:32:24

Линейка из шести моделей — от 0.9B до 375B — выглядит как готовая лестница для любого сценария внедрения. На практике экономика сложнее. Лицензия Apache 2.0 у K2 Horizon избавляет от платы за лицензию модели, а MoVA сокращает объём активных вычислений; но расходы на хранение, KV-кеш, рантайм и железо никуда не исчезают.

Что входит в релиз из шести моделей под Apache 2.0

3 сентября 2026 года IFM представила K2 Horizon — связанную линейку из шести моделей: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B и 0.9B. Сами модели и код выпущены по Apache 2.0, а для датасетов действуют соответствующие им лицензии (анонс IFM).

Одна линейка, шесть моделей и разная степень готовности

В семейство входят следующие модели:

МодельАрхитектураОфициальное позиционированиеКонтекст в официальных материалах
K2 Horizon 0.9BПлотнаяЧасы, очки, ограниченные edge-устройства128K / 131,072 токена
K2 Horizon 3.7BПлотнаяТелефоны, дообучение, лёгкие локальные задачи512K / 524,288 токенов
K2 Horizon 7BПлотнаяТелефоны, локальные ассистенты, программирование и агенты512K / 524,288 токенов
K2 Horizon 32BПлотнаяРабочие станции и on-premises-серверы512K / 524,288 токенов
K2 Horizon MoVA 36B-A4BРазреженная MoE + MoVAЛокальный и эффективный инференс512K / 524,288 токенов
K2 Horizon 375B-A23BРазреженная MoEКорпоративные развёртывания и системы с несколькими ускорителями512K / 524,288 токенов

Модели объединяют общая архитектура и инструменты развёртывания; исключение — 0.9B с уменьшенным словарём. Такой общий фундамент должен упростить переход между размерами моделей или маршрутизацию запросов между ними (пресс-релиз IFM).

Есть важная оговорка о зрелости релизов. В официальной карточке K2-Horizon-32B доступный чекпойнт обозначен как Stage1, а финальный чекпойнт ещё только планируется выпустить. Карточки MoVA 36B-A4B и 375B-A23B, напротив, сообщают о выходе финальных чекпойнтов. Формулировка «анонсировано шесть моделей» верна, а вот «доступны шесть одинаково финальных production-чекпойнтов» — нет (карточка 32B, карточка 375B).

Что Apache 2.0 даёт команде, которая хостит модель сама

Apache 2.0 позволяет изменять модель и код, распространять их и использовать в коммерческих продуктах без платы за каждый токен. IFM уточняет, что для датасетов применяются собственные условия — например, ODC-BY, — а источники с ограничениями нельзя напрямую перераспространять (анонс IFM).

Apache 2.0 убирает лицензионный платёж, но не операционные расходы. Аренда или амортизация GPU, хранение весов модели, ёмкость KV-кеша, инженерия рантайма, мониторинг и аудит безопасности остаются частью бюджета. Кроме того, в примерах из рецепта обслуживания 36B и карточки 375B используется trust_remote_code=True.

Шесть размеров: сначала считаем память

Количество параметров удобно для сравнения возможностей моделей, но при самостоятельном хостинге первым ограничением обычно становится объём хранения весов. В оценках ниже предполагается два байта на параметр для BF16 и половина байта для идеализированного 4-битного представления. Метаданные, буферы рантайма, KV-кеш, файлы токенизатора и память ОС не учтены.

МодельВсего параметров для планированияАктивных параметров на токенМинимум для BF16Идеализированный минимум для 4 битПрактический класс
K2 Horizon 0.9B0.9B0.9B~1.8 GB~0.45 GBЭксперименты на edge- и встраиваемых устройствах
K2 Horizon 3.7B3.7B3.7B~7.4 GB~1.85 GBКомпактные локальные или мобильные задачи
K2 Horizon 7BКласс 7BКласс 7B~14 GB*~3.5 GB*Первый серьёзный локальный тест
K2 Horizon 32B32B32B~64 GB~16 GBРабочая станция или сервер
K2 Horizon MoVA 36B-A4B36B~4B~72 GB~18 GBРабочая станция с квантизацией или инференс на нескольких GPU
K2 Horizon 375B-A23B375B~23B~750 GB~187.5 GBКорпоративный уровень или кластер

\*В карточке 7B модель названа «7B-core», тогда как метаданные Hugging Face показывают 9B параметров. При планировании ёмкости ориентируйтесь на реальные файлы репозитория, а не только на название семейства (карточка 7B).

Конкретные репозитории хорошо показывают, почему это лишь нижние границы, а не гарантии. BF16 GGUF для 0.9B указан размером 2.16 GB, для 3.7B — 10.1 GB, для 32B Stage1 — 69.6 GB, для MoVA 36B — 74.9 GB (0.9B GGUF, 3.7B GGUF, 32B GGUF, 36B GGUF).

Общее и активное количество параметров K2 Horizon

Для edge: 0.9B, 3.7B и 7B

0.9B и 3.7B требуют минимум места для весов и подходят для ограниченных, сфокусированных задач, а не для агентов, которым регулярно приходится восстанавливаться после ошибок (карточка 0.9B, карточка 3.7B GGUF).

Для первого локального эксперимента 7B — наиболее подробно задокументированная модель семейства. В её карточке описаны парсеры для рассуждений и вызовов инструментов, настройка tensor parallelism на одном устройстве и квантизованные варианты. В приведённой там таблице бенчмарков указаны 70.6% на SWE-bench Verified, 39.1% на Terminal-Bench 2.1 и 25.8% на tau3-Banking. Однако все результаты получены с высоким усилием рассуждений, а карточка предупреждает, что детали протоколов могут различаться (карточка 7B).

Для 7B в карточке рекомендованы высокий уровень reasoning effort и не менее 32,768 выходных токенов. Длинные рассуждения увеличивают время генерации: модель может помещаться в память, но всё равно дорого обходиться по фактическому времени работы.

Локальный сервер и рабочая станция: 32B и 36B-A4B

32B — полностью плотная модель, поэтому её поведение проще прогнозировать. Но в реальном планировании важнее статус Stage1 и официальный GGUF размером 69.6 GB (32B Stage1 GGUF).

MoVA 36B-A4B ставит вопрос иначе: способна ли модель с заметно меньшим объёмом активных вычислений приблизиться по возможностям к плотной модели, сохранив при этом большую общую ёмкость? В таблице бенчмарков IFM для GGUF указаны 26.8% на tau3-Banking и 58.6% на Terminal-Bench 2.1, где модель лидирует среди приведённых конкурентов. Но она не занимает первое место по всем метрикам науки, фактологичности и длинного контекста (карточка бенчмарков 36B GGUF).

Когда веса уже загружены в память, меньшее число активных параметров может повысить устойчивую пропускную способность. Но итог зависит от бэкенда, батчинга, межсоединений и квантизации.

Флагман: 375B-A23B

В официальной карточке модели приведена проверенная конфигурация SGLang для K2 Horizon 375B-A23B: восемь GPU H200, tensor parallelism 8, expert parallelism 8, BF16 и FlashAttention-3 (карточка 375B).

Соотношение общих и активных параметров может сократить вычисления относительно плотной 375B-модели, но ориентировочный минимум в 750GB для BF16 по-прежнему задаёт инфраструктурную границу. Artificial Analysis указывает 47 баллов Intelligence Index и позицию #11 из 112 в отображаемом классе, но не приводит ни скорость генерации, ни стоимость задачи (профиль Artificial Analysis).

С учётом документированного и проверенного профиля на восьми H200 эту модель стоит рассматривать как кластерное развёртывание.

MoVA меняет экономику вычислений, но не минимум по хранению

MoVA расшифровывается как Mixture-of-Value Attention. В обычных архитектурах mixture-of-experts разреженная маршрутизация обычно применяется в feed-forward-слоях. IFM описывает MoVA как перенос экспертной маршрутизации и на value-компонент внимания с сохранением совместимости с такими техниками, как FlashAttention и grouped-query attention (объяснение архитектуры IFM).

Что означает обозначение 36B-A4B

Название «36B-A4B» передаёт две разные величины: всего доступно примерно 36B параметров, но на каждый токен активируется около 4B. Это способно сократить число операций умножения и сложения, а также трафик памяти на активном пути — особенно при продолжительной генерации.

Это не означает, что невыбранные эксперты исчезают из памяти. Официальный GGUF-файл занимает 74.9 GB в BF16, а рецепт vLLM описывает модель с 37.44B хранимых параметров с учётом эмбеддингов и 5.95B активных параметров на токен. Это два способа упаковки и учёта одной архитектуры, а не признак существования отдельной 37B-модели (рецепт vLLM).

Удобная ментальная модель выглядит так:

  1. Резидентная ёмкость: хранилище и память должны вмещать веса, которые потенциально могут быть выбраны.
  2. Активные вычисления: для каждого токена задействуется только направленное подмножество параметров.
  3. Состояние рантайма: KV-кеш, временные буферы, батчинг и накладные расходы фреймворка сохраняются.
  4. Стоимость системы: итоговый счёт определяют межсоединения, электричество, RAM хоста и операционное время.

Почему заявленные 512K контекста — не готовый бюджет

Для старших моделей K2 Horizon заявлен нативный контекст 524,288 токенов. Однако опубликованные рецепты vLLM и для MoVA 36B-A4B, и для 375B-A23B задают --max-model-len 131072 — то есть четверть от заявленного максимума (рецепт vLLM для 36B, карточка 375B).

Рецепты с лимитом 131K показывают: нативный контекст 512K не является бесплатной настройкой по умолчанию. Более длинный контекст расходует KV-кеш, снижает конкурентность и увеличивает задержку обработки промпта.

Сценарии самостоятельного хостинга с учётом затрат

У K2 Horizon нет прозрачной универсальной цены API, которую можно взять за базовую точку сравнения. На официальной странице MoVA GGUF сказано, что модель пока не развёрнута ни одним инференс-провайдером. Artificial Analysis показывает цены $0.00 на входные и выходные токены для профиля 375B, но одновременно помечает скорость и стоимость задачи как недоступные. Это не доказывает существование бесплатного production-эндпоинта (карточка MoVA GGUF, Artificial Analysis).

СценарийЧто даётГлавный экономический рискВердикт
GPU класса 24GB с подходящей 4-битной квантизацией 36BНедорогие эксперименты и приватностьМинимальный запас по контексту и конкурентности; поддержка квантизации и рантайма может быть незрелойЛучший вариант для пилота, но не гарантированная production-конфигурация
Рабочая станция для 32B BF16 или 36B BF16Более высокая точность и простое сравнение качества64–75GB весов ещё до кеша и памяти рантаймаОбычно понадобится система с несколькими GPU или большим объёмом памяти
Инференс 36B на двух H200Соответствует документированному профилю обслуживания MoVAРасходы на аренду, хост, хранилище и загрузка оборудованияРазумный вариант для постоянного сервиса или контролируемой оценки
Инференс 375B на восьми H200Флагманская ёмкость и корпоративная пропускная способностьКрупные капитальные затраты или высокая почасовая стоимость инфраструктурыТолько для кластерного уровня

Эксперимент на GPU класса 24GB

Идеализированный минимум для 36B в 4 битах составляет около 18GB. На карте с 24GB остаётся менее 6GB для метаданных квантизации, буферов рантайма и KV-кеша. Такая арифметика делает тест на GPU класса 24GB правдоподобным при умеренном контексте, но не устанавливает универсальный минимум: пригодность запуска определяется конкретной квантизацией, бэкендом, политикой offload и длиной промпта.

Упомянутый официальный артефакт MoVA GGUF представлен в BF16, а не в компактной пользовательской квантизации. Коллекция Hugging Face содержит варианты GGUF и FP8 для всей линейки, но затраты на конвертацию и проверку совместимости в день релиза всё равно нужно закладывать в бюджет развёртывания (коллекция K2 Horizon).

«Полагаю, они всё ещё загружают другие GGUF — пока я вижу только BF16 GGUF» — u/apoptosist в r/LocalLLaMA.

Два H200 для документированного пути 36B

В рецепте IFM для MoVA с vLLM используются tensor parallelism 2, expert parallelism, BF16 и лимит обслуживания в 131,072 токена. В документации SGLang сказано, что конфигурация была проверена на 2× H200. Это более надёжный ориентир по железу, чем одно лишь название модели (рецепт vLLM, официальная карточка GGUF).

Тарифы провайдеров наглядно показывают, почему важна загрузка оборудования. DigitalOcean указывает выделенный NVIDIA H200 за $4.47 за GPU-час и конфигурацию с 8× H200 за $35.78 в час. Google Cloud приводит цену машины A3 Ultra с 8× H200 — $84.806908493 в час; в стоимость типа машины включены подключённые vCPU, память и SSD (цены DigitalOcean, цены Google Cloud).

По указанному тарифу за один GPU два H200 дают примерно $8.94 в час или $6,526 за месяц из 730 часов до расходов на хост и хранилище. Это лишь ориентир, чувствительный к загрузке, а не коммерческое предложение на два GPU.

Восемь H200 для 375B-A23B

В официальном рецепте обслуживания флагмана используются восемь H200, TP=8, EP=8 и BF16. Такая конфигурация соответствует ориентировочному минимуму в 750GB для весов в BF16 и чётко обозначает корпоративную границу модели (карточка 375B).

Указанная Google цена машины с 8× H200 — $84.81 в час — составляет примерно $61,909 за 730 часов, без учёта налогов, передачи данных, постоянного хранилища и эксплуатации приложения. Это ориентир по инфраструктуре, а не цена K2 Horizon и не гарантия конкретной скорости в токенах в секунду для опубликованного рецепта.

Что могут и чего не могут доказать первые тесты самостоятельного хостинга

Первые отчёты подтверждают, что K2 Horizon можно запускать, но разные квантизации и рантаймы пока не дают универсальной кривой цена/производительность.

Один подробный отчёт в X хорошо иллюстрирует, насколько важен выбор бэкенда:

«36B-A4B MoVA выдаёт 131–142 ток/с на 2× 5090 в llama.cpp (форк IFM, Q8_0, контекст 131K) против 52 в vLLM...» — @abtraore_.

Этот полезный, но неконтролируемый отчёт показывает, почему фразы вроде «MoVA быстрее» недостаточно без указания бэкенда и конфигурации.

Обсуждения на Reddit указывают на открытые вопросы по квантизации, малому объёму VRAM, сравнению моделей и вызовам инструментов, но не подтверждают производительность (ветка r/LocalLLaMA).

Для серьёзного решения о покупке не хватает измерений резидентной памяти для разных квантизаций, роста KV-кеша с контекстом, скорости обработки промпта и генерации, надёжности вызова инструментов, энергопотребления и стоимости успешной задачи в одной контролируемой нагрузке.

Выбирайте по загрузке, а не по маркетингу активных параметров

Подходящая модель K2 Horizon зависит от того, как часто она будет работать, какой контекст ей нужен и оправдывает ли качество ответа инфраструктурные расходы. Короткий пилот лучше строить с возможностью легко отступить назад, а постоянно работающий приватный сервис — с прицелом на загрузку оборудования и операционную стабильность.

Ваша задачаС чего начатьПочемуКогда остановиться или перейти выше
Носимое, встраиваемое устройство или узкая задача уровня классификатора0.9BМинимальный размер и заявленный контекст 128KКогда узким местом становятся глубина работы с инструментами или покрытие предметной области
Компактный локальный ассистент или эксперимент с дообучением3.7BНебольшая нагрузка на хранилище и более широкие возможности рассуждений, чем у 0.9BКогда начинают доминировать сбои в программировании и восстановлении после ошибок
Первый серьёзный локальный пилот для программирования или агентов7BДокументированы парсеры, tensor parallelism и квантизованные вариантыКогда для длинных задач требуется более надёжное планирование или работа с инструментами
Мощная рабочая станция с плотной базовой моделью32B Stage1, с осторожностьюПлотную модель проще сравнивать, но текущий чекпойнт не финальныйКогда финальный чекпойнт и измеренные результаты оправдают требования к памяти
Регулярный локальный или серверный инференс, где важны активные вычисленияMoVA 36B-A4BМеньше активных параметров и документированный путь TP=2/EPКогда контекст, конкурентность или сложности рантайма съедают выигрыш в эффективности
Корпоративные рассуждения и агенты с длинным горизонтом375B-A23BСамая ёмкая модель линейки и документированный путь на 8× H200Когда стоимость задачи или загрузка не выдерживают бизнес-обоснования

Для первого пилота зафиксируйте пять показателей до смены модели: пиковое потребление VRAM/RAM, длину промпта, время до первого токена, скорость генерации токенов и стоимость завершённой задачи. Оставьте лимит контекста на документированном уровне 131,072 токенов, пока рабочая нагрузка не докажет, что более длинный контекст оправдывает цену KV-кеша и задержки.

Если нужно понять, какой представитель семейства подойдёт под конкретную машину, отдельное руководство по подбору размера модели K2 Horizon разбирает именно эту более узкую задачу. Здесь приоритет отдан загрузке и измеренной стоимости задачи, а не ярлыкам активных параметров.

FAQ по моделям K2 Horizon

Означает ли Apache 2.0, что все датасеты K2 Horizon тоже лицензированы по Apache 2.0?

Нет. IFM сообщает, что модели и код распространяются по Apache 2.0, а для датасетов применяются соответствующие лицензии, включая ODC-BY. Перед распространением или коммерческим использованием в обучении проверяйте каждый репозиторий и датасет отдельно (анонс IFM).

Означают ли 4B активных параметров, что K2 Horizon MoVA 36B-A4B требует памяти как 4B-модель?

Нет. На токен модель активирует примерно 4B параметров, но её официальный BF16 GGUF занимает около 74.9GB. Реальные требования к памяти определяют хранение весов, KV-кеш, буферы рантайма, накладные расходы квантизации и конкурентность запросов.

Можно ли запустить K2 Horizon MoVA 36B-A4B на одной GPU с 24GB?

Подходящая 4-битная квантизация может сделать эксперимент с умеренным контекстом правдоподобным, поскольку идеализированный минимум для весов 36B составляет около 18GB. Но официальный артефакт BF16 и проверенный путь обслуживания на двух H200 требуют значительно большего запаса, поэтому результат на 24GB следует считать пилотной конфигурацией, а не универсальной гарантией для production.

Экономично ли обслуживать заявленный контекст 512K?

Не автоматически. В карточках моделей заявлен нативный контекст 524,288 токенов, тогда как в документированных примерах vLLM используется 131,072 токена. Более длинный контекст увеличивает потребность в KV-кеше и задержку, а также часто снижает конкурентность.

Можно ли считать K2 Horizon 375B-A23B обычной моделью для самостоятельного хостинга?

Нет. IFM документирует конфигурацию SGLang на восьми H200, а ориентировочный минимум для весов BF16 составляет около 750GB ещё до накладных расходов рантайма. Считайте её моделью для корпоративного или кластерного развёртывания, если только провайдер не опубликует меньшую проверенную конфигурацию.

Цена $0.00 для K2 Horizon 375B — это реальный бесплатный API?

Такой вывод ничем не подтверждён. Artificial Analysis показывает цены $0.00 на вход и выход, но указывает, что скорость и стоимость задачи недоступны, а на официальной странице модели нет инференс-провайдера Hugging Face. Прежде чем закладывать эту цифру в бюджет, проверьте контракт и тарифы конкретного названного провайдера.

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Claude Opus 5

Chat

Премиальная модель Claude для сложного анализа, программирования и профессиональной работы с длинным контекстом.

AnthropicСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicСоздать API Key >

Claude Opus 4.8

Chat

Высокопроизводительная модель Claude для сложных задач, требующих глубоких рассуждений и профессиональной работы.

AnthropicСоздать API Key >

Claude Sonnet 5

Chat

Сбалансированная модель Claude для продвинутого рассуждения, программирования и повседневной работы.

AnthropicСоздать API Key >

Недавние статьи

Промокод OpenRouter (2026): как реально сэкономить

2026-09-05

GitHub HydraFusion Copilot CLI: как работает маршрутизация

2026-09-05

Обзор Grok Bot Haggle Bot: что он на самом деле умеет (2026)

2026-09-05

GitHub HydraFusion в Copilot CLI: как попробовать и чего ждать

2026-09-04
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Gemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 FlashGemini 3.1 Pro

AI-видео

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI-изображения

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.