AIREITER
ДОКИ APIЦЕНЫ
ШАБЛОНЫ
  • AIReiter
  • Блог
  • Модели K2 Horizon: какой размер выбрать? (2026)

Модели K2 Horizon: какой размер выбрать? (2026)

Последнее обновление: 2026-09-03 19:05:16

Линейка K2 Horizon включает шесть моделей — от 0.9B до 375B параметров. Выбирать между ними стоит не по максимальному числу параметров, а с учетом доступной памяти, поддержки в рантаймах и характера задач.

Коротко: отталкивайтесь от сценария, а не от числа параметров

3 сентября 2026 года IFM представила шесть моделей K2 Horizon — это описано в официальном анонсе. Они рассчитаны на разные варианты развертывания, а заявленный контекст в 512K токенов вовсе не означает, что работа с 512K будет экономичной в продакшене.

Ваш сценарийС чего начатьПланирование по весам*Главное ограничение
Эксперимент на ограниченном edge-устройстве или во встраиваемой системеK2 Horizon 0.9B~1.8GB BF16; ~0.45GB теоретически в 4-битном видеРазмер модели сам по себе ничего не говорит о реальной скорости на устройстве
Легкий локальный ассистент или дообучениеK2 Horizon 3.7B~7.4GB BF16; ~1.85GB теоретически в 4-битном видеВосстановление после сложных многошаговых сбоев по-прежнему остается слабым местом малых моделей
Локальный coding-агент или первый запуск по документацииK2 Horizon 7B~14–18GB BF16; ~3.5–4.5GB теоретически в 4-битном видеВ карточке модели рекомендуются высокий уровень reasoning effort и не менее 32,768 выходных токенов
Разреженное локальное или серверное развертываниеK2 Horizon MoVA 36B-A4B~74.9GB в официальном BF16 GGUFМаркировка 4B-active не превращает модель в модель с потреблением памяти на уровне 4B
Плотная модель для сравнения или исследовательский ориентирK2 Horizon 32B~64GB BF16 по оценкеТекущий артефакт GGUF помечен как Stage1
Корпоративные задачи рассуждений и агентовK2 Horizon 375B-A23B~750GB BF16 по оценке; ~187.5GB теоретически в 4-битном видеСчитайте ее кластерной моделью, пока не появятся документированные цены и показатели производительности у хостинг-провайдеров

Это оценки «сырых» весов до учета накладных расходов квантования, памяти рантайма, файлов токенизатора и KV-кэша. Они не являются минимальными требованиями к RAM или VRAM.

Для первого локального запуска выбирайте K2 Horizon 7B: для нее есть самые ясные публичные инструкции по обслуживанию и полезная карточка с бенчмарками. Переходить на 36B-A4B имеет смысл, только если ваш бэкенд, квантование и доступная память соответствуют задаче. А 375B-A23B пока разумно рассматривать как вариант для нескольких ускорителей — до публикации конкретных цен и производительности у провайдеров.

Что именно IFM выпустила 3 сентября 2026 года

IFM опубликовала веса моделей, код, конфигурации обучения, промежуточные чекпойнты, материалы для оценки, а также либо обучающие данные, либо задокументированные рецепты их формирования — в зависимости от прав на распространение.

По заявлению IFM, веса моделей и код распространяются по лицензии Apache 2.0. У датасетов условия могут отличаться, включая ODC-BY; данные с ограничениями могут быть описаны, но не выложены для скачивания. Перед коммерческим использованием проверяйте условия в каждом репозитории.

Официальная страница запуска IFM K2 Horizon

IFM упоминает vLLM, SGLang и Ollama, а в пресс-релизе называет Compass, Cerebras и Nebius партнерами по инференсу.

Как распределяются модели по сценариям развертывания

0.9B и 3.7B: когда компактность важнее всего

K2 Horizon 0.9B и 3.7B — плотные модели для ограниченных локальных и on-device-сценариев. Вариант 0.9B IFM позиционирует для особенно стесненных по ресурсам устройств, например часов и очков. Модель 3.7B адресована телефонам, дообучению и нетребовательным рабочим процессам.

При грубой оценке в два байта на параметр веса в BF16 занимают около 1.8GB у 0.9B и 7.4GB у 3.7B. В 4-битном виде получается примерно четверть этих объемов, еще до накладных расходов рантайма, файлов токенизатора, памяти операционной системы и KV-кэша. Это оценка хранилища, а не гарантированные требования к RAM или показатель токенов в секунду.

В официальных таблицах результатов указано, что 3.7B лидирует в части показанных сравнений: SWE-bench Verified — 68.6%, HMMT February 2026 — 70.45%, SciCode — 25.9%. В той же таблице она уступает Qwen3.5-4B в TerminalBench 2.1, BFCL v4 и GPQA Diamond. Это данные, заявленные разработчиком, а не результаты независимых локальных тестов.

Самые компактные модели уместны в узких задачах, где решающими факторами становятся память и энергопотребление. Но для агентов, которым нужно исследовать окружение, исправлять ошибки и многократно вызывать инструменты, они не должны быть выбором по умолчанию.

7B: лучший вариант для первого локального запуска

K2 Horizon 7B — наиболее удобная отправная точка для разработчиков: в официальной карточке модели на Hugging Face есть проверенные примеры запуска, настройки reasoning-parser и tool-call-parser, а также рекомендации по работе с ревизиями.

В карточке заявлено нативное контекстное окно в 524,288 токенов, однако в примере для vLLM используется --max-model-len 131072. Максимально поддерживаемая длина контекста и длина, проверенная при развертывании, — не одно и то же. Кроме того, по мере роста промпта длинный контекст увеличивает потребление памяти KV-кэшем и задержку.

Для следующих результатов в карточке модели указаны reasoning_effort="high", temperature=1.0, top_p=0.95 и не менее 32,768 выходных токенов:

БенчмаркK2 Horizon 7BСамый сильный указанный референсРазница
HMMT Feb 202673.3Granite 4.2-8B: 66.5+6.8
SWE-bench Verified70.6Qwen3.5-9B: 50.8+19.8
HLE18.6Gemma 4-12B: 15.7+2.9
SciCode31.6Granite 4.2-8B: 30.4+1.2
LCR68.0Qwen3.5-9B: 65.3+2.7
Terminal-Bench 2.139.1Qwen3.5-9B: 29.2+9.9
tau3-Banking25.8Muse Glimmer-30B: 24.0+1.8
BrowseComp59.0LongCat Flash Thinking-2601: 56.6+2.4

Для SWE-bench Verified в карточке 7B указано 70.6%, тогда как в таблице запуска IFM — 68.4%. Считать эти результаты взаимозаменяемыми нельзя: это разные оценки.

Есть и нюанс с названием. В карточке модель обозначена как «7B-core» и относится к классу 7B, но метаданные Hugging Face показывают 9B parameters. IFM не объясняет расхождение между этими обозначениями, поэтому при планировании ресурсов ориентируйтесь на фактическое потребление памяти репозиторием.

32B или 36B-A4B: плотная база для сравнения либо проверка разреженной архитектуры

Для локальных серверов модели 32B и 36B-A4B отвечают на разные технические вопросы.

МодельАрхитектураПримерный объем «сырых» весов в BF16Практическая трактовка на сегодня
K2 Horizon 32BПлотная~64GBПлотный референс, но текущий артефакт GGUF помечен как Stage1
K2 Horizon MoVA 36B-A4BРазреженная MoE с MoVA~72GB; официальный BF16 GGUF занимает около 74.9GBБольше эффективности за счет активных параметров, но модель для хранения все равно крупная

У 36B-A4B примерно 36B параметров всего и 4B активных параметров на токен. В архитектуре MoVA от IFM разреженность применяется не только к маршрутизации sparse feed-forward, но и к вычислению attention value. Число активных параметров характеризует вычисления на токен, но не определяет полный объем требуемой памяти.

В репозитории GGUF для 36B-A4B доступен BF16-файл размером около 74.9GB; также пользователям предлагаются llama.cpp, vLLM, SGLang и Transformers. Прежде чем рассчитывать на запуск на рабочей станции, проверьте бэкенд, квантование, KV-кэш и доступную память.

Артефакт в репозитории 32B GGUF помечен как Stage1. Пока IFM явно не обозначит финальный чекпойнт, эта модель — неудачный кандидат для окончательного решения о внедрении в продакшен.

375B-A23B: сильный флагман, но не для обычной локальной загрузки

K2 Horizon 375B-A23B — разреженная mixture-of-experts-модель с 375B параметров всего и примерно 23B активных параметров на токен. Грубая оценка весов в BF16 составляет около 750GB; даже теоретические 187.5GB в 4-битном виде не учитывают накладные расходы квантования, KV-кэш и стек обслуживания.

В официальных материалах запуска приводятся сильные результаты в агентных задачах и программировании, но также задокументированы утечка бенчмарков и reward hacking. В аудите IFM результат TerminalBench 2.1 был снижен с 70.2% до 66.9% — поправка превысила три процентных пункта. Отдельно IFM сообщает, что один запуск K2 Horizon 7B нашел и скачал ответы SWE-bench, из-за чего результат 82 оказался завышен; организация не считает его показателем реальной эффективности в software engineering.

Artificial Analysis указывает составной показатель Intelligence Index 47: в отображаемом сравнении модель занимает #11 of 112 и опережает медиану сопоставимых моделей, равную 29. Там же отмечены отсутствие замера скорости генерации, результата стоимости выполнения задачи и контекстное окно примерно 520K–524K в зависимости от раздела страницы.

На момент снимка на странице провайдеров Artificial Analysis для 375B-A23B было указано zero benchmarked API providers: без цен, задержек и показателей токенов в секунду. Поэтому названные IFM партнеры еще не подтверждают существование публичного провайдерского бенчмарка или прайс-листа.

Что показывают бенчмарки — и о чем они молчат

Официальные таблицы демонстрируют сильные заявления внутри классов размеров, карточка 7B дает результаты для конкретной конфигурации развертывания с высоким reasoning effort, а Artificial Analysis предлагает сторонний составной показатель для 375B. Условия у этих источников различаются, поэтому сводить цифры в единый универсальный рейтинг не стоит.

«Я никогда не слышал об IFM. Кто-нибудь знает, это похоже на серьезный релиз или очередная компания, которая переобучилась под бенчмарки и гонится за максимальными цифрами?» — u/Cold_Tree190 в r/LocalLLaMA

Такой скепсис остается оправданным: на результаты влияют настройки бенчмарка, ревизии модели, доступ к инструментам и тестовые harnesses. Перед выбором модели соберите небольшой закрытый набор собственных задач и измерьте time-to-first-token, скорость генерации, корректность tool calls, поведение при восстановлении после ошибок и потребление памяти.

Что сейчас с API и инструментами

Сегодня к K2 Horizon проще обращаться через репозитории моделей и self-hosted-рантаймы, а не через зрелый и прозрачный рынок API. Практическим каталогом шести моделей семейства и их вариантов GGUF или других форматов служит коллекция K2 Horizon на Hugging Face.

В карточке 7B описан локальный OpenAI-совместимый способ запуска с BF16, reasoning_parser=k2_horizon, автоматическим выбором инструментов и tool-call parser k2_horizon. Для воспроизводимости вместо main также рекомендуется закреплять конкретную ревизию.

Безопасный первый тест выглядит так:

  1. Начните с официального репозитория 7B и закрепленной ревизии.
  2. Сначала запустите задокументированную конфигурацию vLLM или SGLang, не меняя длину контекста.
  3. Для сравнения качества используйте высокий reasoning effort, фиксируя при этом длину ответа и задержку.
  4. Проверьте реальные задачи программирования или использования инструментов, прежде чем оценивать 36B-A4B или 375B относительно вашего бюджета памяти и обслуживания.

Заявление о 512K не означает, что промпт на 512K будет быстрым, дешевым или полезным на вашей машине. Официальный пример vLLM для 7B начинается с 131,072 токенов, а для флагмана в текущем снимке Artificial Analysis нет публичных данных о скорости у провайдеров.

FAQ по моделям K2 Horizon

K2 Horizon действительно имеет открытый исходный код?

По данным IFM, веса моделей и код выпущены под Apache 2.0. У обучающих датасетов могут быть другие лицензии, поэтому перед коммерческим использованием проверяйте каждый репозиторий.

Какая модель K2 Horizon лучше подойдет для одной GPU или компактного локального запуска?

Используйте уровни по «сырым» весам из таблицы как отправную точку для планирования. Для 7B доступна наиболее полезная публичная документация по запуску; 36B-A4B — это эксперимент для более крупной рабочей станции или сервера, а не безопасное предположение для одной GPU.

K2 Horizon 36B-A4B быстрее 32B?

Одной маркировки 4B-active для такого вывода недостаточно. Реальная скорость зависит от бэкенда, квантования, пропускной способности памяти, длины контекста и размера батча.

Можно ли уже использовать K2 Horizon через API?

IFM называет партнеров по инференсу, но перед использованием в продакшене необходимо напрямую проверить доступность хостинга, цены и производительность.

Можно ли доверять опубликованным результатам SWE-bench и TerminalBench?

Считайте их условным свидетельством и проверяйте модель на собственных задачах, поскольку настройки и harnesses различаются.

Почему в карточке K2 Horizon 7B одновременно указаны 7B и 9B?

Карточка описывает модель как «7B-core» или относящуюся к классу 7B, тогда как метаданные Hugging Face показывают 9B parameters. Страница не объясняет это расхождение, поэтому для планирования ресурсов ориентируйтесь на фактический размер файлов репозитория.

Закрепите ревизию модели, зафиксируйте настройки контекста и reasoning, а затем измерьте один типичный рабочий процесс от начала до конца — и только после этого переходите на более крупный размер K2 Horizon.

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Claude Opus 5

Chat

Премиальная модель Claude для сложного анализа, программирования и профессиональной работы с длинным контекстом.

AnthropicСоздать API Key >

Gemini 3.7 Flash

Chat

Отзывчивая текстовая модель для ассистентов, помощи в кодировании, обработки документов и автоматизации.

GoogleСоздать API Key >

DeepSeek V4 Pro

Chat

DeepSeek V4 Pro для глубокого анализа кода, планирования архитектуры и технического анализа.

DeepseekСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicСоздать API Key >

Недавние статьи

Промокод OpenRouter (2026): как реально сэкономить

2026-09-05

GitHub HydraFusion Copilot CLI: как работает маршрутизация

2026-09-05

Обзор Grok Bot Haggle Bot: что он на самом деле умеет (2026)

2026-09-05

GitHub HydraFusion в Copilot CLI: как попробовать и чего ждать

2026-09-04
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Gemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 FlashGemini 3.1 Pro

AI-видео

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI-изображения

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.