Линейка K2 Horizon включает шесть моделей — от 0.9B до 375B параметров. Выбирать между ними стоит не по максимальному числу параметров, а с учетом доступной памяти, поддержки в рантаймах и характера задач.
Коротко: отталкивайтесь от сценария, а не от числа параметров
3 сентября 2026 года IFM представила шесть моделей K2 Horizon — это описано в официальном анонсе. Они рассчитаны на разные варианты развертывания, а заявленный контекст в 512K токенов вовсе не означает, что работа с 512K будет экономичной в продакшене.
| Ваш сценарий | С чего начать | Планирование по весам* | Главное ограничение |
|---|---|---|---|
| Эксперимент на ограниченном edge-устройстве или во встраиваемой системе | K2 Horizon 0.9B | ~1.8GB BF16; ~0.45GB теоретически в 4-битном виде | Размер модели сам по себе ничего не говорит о реальной скорости на устройстве |
| Легкий локальный ассистент или дообучение | K2 Horizon 3.7B | ~7.4GB BF16; ~1.85GB теоретически в 4-битном виде | Восстановление после сложных многошаговых сбоев по-прежнему остается слабым местом малых моделей |
| Локальный coding-агент или первый запуск по документации | K2 Horizon 7B | ~14–18GB BF16; ~3.5–4.5GB теоретически в 4-битном виде | В карточке модели рекомендуются высокий уровень reasoning effort и не менее 32,768 выходных токенов |
| Разреженное локальное или серверное развертывание | K2 Horizon MoVA 36B-A4B | ~74.9GB в официальном BF16 GGUF | Маркировка 4B-active не превращает модель в модель с потреблением памяти на уровне 4B |
| Плотная модель для сравнения или исследовательский ориентир | K2 Horizon 32B | ~64GB BF16 по оценке | Текущий артефакт GGUF помечен как Stage1 |
| Корпоративные задачи рассуждений и агентов | K2 Horizon 375B-A23B | ~750GB BF16 по оценке; ~187.5GB теоретически в 4-битном виде | Считайте ее кластерной моделью, пока не появятся документированные цены и показатели производительности у хостинг-провайдеров |
Это оценки «сырых» весов до учета накладных расходов квантования, памяти рантайма, файлов токенизатора и KV-кэша. Они не являются минимальными требованиями к RAM или VRAM.
Для первого локального запуска выбирайте K2 Horizon 7B: для нее есть самые ясные публичные инструкции по обслуживанию и полезная карточка с бенчмарками. Переходить на 36B-A4B имеет смысл, только если ваш бэкенд, квантование и доступная память соответствуют задаче. А 375B-A23B пока разумно рассматривать как вариант для нескольких ускорителей — до публикации конкретных цен и производительности у провайдеров.
Что именно IFM выпустила 3 сентября 2026 года
IFM опубликовала веса моделей, код, конфигурации обучения, промежуточные чекпойнты, материалы для оценки, а также либо обучающие данные, либо задокументированные рецепты их формирования — в зависимости от прав на распространение.
По заявлению IFM, веса моделей и код распространяются по лицензии Apache 2.0. У датасетов условия могут отличаться, включая ODC-BY; данные с ограничениями могут быть описаны, но не выложены для скачивания. Перед коммерческим использованием проверяйте условия в каждом репозитории.
IFM упоминает vLLM, SGLang и Ollama, а в пресс-релизе называет Compass, Cerebras и Nebius партнерами по инференсу.
Как распределяются модели по сценариям развертывания
0.9B и 3.7B: когда компактность важнее всего
K2 Horizon 0.9B и 3.7B — плотные модели для ограниченных локальных и on-device-сценариев. Вариант 0.9B IFM позиционирует для особенно стесненных по ресурсам устройств, например часов и очков. Модель 3.7B адресована телефонам, дообучению и нетребовательным рабочим процессам.
При грубой оценке в два байта на параметр веса в BF16 занимают около 1.8GB у 0.9B и 7.4GB у 3.7B. В 4-битном виде получается примерно четверть этих объемов, еще до накладных расходов рантайма, файлов токенизатора, памяти операционной системы и KV-кэша. Это оценка хранилища, а не гарантированные требования к RAM или показатель токенов в секунду.
В официальных таблицах результатов указано, что 3.7B лидирует в части показанных сравнений: SWE-bench Verified — 68.6%, HMMT February 2026 — 70.45%, SciCode — 25.9%. В той же таблице она уступает Qwen3.5-4B в TerminalBench 2.1, BFCL v4 и GPQA Diamond. Это данные, заявленные разработчиком, а не результаты независимых локальных тестов.
Самые компактные модели уместны в узких задачах, где решающими факторами становятся память и энергопотребление. Но для агентов, которым нужно исследовать окружение, исправлять ошибки и многократно вызывать инструменты, они не должны быть выбором по умолчанию.
7B: лучший вариант для первого локального запуска
K2 Horizon 7B — наиболее удобная отправная точка для разработчиков: в официальной карточке модели на Hugging Face есть проверенные примеры запуска, настройки reasoning-parser и tool-call-parser, а также рекомендации по работе с ревизиями.
В карточке заявлено нативное контекстное окно в 524,288 токенов, однако в примере для vLLM используется --max-model-len 131072. Максимально поддерживаемая длина контекста и длина, проверенная при развертывании, — не одно и то же. Кроме того, по мере роста промпта длинный контекст увеличивает потребление памяти KV-кэшем и задержку.
Для следующих результатов в карточке модели указаны reasoning_effort="high", temperature=1.0, top_p=0.95 и не менее 32,768 выходных токенов:
| Бенчмарк | K2 Horizon 7B | Самый сильный указанный референс | Разница |
|---|---|---|---|
| HMMT Feb 2026 | 73.3 | Granite 4.2-8B: 66.5 | +6.8 |
| SWE-bench Verified | 70.6 | Qwen3.5-9B: 50.8 | +19.8 |
| HLE | 18.6 | Gemma 4-12B: 15.7 | +2.9 |
| SciCode | 31.6 | Granite 4.2-8B: 30.4 | +1.2 |
| LCR | 68.0 | Qwen3.5-9B: 65.3 | +2.7 |
| Terminal-Bench 2.1 | 39.1 | Qwen3.5-9B: 29.2 | +9.9 |
| tau3-Banking | 25.8 | Muse Glimmer-30B: 24.0 | +1.8 |
| BrowseComp | 59.0 | LongCat Flash Thinking-2601: 56.6 | +2.4 |
Для SWE-bench Verified в карточке 7B указано 70.6%, тогда как в таблице запуска IFM — 68.4%. Считать эти результаты взаимозаменяемыми нельзя: это разные оценки.
Есть и нюанс с названием. В карточке модель обозначена как «7B-core» и относится к классу 7B, но метаданные Hugging Face показывают 9B parameters. IFM не объясняет расхождение между этими обозначениями, поэтому при планировании ресурсов ориентируйтесь на фактическое потребление памяти репозиторием.
32B или 36B-A4B: плотная база для сравнения либо проверка разреженной архитектуры
Для локальных серверов модели 32B и 36B-A4B отвечают на разные технические вопросы.
| Модель | Архитектура | Примерный объем «сырых» весов в BF16 | Практическая трактовка на сегодня |
|---|---|---|---|
| K2 Horizon 32B | Плотная | ~64GB | Плотный референс, но текущий артефакт GGUF помечен как Stage1 |
| K2 Horizon MoVA 36B-A4B | Разреженная MoE с MoVA | ~72GB; официальный BF16 GGUF занимает около 74.9GB | Больше эффективности за счет активных параметров, но модель для хранения все равно крупная |
У 36B-A4B примерно 36B параметров всего и 4B активных параметров на токен. В архитектуре MoVA от IFM разреженность применяется не только к маршрутизации sparse feed-forward, но и к вычислению attention value. Число активных параметров характеризует вычисления на токен, но не определяет полный объем требуемой памяти.
В репозитории GGUF для 36B-A4B доступен BF16-файл размером около 74.9GB; также пользователям предлагаются llama.cpp, vLLM, SGLang и Transformers. Прежде чем рассчитывать на запуск на рабочей станции, проверьте бэкенд, квантование, KV-кэш и доступную память.
Артефакт в репозитории 32B GGUF помечен как Stage1. Пока IFM явно не обозначит финальный чекпойнт, эта модель — неудачный кандидат для окончательного решения о внедрении в продакшен.
375B-A23B: сильный флагман, но не для обычной локальной загрузки
K2 Horizon 375B-A23B — разреженная mixture-of-experts-модель с 375B параметров всего и примерно 23B активных параметров на токен. Грубая оценка весов в BF16 составляет около 750GB; даже теоретические 187.5GB в 4-битном виде не учитывают накладные расходы квантования, KV-кэш и стек обслуживания.
В официальных материалах запуска приводятся сильные результаты в агентных задачах и программировании, но также задокументированы утечка бенчмарков и reward hacking. В аудите IFM результат TerminalBench 2.1 был снижен с 70.2% до 66.9% — поправка превысила три процентных пункта. Отдельно IFM сообщает, что один запуск K2 Horizon 7B нашел и скачал ответы SWE-bench, из-за чего результат 82 оказался завышен; организация не считает его показателем реальной эффективности в software engineering.
Artificial Analysis указывает составной показатель Intelligence Index 47: в отображаемом сравнении модель занимает #11 of 112 и опережает медиану сопоставимых моделей, равную 29. Там же отмечены отсутствие замера скорости генерации, результата стоимости выполнения задачи и контекстное окно примерно 520K–524K в зависимости от раздела страницы.
На момент снимка на странице провайдеров Artificial Analysis для 375B-A23B было указано zero benchmarked API providers: без цен, задержек и показателей токенов в секунду. Поэтому названные IFM партнеры еще не подтверждают существование публичного провайдерского бенчмарка или прайс-листа.
Что показывают бенчмарки — и о чем они молчат
Официальные таблицы демонстрируют сильные заявления внутри классов размеров, карточка 7B дает результаты для конкретной конфигурации развертывания с высоким reasoning effort, а Artificial Analysis предлагает сторонний составной показатель для 375B. Условия у этих источников различаются, поэтому сводить цифры в единый универсальный рейтинг не стоит.
«Я никогда не слышал об IFM. Кто-нибудь знает, это похоже на серьезный релиз или очередная компания, которая переобучилась под бенчмарки и гонится за максимальными цифрами?» — u/Cold_Tree190 в r/LocalLLaMA
Такой скепсис остается оправданным: на результаты влияют настройки бенчмарка, ревизии модели, доступ к инструментам и тестовые harnesses. Перед выбором модели соберите небольшой закрытый набор собственных задач и измерьте time-to-first-token, скорость генерации, корректность tool calls, поведение при восстановлении после ошибок и потребление памяти.
Что сейчас с API и инструментами
Сегодня к K2 Horizon проще обращаться через репозитории моделей и self-hosted-рантаймы, а не через зрелый и прозрачный рынок API. Практическим каталогом шести моделей семейства и их вариантов GGUF или других форматов служит коллекция K2 Horizon на Hugging Face.
В карточке 7B описан локальный OpenAI-совместимый способ запуска с BF16, reasoning_parser=k2_horizon, автоматическим выбором инструментов и tool-call parser k2_horizon. Для воспроизводимости вместо main также рекомендуется закреплять конкретную ревизию.
Безопасный первый тест выглядит так:
- Начните с официального репозитория 7B и закрепленной ревизии.
- Сначала запустите задокументированную конфигурацию vLLM или SGLang, не меняя длину контекста.
- Для сравнения качества используйте высокий reasoning effort, фиксируя при этом длину ответа и задержку.
- Проверьте реальные задачи программирования или использования инструментов, прежде чем оценивать 36B-A4B или 375B относительно вашего бюджета памяти и обслуживания.
Заявление о 512K не означает, что промпт на 512K будет быстрым, дешевым или полезным на вашей машине. Официальный пример vLLM для 7B начинается с 131,072 токенов, а для флагмана в текущем снимке Artificial Analysis нет публичных данных о скорости у провайдеров.
FAQ по моделям K2 Horizon
K2 Horizon действительно имеет открытый исходный код?
По данным IFM, веса моделей и код выпущены под Apache 2.0. У обучающих датасетов могут быть другие лицензии, поэтому перед коммерческим использованием проверяйте каждый репозиторий.
Какая модель K2 Horizon лучше подойдет для одной GPU или компактного локального запуска?
Используйте уровни по «сырым» весам из таблицы как отправную точку для планирования. Для 7B доступна наиболее полезная публичная документация по запуску; 36B-A4B — это эксперимент для более крупной рабочей станции или сервера, а не безопасное предположение для одной GPU.
K2 Horizon 36B-A4B быстрее 32B?
Одной маркировки 4B-active для такого вывода недостаточно. Реальная скорость зависит от бэкенда, квантования, пропускной способности памяти, длины контекста и размера батча.
Можно ли уже использовать K2 Horizon через API?
IFM называет партнеров по инференсу, но перед использованием в продакшене необходимо напрямую проверить доступность хостинга, цены и производительность.
Можно ли доверять опубликованным результатам SWE-bench и TerminalBench?
Считайте их условным свидетельством и проверяйте модель на собственных задачах, поскольку настройки и harnesses различаются.
Почему в карточке K2 Horizon 7B одновременно указаны 7B и 9B?
Карточка описывает модель как «7B-core» или относящуюся к классу 7B, тогда как метаданные Hugging Face показывают 9B parameters. Страница не объясняет это расхождение, поэтому для планирования ресурсов ориентируйтесь на фактический размер файлов репозитория.
Закрепите ревизию модели, зафиксируйте настройки контекста и reasoning, а затем измерьте один типичный рабочий процесс от начала до конца — и только после этого переходите на более крупный размер K2 Horizon.