Thinking Machines Inkling: 975B, открытая и сложная в запуске

Последнее обновление: 2026-07-16 10:39:21

Thinking Machines Inkling — это модель с открытыми весами на 975 миллиардов параметров, выпущенная 15 июля 2026 года, построенная как sparse mixture-of-experts, которая активирует только 41B параметров на токен и принимает на вход текст, изображение и аудио. Она распространяется под Apache-2.0, так что вы можете скачать полные веса и дообучать их в коммерческих целях. Загвоздка в том, что даже 4-bit quant требует примерно 600GB VRAM, так что это модель, которую команды оценивают на кластере, а не что-то, что вы запускаете на gaming GPU.

Характеристики и то, в чём заголовки ошиблись

Вот что указано на карточке модели Hugging Face и на официальной странице Inkling (доступно 16 июля 2026 года).

СпецификацияInkling
Общее количество параметров975B
Активные параметры41B на токен
Архитектура66-слойный decoder-only, sparse MoE (256 экспертов, 6 routed + 2 shared)
МодальностиТекст, изображение, аудио на входе; текст на выходе (UTF-8)
Данные для обучения45 триллионов токенов
ЛицензияApache-2.0
ЗагрузкаHugging Face (thinkingmachines/inkling)

Нужно исправить три момента, которые циркулируют в освещении запуска:

  • Контекстное окно. В нескольких материалах упоминалось окно в 1M токенов. На официальной странице Inkling указано 64K по умолчанию и 256K при запуске через платформу Tinker; на карточке Hugging Face число вообще не указано. Считайте 64K/256K подтверждёнными значениями, а 1M — неподтверждённым.
  • Лицензия. Подтверждена Apache-2.0, одна из самых разрешительных лицензий, и она допускает коммерческое использование. Thinking Machines перекладывает ответственность за безопасность fine-tuning на вас.
  • "Inkling-Small." В некоторых отчётах упоминался меньший вариант с примерно 12B активных параметров, но на карточке модели Hugging Face он не указан. Пока он там не появится, не рассчитывайте на него.

Что на самом деле означает здесь «975B параметров»

Inkling направляет каждый токен к 6 из 256 экспертов плюс 2 общих эксперта, поэтому одновременно активируется лишь около 41 млрд параметров, хотя весь пул составляет 975 млрд. Именно поэтому Thinking Machines утверждает, что он сопоставим с Nvidia's Nemotron 3 Ultra в задачах кодинга, при этом тратя примерно на треть меньше токенов для достижения этого результата: вы получаете широту возможностей большой модели при стоимости инференса модели среднего размера.

Inkling также предлагает регулятор "thinking effort". Увеличьте его для более сложных задач и примите более медленные, более вдумчивые ответы, или уменьшите его ради скорости. Он обучен отмечать неопределённость вместо того, чтобы гадать, что важнее для базы fine-tuning, чем для потребительского чат-бота.

Можете ли вы действительно запустить Inkling?

Вот где ярлык «open weights» становится сложным, потому что open не означает лёгкий. Вот примерно что требуется, чтобы обслуживать полную модель 975B, исходя из model card и ранних оценок сообщества (это ориентировочные значения, а не гарантии):

Approximate VRAM required to run Inkling at different quantization levels
  • BF16 (полная точность): ~2TB VRAM только для весов, так что потребуется 16+ GPU класса H200 или узел с 8 GPU B300, прежде чем учитывать накладные расходы на обслуживание.
  • NVFP4 / 4-bit: ~600GB, всё ещё уровень многопроцессорного серверного развертывания (примерно 4× H200 или 8× карт по 80GB).
  • 1-2 bit GGUF (llama.cpp / Unsloth quants): ~280-350GB суммарно RAM+VRAM, достижимо на высокопроизводительной рабочей станции или полностью укомплектованном Mac Studio Ultra, и медленнее при переходе к длинному контексту, поскольку растёт KV cache.

Честно говоря: хорошо финансируемая команда может оценить и дообучить Inkling, но сегодня нет способа запускать его локально на потребительском GPU. Если вы независимый разработчик, который надеется загрузить его на одну карту с 24 ГБ памяти, это не ваша модель. Вы можете скачать его с Hugging Face по адресу thinkingmachines/inkling или дообучить через платформу Tinker от Thinking Machines, которая также открывает доступ к контексту 256K.

Где Inkling находится по сравнению с другими моделями

Thinking Machines прямо говорит, что Inkling — не самая сильная доступная модель, и карточка модели подтверждает это бенчмарками: Inkling показывает хорошие результаты, но уступает закрытому передовому уровню в рассуждениях и программировании.

Inkling benchmark scores compared with the best rival on each test
БенчмаркInklingЛучший упомянутый конкурент
AIME 202697.1%GPT 5.6 Sol, 99.9%
SWE-bench Verified77.6%Claude Fable 5, 95.0%
MMMU Pro73.3%Claude Fable 5, 84.2%
VoiceBench91.4%Gemini 3.1 Pro, 94.3%

*Источник: карточка модели Inkling и официальная страница бенчмарка, доступ к которым был получен 16 июля 2026 г.*

Официальная радиальная диаграмма визуально рассказывает ту же историю. Inkling уверенно держится на задачах рассуждения и мультимодальных задачах, но уступает GPT 5.6 Sol и Claude Fable 5 в агентном кодинге (SWE-bench Pro, Terminal Bench).

Official Inkling benchmark radar comparing it with GPT 5.6 Sol and Claude Fable 5

Его сильная сторона — широта возможностей: нативная работа с аудио и изображениями в одной открытой модели, при этом разрыв в кодинге можно сократить с помощью fine-tuning. Если вам нужно лучшее из коробки agentic coding, закрытая frontier-модель по-прежнему выигрывает. Если вам нужна открытая мультимодальная базовая модель, которой вы владеете, Inkling — более интересный вариант.

Для кого на самом деле предназначен Inkling

Inkling — это основа для дальнейшей работы, а не готовый ассистент. Thinking Machines зарабатывает на Tinker, своей платформе для fine-tuning, а не на тарифицируемых API-вызовах, поэтому сама модель бесплатна, а идея звучит так: «возьмите это и специализируйте под свои задачи».

Самым наглядным доказательством служит Bridgewater Associates: по данным Thinking Machines, финансово адаптированная версия модели набрала 84,7% в тесте компании на логическое мышление при примерно в четырнадцать раз меньшей стоимости, чем у проприетарной модели. Именно для этого она и предназначена: способный универсальный инструмент, который команда адаптирует под конкретную область.

Так что это хороший вариант, если у вас есть инфраструктура и экспертиза в fine-tuning, чтобы специализировать open model и владеть результатом, а также если вы готовы взять на себя ответственность за safety tuning. Пропустите его, если вам нужен готовый chatbot «из коробки» или вы работаете на consumer hardware, потому что общедоступные closed models дешевле в освоении и сильнее с первого дня. Один важный нюанс: post-training Inkling использовал data, сгенерированные другими open models, включая Moonshot's Kimi K2.5, а Thinking Machines сообщает, что следующее поколение будет полностью self-trained.

Часто задаваемые вопросы об Inkling

Бесплатно ли использовать Inkling в коммерческих целях?

Да. Он распространяется под лицензией Apache-2.0, которая разрешает коммерческое использование и модификацию. Вы несете ответственность за любую донастройку безопасности перед его развертыванием.

Где я могу скачать Inkling?

Полные веса доступны на Hugging Face по адресу thinkingmachines/inkling. Квантованные сборки GGUF от сообщества также доступны там.

Действительно ли у Inkling есть контекстное окно в 1 млн токенов?

На официальной странице по умолчанию указано 64K, а через платформу Tinker — 256K. Значение 1M в некоторых публикациях не подтверждено на model card, поэтому ориентируйтесь на 64K/256K.

Inkling против DeepSeek или Qwen — что лучше?

Это зависит от задачи, а не от одного показателя. Преимущество Inkling — нативный мультимодальный ввод (текст, изображение, аудио) в одной модели Apache-2.0 плюс путь дообучения Tinker; ведущие китайские open models по-прежнему остаются сильными вариантами для общих задач и программирования. Проверьте их на своей задаче, прежде чем принимать решение.

Что такое Tinker, и нужен ли он мне?

Tinker — это размещенная платформа тонкой настройки от Thinking Machines. Она не нужна для запуска открытых весов, но это официальный способ настройки Inkling, и она увеличивает размер контекстного окна до 256K.

---

Связанное чтение