AIREITER

Nemotron 3.5 Lightning: 30B MoE для быстрых AI-агентов

Последнее обновление: 2026-08-11 19:04:31

Nemotron 3.5 Lightning не пытается стать лучшей универсальной моделью своего класса — и в этом её смысл. В собственных бенчмарках NVIDIA она уступает Qwen 3.6 35B-A3B в 11 из 12 тестов, зато заявляет генерацию токенов до 4 раз быстрее. Это MoE-модель на 30B параметров, где для каждого токена задействуются лишь 3B: она рассчитана на повторяющиеся этапы агентных пайплайнов, в которых скорость и стоимость важнее предельного качества рассуждений. Нужно учитывать и требования к железу: BF16-веса требуют GPU с 80 GB памяти, а для продакшена NVIDIA рекомендует чекпойнт NVFP4.

Чем Nemotron 3.5 Lightning отличается от других моделей на 30B

В основе Nemotron 3.5 Lightning лежит гибридная архитектура: слои state-space Mamba-2 чередуются с маршрутизацией MoE и выборочными слоями attention. NVIDIA обозначает эту комбинацию тегом nemotron_h. Mamba-2 снижает затраты памяти и вычислений, характерные для attention на длинном контексте. Благодаря этому Lightning поддерживает контекст до 1M токенов; на одной H100 80GB практический предел составляет 256K, согласно карточке модели. У чисто attention-архитектуры такая длина контекста обошлась бы значительно дороже из-за квадратичного роста вычислений.

ХарактеристикаЗначение
Всего параметров30B
Активных параметров на токен3B
АрхитектураГибрид Mamba-2 + MoE + Attention
Длина контекстаДо 1M токенов (256K на одной H100)
Варианты точностиBF16, NVFP4
ЛицензияOpenMDW v1.1 (разрешено коммерческое использование)
ЯзыкиАнглийский, испанский, французский, немецкий, итальянский, японский + программирование
Корпус предобучения20T+ токенов
Режим рассужденийВключается через enable_thinking в chat template
Рекомендуемые параметры семплированияTemperature 1.0, top-p 0.95

NVIDIA называет Lightning самой компактной моделью семейства Nemotron 3. Её специально обучали поведению в агентной обвязке: вызовам инструментов, проверке результатов, форматированию ответа и делегированию подагентам. Сложное планирование остаётся за продвинутой reasoning-моделью наподобие Nemotron 3 Ultra, а Lightning берёт на себя рутинное исполнение, которое иначе расходовало бы токеновый бюджет дорогой модели.

Бенчмарки: в чём Lightning сильна, а в чём уступает

В карточке модели на HuggingFace опубликованы 14 строк бенчмарков, где Lightning сопоставляют с Qwen 3.6 35B-A3B, Gemma 4 26B-A4B, Nemotron 3 Nano/Super и GPT-OSS 20B. Ниже — 10 наиболее важных для выбора модели результатов.

Сравнение бенчмарков Nemotron 3.5 Lightning, Qwen 3.6, Gemma 4 и GPT-OSS по пяти ключевым тестам
БенчмаркNemotron 3.5 LightningQwen 3.6 35B-A3BGemma 4 26B-A4BGPT-OSS 20B
MMLU Pro81.9485.6385.2076.40
GPQA Diamond (без инструментов)75.4483.4079.6171.46
SWE-bench Verified51.5670.1257.4052.44
SWE-bench Multilingual39.3363.4043.4041.93
Terminal-Bench 2.124.5844.3837.2215.17
PinchBench85.3788.0774.7057.20
BrowseComp36.9748.7426.30-
IFBench (loose)71.8863.7177.2568.50
AA-LCR52.0061.0657.5632.88
SciCode32.6035.3340.2838.63

В 11 из 12 сопоставимых строк Lightning проигрывает Qwen 3.6 35B-A3B. Исключение — IFBench, оценивающий следование инструкциям в режиме loose: 71.88 против 63.71 у Qwen, преимущество в 8 пунктов. Это хорошо соответствует позиционированию модели для агентного исполнения: при форматировании tool calls и проверке результатов соблюдение инструкций может быть важнее, чем максимальная глубина рассуждений.

Главный аргумент Lightning — скорость. В тесте NVIDIA PinchBench, где 10 000 агентных задач измеряются в GPU-часах H100, модель выполняет нагрузку примерно за 16.5 GPU-часа с точностью 86%. Qwen 3.6 35B требуется 23.5–24 GPU-часа при точности 87%, а Gemma 4 26B — 25–26 GPU-часов при 73%:

Диаграмма PinchBench: точность агентов и GPU-часы на 10 000 задач

То есть при почти одинаковой точности требуется примерно на 30% меньше вычислений. Если вы оплачиваете GPU-часы и прогоняете 10 000 агентных шагов, разница становится существенной. NVIDIA также указывает скорость порядка 670 выходных токенов в секунду и около 23–24 пунктов Intelligence Index в рейтинге Artificial Analysis. Это выводит Lightning на границу Парето среди моделей с открытыми весами и суммарным числом параметров менее 40B.

Пользовательские тесты на r/LocalLLaMA показывают схожую картину. Владелец DGX Spark сообщил о 78.5 токена/с при target-only генерации и 90.7 токена/с со speculative decoding на чекпойнте NVFP4. Другой участник основной ветки обсуждения оценил качество Lightning как «между Gemma 4 26B и 31B, но заметно ближе к 26B». По его словам, модель работает примерно в 2 раза быстрее Gemma 31B, однако генерирует много thinking-токенов, что на практике частично съедает выигрыш. Ранние конверсии GGUF Q4 занимают около 25 GB и выдают предупреждения о неиспользуемых тензорах — вероятно, гибридная архитектура Mamba-2 пока поддерживается не всеми инструментами на базе GGUF.

Какое железо нужно и как запустить модель локально

Чекпойнт BF16 с эталонными полноточными весами требует для запуска на одной видеокарте 1x H100 80GB или 1x A100 80GB. Размер шардированного файла safetensors — 65.8 GB. Для продакшен-инференса NVIDIA прямо рекомендует отдельный релиз NVFP4.

ЧекпойнтПримерный размер файлаМинимальная GPUОптимальный сценарий
BF1665.8 GB1x H100/A100 80GBДообучение, исследования, создание квантованных вариантов
NVFP4~16 GBRTX 5090, DGX Spark, Jetson (Blackwell/Hopper/Ampere)Продакшен-инференс, развёртывание агентов
GGUF Q4~25 GB16 GB+ VRAM (собрано сообществом)llama.cpp, Ollama, LM Studio

Для поддержки с первого дня NVIDIA работала с четырьмя проектами локального сервинга: vLLM, SGLang, Ollama и llama.cpp. Также упоминаются LM Studio и Unsloth. Модель поддерживает три стратегии speculative decoding:

  • DSpark — рекомендуемый вариант для DGX Spark и дата-центрового инференса с низкой конкуренцией запросов
  • DFlash — альтернативная draft-модель; выбор зависит от нагрузки
  • MTP (Multi-Token Prediction) — встроен в модель и лучше всего подходит для средней и высокой конкуренции запросов

Если локального железа нет, Lightning доступна через build.nvidia.com как микросервис NIM, а также на OpenRouter. Чекпойнт NVFP4 запускается на GeForce RTX 5090, DGX Spark, OEM-системах GB10 и NVIDIA Jetson.

Как Lightning встраивается в агентный пайплайн

Открытая библиотека маршрутизации NVIDIA NeMo Switchyard подбирает модель для каждого этапа агентного workflow с учётом точности, скорости и стоимости. Планирование направляется в reasoning-модель верхнего уровня, а выполнение — в Lightning. Во внутреннем бенчмарке NVIDIA Switchyard, по заявлению компании, сохранил «уровень выполнения задач, сопоставимый с frontier-моделями», при стоимости около одной трети от использования только Opus 4.8. Lightning берёт на себя такие действия, как git pull, проверка ответов инструментов, форматирование результатов и типовые API-вызовы.

Есть и практический пример. CodeRabbit опубликовала кейс на Reddit: компания дообучила Nemotron 3.5 Lightning для маршрутизации задач code review, используя целевой SFT и RLVR (reinforcement learning with verifiable rewards). На зафиксированной оценке из 1 000 задач модель превзошла их базовый вариант, а обучение обошлось менее чем в $100. Для такого процесса NVIDIA предлагает NeMo Automodel и NeMo Megatron Bridge для LoRA/SFT, NeMo RL и NeMo Gym для обучения с подкреплением, а также открытый датасет Nemotron-RL Agentic Terminal Pivot.

Для команд, создающих агентные пайплайны, вопрос сводится к следующему: можно ли дообучить Lightning так, чтобы она выполняла основную массу агентных шагов с затратами модели на 3B активных параметров, а frontier-модель подключалась лишь к немногим действительно сложным этапам?

Стоит ли выбирать Nemotron 3.5 Lightning

СценарийРекомендацияПричина
Маршрутизация большого потока агентных задач: tool calls, валидация, форматированиеLightning NVFP43B активных параметров, скорость токенов в 4 раза выше, ~30% меньше вычислений при схожей точности
Универсальный помощник для программированияQwen 3.6 35B-A3B70.12 против 51.56 на SWE-bench Verified — разрыв 19 пунктов
Сложные рассуждения и планированиеNemotron 3 Ultra или frontier-модельLightning прямо не позиционируется как модель для планирования
Локальный чат на одной потребительской GPULightning NVFP4 на RTX 5090Работает, но конверсии GGUF пока сырые; vLLM/SGLang надёжнее
Дообучение под узкую агентную задачуLightning BF163B активных параметров = дешевле дообучать; OpenMDW v1.1 разрешает коммерческое использование
Массовое следование инструкциямLightningIFBench: 71.88 против 63.71 у Qwen — преимущество 8 пунктов

Lightning меняет пиковую точность на скорость при массовом исполнении. Экономия 30% вычислений накапливается за сотни агентных шагов в одной сессии, однако модель вышла 11 августа 2026 года, и экосистема вокруг неё ещё развивается. Гибридная архитектура Mamba-2 означает, что инструменты на базе GGUF могут пока поддерживать её не полностью. На оборудовании NVIDIA с vLLM или SGLang наиболее безопасный путь развёртывания сегодня — чекпойнт NVFP4. Для Apple Silicon или конфигураций, где доступен только GGUF, лучше дождаться стабилизации конверсий силами сообщества.

Частые вопросы

Можно ли запустить Nemotron 3.5 Lightning на потребительском железе?

Для потребительского оборудования NVIDIA поддерживает только чекпойнт NVFP4. Веса BF16 требуют GPU с 80GB памяти — H100 или A100. NVFP4 работает на GeForce RTX 5090, DGX Spark и NVIDIA Jetson. Для llama.cpp и Ollama существуют собранные сообществом варианты GGUF Q4, рассчитанные на системы с 16 GB+ VRAM, но в ранних сборках сообщали о проблемах с неиспользуемыми тензорами, связанными с гибридной архитектурой Mamba-2.

Как Nemotron 3.5 Lightning соотносится с Qwen 3.6 35B?

Qwen 3.6 35B-A3B превосходит Lightning в 11 из 12 опубликованных бенчмарков; самые большие разрывы заметны в SWE-bench Verified и Terminal-Bench. Lightning выигрывает в IFBench на следовании инструкциям и выполняет агентные задачи примерно на 30% быстрее при сопоставимой точности. Qwen сильнее как универсальная модель, а Lightning лучше подходит для быстрого агентного исполнения.

Подходит ли Nemotron 3.5 Lightning для программирования?

Если смотреть только на бенчмарки кода — нет: в SWE-bench Verified у Lightning 51.56 против 70.12 у Qwen 3.6. Но CodeRabbit успешно дообучила Lightning для маршрутизации code review менее чем за $100 и превзошла свой базовый вариант. Модель рассчитана на кастомизацию: после дообучения под соглашения конкретной кодовой базы она может выполнять рутинные задачи с затратами уровня 3B активных параметров.

Какая лицензия у Nemotron 3.5 Lightning?

Модель выпущена по лицензии OpenMDW v1.1 (Open Model Data Weight), которую NVIDIA описывает как максимально разрешительную. Она допускает коммерческое использование, включая веса, обучающие данные и рецепты. Полные условия лицензии приведены в карточке модели на HuggingFace.