AIREITER

Руководство по Nemotron 3 Ultra API: бесплатный доступ, лимиты и настройка

Последнее обновление: 2026-09-19 01:36:22

Контекст на миллион токенов и endpoint с ценой $0 выглядят как веская причина сразу выбрать Nemotron 3 Ultra. Но для продакшена этого недостаточно: бесплатный маршрут годится для оценки модели, а рабочий сервис потребует надежного провайдера, продуманной обработки данных и платного резервного варианта.

Nemotron 3 Ultra free API listing on OpenRouter

Стоит ли использовать Nemotron 3 Ultra API?

Nemotron 3 Ultra API имеет смысл протестировать для долго работающих текстовых агентов, анализа больших документов и задач программирования, которым помогает очень длинный контекст. В качестве универсального API для обычного чата с низкой задержкой он подходит хуже. То же касается конфиденциальных запросов через публичный бесплатный endpoint и продакшен-сервисов без резервного маршрута.

NVIDIA выпустила Nemotron 3 Ultra 4 июня 2026 года. В официальной карточке модели NVFP4-чекпойнт обозначен как версия 1.0 GA и распространяется для коммерческого и некоммерческого использования по лицензии OpenMDW 1.1.

Что важно для решенияПроверенное значениеПочему это важно
Размер модели550B всего, 55B активноРазреженные вычисления не делают полный набор весов маленьким
Максимальный контекстДо 1M токеновУ конкретного маршрута лимит провайдера может быть ниже
МодальностьТекстовый ввод и выводПонимания изображений и видео нет
Официальный NVFP4 SWE-Bench Verified69.7Важный показатель для оценки кодинг-агентов
Официальный NVFP4 RULER 1M94.0Поддерживает сценарии с длинным контекстом
Бесплатная цена в OpenRouter$0 за ввод, $0 за выводПодходит для тестов, но не является SLA
Снимок доступности OpenRouter84.07% успешных запросов за три дняДоступность endpoint не всегда означала успешное выполнение
Официальный минимум для самостоятельного запуска4x B200-класса или 8x H100Обычным рабочим компьютером здесь не обойтись

Приведенные выше результаты бенчмарков взяты из карточки модели NVIDIA и отражают данные первого источника. Доступность в OpenRouter — это динамический показатель провайдера, а не постоянная гарантия.

Как вызвать бесплатный Nemotron 3 Ultra API за пять минут

Самый быстрый бесплатный вариант — совместимый с OpenAI endpoint chat-completions в OpenRouter и точный идентификатор модели nvidia/nemotron-3-ultra-550b-a55b:free. Создайте ключ OpenRouter, храните его в переменной окружения и сначала отправьте небольшой тестовый запрос — не начинайте сразу с задачи на длинном контексте.

  1. Создайте API-ключ в OpenRouter.
  2. Экспортируйте его в переменную OPENROUTER_API_KEY.
  3. Отправьте запрос на /api/v1/chat/completions, указав бесплатный идентификатор модели.
  4. Во время оценки записывайте HTTP-статус, задержку и пустые ответы.
  5. До выхода в продакшен добавьте платный маршрут или другую модель.
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b:free",
    "messages": [
      {
        "role": "user",
        "content": "Return three risks in this migration plan as a numbered list."
      }
    ],
    "max_tokens": 500
  }'

Тот же маршрут можно использовать через клиент OpenAI для Python — достаточно изменить base_url и model:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra-550b-a55b:free",
    messages=[
        {
            "role": "user",
            "content": "Inspect this plan and list the three highest-impact risks.",
        }
    ],
    max_tokens=500,
)

print(response.choices[0].message.content)

На что действительно можно рассчитывать в бесплатном маршруте

Бесплатный маршрут Nemotron 3 Ultra не обещает ни неограниченной пропускной способности, ни доступности уровня продакшена. В карточке OpenRouter бесплатные endpoint помечены как ограниченные по частоте запросов, но точная квота на странице модели не указана. В снимке от 19 сентября доступность составляла 100%, однако за три дня успешными были только 84.07% запросов: ошибки и пустые ответы учитывались как сбои.

В том же снимке OpenRouter указывал контекст на 1M токенов, максимальный ответ на 65,536 токенов, поддержку вызова инструментов, медианную задержку 2.28 секунды и медианную скорость 29 токенов в секунду.

Есть и ограничение, зависящее от конкретного провайдера: бесплатный маршрут OpenRouter поддерживал tools и tool_choice, но не обеспечивал принудительное соблюдение response_format. В платном маршруте Segmind заявлен вывод по JSON Schema — $0.625 за миллион входных токенов и $2.75 за миллион выходных токенов. Если код рассчитывает на строгий JSON, проверяйте именно выбранного провайдера, а не делайте выводы по возможностям базовой модели.

Не отправляйте конфиденциальные или персональные данные через бесплатный маршрут OpenRouter. В его описании сказано, что запросы журналируются в целях безопасности и могут использоваться для улучшения продуктов и сервисов NVIDIA. При 429, тайм-ауте или пустом ответе применяйте ограниченный экспоненциальный backoff, а затем переключайтесь на платный маршрут. Бесконечно повторять действие агента нельзя.

Что на практике меняет конфигурация 550B A55B

Обозначение 550B-A55B означает, что Nemotron 3 Ultra содержит 550 миллиардов параметров, но для каждого токена активирует примерно 55 миллиардов. NVIDIA использует маршрутизацию LatentMoE, Mamba-2, отдельные слои внимания и Multi-Token Prediction. Разреженная активация сокращает вычисления на токен, но все веса по-прежнему нужно хранить, распределять между ускорителями или выгружать. Поэтому A55B — это не модель, которую можно развернуть как обычную 55B.

В исследовательском релизе NVIDIA заявляет контекст до 1M токенов и сравнивает пропускную способность на необычном сценарии: 8,000 входных токенов и 64,000 выходных. По данным NVIDIA, модель обеспечивает в 5.9 раза большую пропускную способность, чем GLM-5.1-754B-A40B, в 4.8 раза большую, чем Kimi-K2.6-1T-A32B, и в 1.6 раза большую, чем Qwen-3.5-397B-17B. Абсолютные значения пропускной способности и конфигурация оборудования не указаны, поэтому превращать эти множители в прогноз задержки API не стоит.

Для выбора конфигурации полезнее официальная таблица BF16/NVFP4:

БенчмаркBF16NVFP4Практический вывод
SWE-Bench Verified71.969.7Квантизация отнимает 2.2 балла в этом тесте программирования
Terminal Bench 2.156.453.9В агентских терминальных задачах результат тоже снижается
TauBench V3 average70.970.3Средний результат в работе с инструментами остается близким
GPQA, без инструментов87.087.9NVFP4 не во всех задачах слабее
RULER 1M94.794.0Извлечение данных из длинного контекста остается на близком уровне
OmniScience non-hallucination78.775.5Проверки фактической точности по-прежнему необходимы

Разница зависит от задачи: NVFP4 теряет 3.2 балла в тесте на отсутствие галлюцинаций, но получает 0.9 балла в GPQA.

Выбирайте модель под задачу, а не по числу параметров

Nemotron 3 Ultra стоит сравнивать с DeepSeek V4, GLM 5.2 и Qwen 3.8 Max на том рабочем сценарии, который вы собираетесь запускать, а не по размеру моделей. В рамках этого материала нет результатов, полученных на одном и том же стенде, которые подтверждали бы универсального победителя. Поэтому надежный подход — составить план тестирования и заранее проверить ограничения каждого варианта.

ЗадачаС чего начатьЧто проверить перед выбором
Извлечение данных из документов на миллион токенов или их синтезNemotron 3 UltraОфициальный NVFP4 RULER 1M — 94.0; проверьте точность извлечения и задержку prefill на реальной длине запроса
Долго работающий кодинг-агентNemotron 3 Ultra или DeepSeek V4Nemotron набирает 69.7 в SWE-Bench Verified и 53.9 в Terminal Bench 2.1; сравните успешность задач в репозитории и корректность вызовов инструментов на одном стенде
Автоматизация со структурированным выводомGLM 5.2, Qwen 3.8 Max или провайдер Nemotron с поддержкой схемБесплатный OpenRouter не обеспечивает response_format; измерьте соблюдение схемы и число повторных запросов на конкретном маршруте
Большой поток коротких запросовDeepSeek V4, GLM 5.2 или Qwen 3.8 MaxСравните стоимость успешной задачи и p95-задержку: масштаб Ultra не делает модель автоматически выгодной
Развертывание открытой модели на оборудовании NVIDIANemotron 3 UltraСравните BF16 и NVFP4 на целевой задаче, а затем посчитайте устойчивую загрузку оборудования

У DeepSeek V4 и GLM 5.2 есть отдельные API на AIReiter, а Qwen 3.8 Max доступна как размещенная чат-модель: руководство по DeepSeek V4 Pro API, обзор GLM 5.2 API и цены на Qwen 3.8 Max API. Это альтернативы для оценки, а не утверждение, что одна модель лучше на любой задаче.

Можно ли запустить Nemotron 3 Ultra локально?

Nemotron 3 Ultra можно развернуть самостоятельно, но «локально» здесь означает оборудование дата-центра или DGX Station, а не ноутбук. NVIDIA указывает 4x GB200, 4x B200, 4x GB300, 4x B300 или 8x H100 как минимальные конфигурации для стандартного сценария запуска.

В официальных примерах vLLM в карточке модели NVIDIA используются тензорный и экспертный параллелизм 4-way, FP8 KV-кэш, поэтапный prefill и спекулятивное декодирование MTP. В стандартном примере по умолчанию задано 262,144 токена; для включения 1,048,576 токенов требуется явно изменить параметр. Поэтому заявленный максимальный контекст не является настройкой по умолчанию.

NVIDIA также описывает специальное развертывание на одной DGX Station. NVFP4-чекпойнт запускается на одном интегрированном GPU GB300, которому доступно до 150 GiB общей памяти CPU; веса экспертов при этом выгружаются. Для такого сценария нужны vLLM 0.22.0, специализированный NVFP4-бэкенд для Blackwell и архитектура памяти DGX Station. На обычный ПК с одной видеокартой этот рецепт не переносится.

Вариант развертыванияКогда выбиратьГлавное ограничение
Бесплатный API OpenRouterДля оценки промптов и поведения инструментовЛимиты частоты, журналирование и нестабильная доступность
Платный размещенный APIДля запуска продукта до того, как объем использования оправдает покупку оборудованияРазличия в цене провайдера, точности, контексте и возможностях
Самостоятельный запуск на 4x B200-класса / 8x H100Когда важны стабильный объем, контроль над данными или кастомизация моделиКапитальные затраты и эксплуатация распределенного инференса
Одна DGX Station GB300 с выгрузкой весовЕсли у вас есть именно такая система с общей памятьюЗадержка из-за выгрузки и привязка к конкретному оборудованию

Частые вопросы о Nemotron 3 Ultra API

Nemotron 3 Ultra API бесплатен?

Да. OpenRouter указывает для nvidia/nemotron-3-ultra-550b-a55b:free цену $0 за входные и выходные токены, но endpoint ограничен по частоте запросов, а обращения журналируются.

Действительно ли Nemotron 3 Ultra поддерживает миллион токенов?

NVIDIA указывает максимум в 1M токенов, однако у маршрутов провайдеров настройки по умолчанию могут быть ниже. В примере NVIDIA для vLLM по умолчанию используется 262,144 токена, а 1,048,576 нужно включать отдельно.

Поддерживает ли API инструменты и структурированный JSON?

Модель поддерживает инструменты, но принудительное соблюдение формата зависит от провайдера: в бесплатном OpenRouter нет обязательного response_format, тогда как Segmind заявляет строгую поддержку JSON Schema.

Можно ли использовать Nemotron 3 Ultra в коммерческих проектах?

NVIDIA указывает, что релиз по OpenMDW 1.1 разрешает коммерческое и некоммерческое использование. Изучите условия лицензии в официальной карточке модели, особенно требования к распространению и развертыванию.

Можно ли отключить рассуждения?

Документация API NVIDIA предоставляет параметр enable_thinking=True/False. Размещенные провайдеры могут обрабатывать эту настройку по-разному, поэтому проверьте поддерживаемый параметр и учет токенов на выбранном маршруте.

Эквивалентна ли конфигурация 550B A55B плотной модели на 55B?

Нет. Для каждого токена активны примерно 55B параметров, но все 550B параметров по-прежнему нужно хранить, распределять или выгружать.

Решение о развертывании, а не гонка за лучший бенчмарк

Начать разумнее всего с бесплатного Nemotron 3 Ultra API, используя несекретные промпты и небольшой набор тестов. Переходите на платный endpoint, когда становятся важны сбои, соблюдение схемы или предсказуемая емкость. Самостоятельный запуск оправдан только тогда, когда измеренная загрузка, требования к приватности или кастомизация действительно окупают как минимум четыре современных GPU с большим объемом памяти либо описанный NVIDIA вариант с DGX Station.

Что показало тестированиеСледующий шаг
Качество высокое, но бесплатные запросы завершаются ошибками или стоят в очередиДобавить платный маршрут Nemotron и политику повторных запросов
Главное преимущество — извлечение данных из длинного контекстаПроверить самый большой реальный документ и измерить время prefill
Основная проблема — ошибки JSONВыбрать провайдера с принудительной поддержкой схем или сравнить маршруты GLM/Qwen
Главными становятся стоимость или задержка коротких задачВыбрать меньшую модель, оставив Ultra для сложных случаев
Данные не могут покидать вашу сетьРассчитать бюджет официального многогпу-контура до начала внедрения

Читайте также