Роботу на заводском полу нужно видеть сцену, предсказывать, как она изменится, и решать, какое будет его следующее действие, быстрее, чем позволяет круговой обмен с облачным GPU. Именно для этого NVIDIA создала Cosmos 3 Edge: это первая world model в семействе Cosmos, уменьшенная до 4 миллиардов параметров, чтобы она могла работать на самой машине, а не в дата-центре. Она полезна для замкнутых on-device циклов управления роботами на оборудовании класса Jetson, но, как показывают числа ниже, она не является прямой заменой более крупных моделей Cosmos, когда вам нужно максимальное качество.
Что такое Cosmos 3 Edge
Cosmos 3 Edge — это открытая «модель мира» с 4 миллиардами параметров: модель, которая учится понимать, как ведёт себя физический мир, чтобы она могла рассуждать о движении, причинно-следственных связях и последствиях действия. NVIDIA выпустила её 20 июля 2026 года в своём репозитории Hugging Face Cosmos 3.
Он принимает на вход vision, text и audio (а также images, video и action trajectories) и выдаёт три вида результата: reasoning tokens, video и action tokens. Проще говоря, одна модель наблюдает за сценой, определяет, что происходит, и выдает моторные действия, которые робот должен выполнить дальше, объединяя в один процесс цепочку «see, reason, act», которая обычно охватывает несколько отдельных систем.
Отличие от своих собратьев заключается в том, где он работает. Cosmos 3 Super и Nano, выпущенные вместе с семейством на GTC Taipei 31 мая 2026 года, предназначены для рабочих станций и центров обработки данных. Edge — это вариант, созданный для работы прямо на роботе, транспортном средстве или самой промышленной камере. Запуск также расширил NVIDIA Cosmos Coalition: к платформе присоединились японские компании в области робототехники и производства, включая Fanuc, Kawasaki Heavy Industries, Yaskawa, Sony и SoftBank, чтобы создавать на её основе решения.
Показатели на устройстве и что они означают для робота
NVIDIA приводит три ключевых показателя для Edge на модуле Jetson Thor. Каждый из них превращается в конкретное инженерное ограничение:
- Управление в реальном времени на 15 Гц. Модель замыкает полный цикл от восприятия к действию примерно каждые 67 миллисекунд. Это достаточно быстро для непрерывного замкнутого управления роботом, такого как стабильная манипуляция и навигация, хотя и ниже частот, которые нужны для высокоскоростных динамических манёвров.
- 32 действия за одно вычисление. Один прямой проход выдаёт короткую *последовательность* действий, а не один шаг. Робот получает запланированный фрагмент движения для выполнения, пока запускается следующий inference, и именно это делает цикл 15 Гц плавным, а не рывкообразным. Компромисс — отзывчивость: контроллер, который не может прервать фрагмент, поздно отреагирует на неожиданность, поэтому пакетирование действий лучше всего сочетается с перепланированием по скользящему горизонту.
- Наблюдения 640×360. Это разрешение, на котором модель выполняет рассуждение на устройстве. Его достаточно, чтобы отслеживать объекты и предсказывать траектории, и это сознательный компромисс ради укладывания в вычислительный бюджет. Для детального визуального осмотра такое разрешение не предназначено.
Задержка на более мощном оборудовании дополняет общую картину. На одном H100 Edge возвращает политику робота (действие DROID) за 1,25 секунды и выполняет прямую и обратную динамику (предсказывая следующее состояние мира или выводя действие между двумя состояниями) примерно за 3,6 секунды каждую. Полная генерация изображения в видео — это самая тяжёлая операция, занимающая 23,92 секунды, что показывает, где модель дешева (действия и динамика), а где она дорога (генерация).
Как 4B-модель и рассуждает, и действует
Встраивание и понимания, и генерации в 4 миллиарда параметров обеспечивается архитектурой. Edge использует две башни transformer, которые разделяют свои мультимодальные слои attention: авторегрессионную башню, которая отвечает за рассуждение и понимание, предсказывая следующий token, и diffusion-башню, которая отвечает за генерацию, итеративно выполняя denoising. Поскольку у них общие attention, model может опираться в том, что генерирует, на то, о чём она рассуждала, реализуя «сначала увидь, потом действуй» в одной сети, а не в цепочке передач.
Edge отличается от своих собратьев ещё и вот чем. Cosmos 3 Nano и Super построены на предварительно обученных весах Qwen3-VL; Edge — это плотная модель, обученная с нуля для edge case. Именно этот фокус и позволяет 4B-модели конкурировать в своём классе, а не восприниматься как наивно уменьшенная версия более крупной модели.
Edge vs Nano vs Super: какую версию Cosmos 3 запускать
Три варианта — это не уровни одного и того же, которые вы выбираете по бюджету; они соответствуют *тому, где модель физически выполняется*. Сначала определите аппаратное обеспечение, затем выбирайте вариант.
| Вариант | Параметры | Состав | Целевое оборудование | Лучше всего для |
|---|---|---|---|---|
| Edge | 4B | Плотная, обучена с нуля | Jetson (вкл. новые T2000 / T3000), Jetson Thor, GeForce RTX, DGX | На устройстве, роботические циклы в реальном времени |
| Nano | 16B | 8B reasoner + 8B generator (Qwen3-VL) | Рабочая станция RTX PRO 6000 | Инференс в реальном времени уровня рабочей станции |
| Super | 64B | 32B reasoner + 32B generator (Qwen3-VL) | Центр обработки данных Hopper / Blackwell | Максимальное качество, офлайн-генерация |
Помимо таблицы, компромисс, который определяет большинство проектов, — это пропускная способность против задержки. Edge — единственный вариант, который помещается на роботе, но его единый плотный стек должен поочередно использоваться для рассуждения и генерации; Nano и Super разделяют это на отдельные половины — reasoner и generator, — поэтому они ещё больше повышают качество и потому им для этого нужны рабочие станции или GPU для дата-центров. Исключайте Edge, когда задача зависит от тонких визуальных деталей, высокоскоростного управления или видео наивысшего качества.
Бенчмарки в контексте
Среди моделей схожего размера 4B, Cosmos 3 Edge занимает #1 место в VANTAGE-Bench по vision analytics и является передовым решением для robot policy learning — двух задач, на которые он ориентирован. Для генерации он создаёт image-to-video в 480p и 24 fps с конкурентоспособным качеством в наборах PAIBench и RBench, что подходит для synthetic-data и preview generation, а не для конкуренции с специализированными video models.
Это соответствует более широкой линейке. По всей линейке Cosmos 3 NVIDIA сообщает о рейтингах открытых моделей №1 на семи лидербордах physical-AI, охватывающих reasoning (средние показатели Robotics, Smart Space и Driving) и generation (R-Bench, Artificial Analysis, RoboLab и RoboArena). Это результаты, сообщённые поставщиком, поэтому следует воспринимать их как «самый сильный в своём классе по размеру для on-device perception and control», а не как самую сильную модель Cosmos в целом.
Где Cosmos 3 Edge уступает
Маленькие и локальные модели — это набор компромиссов, и их стоит назвать, прежде чем вы примете решение:
- Предел разрешения. Наблюдения 640×360 подходят для прогнозирования траектории, но ограничивают задачи, зависящие от тонких визуальных деталей, например инспекцию мелких дефектов.
- Предел производительности. 4B параметров ограничивают то, насколько хорошо модель может выполнять долгосрочное рассуждение и высокоточное генерирование. Когда качество важнее задержки, правильный выбор — Nano или Super.
- Адаптация ожидаема, а не необязательна. NVIDIA документирует настройку базовой модели под конкретного робота, набор датчиков или среду примерно за день на небольшом кластере H100 или DGX Station. Это быстро, но также указывает на то, что поведение «из коробки» в незнакомой, неструктурированной среде обычно сначала требует донастройки.
- Генерация — второстепенный навык. Модель может генерировать видео, но это не её сильная сторона; рассматривайте её как модель восприятия и действия, которая также умеет генерировать, а не как модель генерации.
Как запустить
Весы доступны в открытом доступе по адресу huggingface.co/nvidia/Cosmos3-Edge, выпущены под лицензией OpenMDW 1.1 — открытой лицензией на веса модели, допускающей коммерческое использование и дообучение. (В некоторых ранних публикациях её называли Apache 2.0; в model card указана OpenMDW 1.1, так что перед выпуском продукта проверьте текст лицензии на условия указания авторства и распространения.)
Для развертывания NVIDIA указывает на оптимизацию checkpoints с помощью open inference frameworks, таких как vLLM, наряду со своими собственными NIM microservices, а также на экспорт в ONNX для переноса модели на оборудование Jetson. Более широкое семейство также включает Cosmos3OmniPipeline в Hugging Face Diffusers. Реалистичный путь для команды робототехники таков: скачать из Hugging Face, дообучить на собственных данных задачи примерно в течение суток (согласно рекомендациям NVIDIA), затем экспортировать и развернуть на целевой устройстве.
Одни и те же веса работают на широком спектре оборудования: модули Jetson, включая новые T2000 и T3000, Jetson Thor, GPU GeForce RTX и RTX PRO, а также системы DGX, поэтому одна и та же модель может перейти с рабочего стола разработчика на развернутую машину без переписывания.
Часто задаваемые вопросы
Cosmos 3 Edge — это проект с открытым исходным кодом?
Веса доступны для свободного скачивания по лицензии OpenMDW 1.1, которая разрешает коммерческое использование и fine-tuning. Это делает их «open weights», которые вы можете запускать и адаптировать самостоятельно, а не выпуском только через API; код обучения и данные — отдельный вопрос, который подробно описан в тексте лицензии.
Какое оборудование требуется для Cosmos 3 Edge?
Он создан для работы на устройстве на модулях NVIDIA Jetson (включая недавно анонсированные T2000 и T3000) и Jetson Thor, а также работает на GPU GeForce RTX и RTX PRO и системах DGX. Показатель управления 15 Hz указан именно для Jetson Thor, поэтому на более компактных модулях Jetson ожидайте более низкие частоты.
Когда был выпущен Cosmos 3 Edge?
Cosmos 3 Edge был запущен 20 июля 2026 года и был добавлен в семейство Cosmos 3, впервые представленное на GTC Taipei 31 мая 2026 года.
Cosmos 3 Edge или Nano: что мне использовать?
Выбирайте в зависимости от того, где работает модель. Если она должна запускаться на самом роботе или камере, используйте Edge (4B). Если она работает на рабочей станции рядом с устройством, Nano (16B) дает более высокое качество за дополнительную вычислительную мощность.
