공장 현장의 로봇은 장면을 보고, 어떻게 변할지 예측하고, 클라우드 GPU까지 왕복하는 시간보다 더 빠르게 다음 동작을 결정해야 합니다. NVIDIA가 Cosmos 3 Edge를 구축한 이유가 바로 이 루프입니다. 이는 Cosmos 제품군에서 처음으로 40억 개 파라미터로 축소되어 데이터 센터가 아니라 기기 자체에서 실행될 수 있는 월드 모델입니다. Jetson급 하드웨어에서 디바이스 내 로봇 루프에 유용하지만, 아래 수치가 보여주듯 최대 품질이 필요할 때 더 큰 Cosmos 모델을 그대로 대체할 수 있는 것은 아닙니다.
Cosmos 3 Edge란 무엇인가
Cosmos 3 Edge는 40억 개의 파라미터를 가진 오픈 "world model"입니다. 이는 물리 세계가 어떻게 작동하는지를 학습하여 운동, 인과 관계, 그리고 행동의 결과에 대해 추론할 수 있는 모델입니다. NVIDIA는 2026년 7월 20일 Hugging Face Cosmos 3 repository에 이를 공개했습니다.
시각, 텍스트, 오디오(그리고 이미지, 비디오, 액션 궤적)를 입력받아 추론 토큰, 비디오, 액션 토큰의 세 가지 종류의 출력을 생성합니다. 쉽게 말해, 하나의 모델이 장면을 관찰하고, 무슨 일이 일어나고 있는지 파악한 뒤, 로봇이 다음에 취해야 할 운동 동작을 내보내며, 보통 여러 개의 পৃথવ পৃথ separate systems에 걸쳐 있는 "보고, 추론하고, 행동하는" 파이프라인을 하나로 통합합니다.
그의 형제 모델들과의 차이점은 실행 위치에 있다. 2026년 5월 31일 GTC 타이베이에서 가족 제품군과 함께 공개된 Cosmos 3 Super와 Nano는 워크스테이션과 데이터 센터를 대상으로 한다. Edge는 로봇, 차량 또는 산업용 카메라 자체에서 실행되도록 설계된 변형이다. 이번 출시로 NVIDIA의 Cosmos Coalition도 확대되었으며, Fanuc, Kawasaki Heavy Industries, Yaskawa, Sony, SoftBank를 포함한 일본의 로보틱스 및 제조 기업들이 플랫폼 위에 구축하기 위해 참여했다.
기기 내 수치와 그것이 로봇에 의미하는 바
NVIDIA는 Jetson Thor 모듈에서 Edge에 대해 세 가지 핵심 수치를 제시합니다. 각각은 구체적인 엔지니어링 제약으로 해석됩니다:
- 15 Hz 실시간 제어. 모델은 약 67밀리초마다 전체 인지-행동 루프를 닫습니다. 이는 안정적인 조작과 내비게이션 같은 연속적인 폐루프 로봇 제어에는 충분히 빠르지만, 고속 동적 기동에 필요한 속도에는 미치지 못합니다.
- 추론당 32개의 액션. 단일 순전파는 한 단계가 아니라 짧은 행동 *시퀀스*를 출력합니다. 로봇은 다음 추론이 실행되는 동안 수행할 계획된 모션 청크를 받는데, 이것이 15 Hz 루프를 끊기지 않고 부드럽게 유지해 줍니다. 그 대가로 반응성이 떨어집니다. 청크를 중단할 수 없는 컨트롤러는 예상치 못한 상황에 늦게 반응하므로, 액션 청크화는 롤링 호라이즌 재계획과 가장 잘 맞습니다.
- 640×360 관측값. 이는 모델이 온디바이스에서 추론하는 해상도입니다. 객체를 추적하고 궤적을 예측하기에는 충분하며, 컴퓨팅 예산에 맞추기 위한 의도적인 절충입니다. 이 해상도는 세밀한 시각적 검사를 위한 것이 아닙니다.
더 큰 하드웨어에서의 지연 시간은 나머지 그림을 완성해 줍니다. 단일 H100에서 Edge는 로봇 정책(DROID action)을 1.25초에 반환하고, 순방향 및 역방향 동역학(다음 세계 상태를 예측하거나 두 상태 사이의 action을 추론하는 것)은 각각 약 3.6초에 실행합니다. 전체 image-to-video 생성은 23.92초로 가장 무거운 작업이며, 이는 모델이 어디에서 저렴한지(action과 dynamics)와 어디에서 비용이 많이 드는지(generation)를 보여줍니다.
4B 모델이 추론하고 행동하는 방식
4 billion parameters에 이해와 생성*을 함께 담아낼 수 있는 것은 아키텍처 덕분입니다. Edge는 멀티모달 attention layer를 공유하는 두 개의 transformer tower를 실행합니다. 하나는 다음 token을 예측하며 reasoning과 understanding을 처리하는 autoregressive tower이고, 다른 하나는 반복적으로 denoising하며 generation을 처리하는 diffusion tower입니다. 이들은 attention을 공유하기 때문에, 모델은 자신이 추론한 내용을 바탕으로 생성하는 것을 구체화할 수 있으며, 여러 단계의 handoff가 아닌 하나의 network 안에서 "보고, 그다음 행동하는" 방식을 수행합니다.
Edge는 다른 형제 모델들과 또 한 가지 점에서 다릅니다. Cosmos 3 Nano와 Super는 사전 학습된 Qwen3-VL 가중치를 기반으로 구축되었지만, Edge는 엣지 케이스를 위해 처음부터 학습된 dense 모델입니다. 이러한 집중 덕분에 4B 모델이 더 큰 모델을 단순히 축소한 것으로 보이지 않고, 이 범주에서 경쟁력을 갖게 됩니다.
Edge vs Nano vs Super: 실행할 Cosmos 3는 무엇인가
세 가지 변형은 예산에 따라 고르는 같은 제품의 등급이 아닙니다. 모델이 물리적으로 실행되는 *장소*에 맞춰져 있습니다. 먼저 하드웨어를 결정하고, 그다음 변형을 선택하세요.
| 변형 | 파라미터 | 구성 | 대상 하드웨어 | 최적 용도 |
|---|---|---|---|---|
| Edge | 4B | Dense, 처음부터 학습됨 | Jetson (new T2000 / T3000 포함), Jetson Thor, GeForce RTX, DGX | 디바이스 내 실시간 로봇 루프 |
| Nano | 16B | 8B reasoner + 8B generator (Qwen3-VL) | RTX PRO 6000 워크스테이션 | 워크스테이션급 실시간 추론 |
| Super | 64B | 32B reasoner + 32B generator (Qwen3-VL) | Hopper / Blackwell 데이터 센터 | 최고 품질, 오프라인 생성 |
표를 넘어, 대부분의 프로젝트를 결정짓는 트레이드오프는 용량과 지연 시간입니다. Edge는 로봇에 탑재할 수 있는 유일한 변형이지만, 단일 밀집 스택이 추론과 생성을 시간 분할로 처리해야 합니다. 반면 Nano와 Super는 이를 별도의 추론기와 생성기 절반으로 나누기 때문에 품질을 더 높게 확장할 수 있고, 이를 위해 워크스테이션 또는 데이터센터 GPU가 필요합니다. 미세한 시각적 디테일, 고속 제어, 또는 최고 충실도의 비디오가 핵심인 작업이라면 Edge는 제외하세요.
벤치마크, 맥락 속에서
유사한 4B 규모의 모델들 중에서 Cosmos 3 Edge는 vision analytics 부문에서 VANTAGE-Bench 1위를 차지하며, 이 모델이 목표로 하는 두 가지 작업인 로봇 정책 학습에서도 최첨단 수준입니다. 생성 측면에서는 480p와 24 fps의 image-to-video를 생성하며, PAIBench 및 RBench 벤치마크에서 경쟁력 있는 품질을 보여 합성 데이터 및 미리보기 생성에 적합하고, 전용 video 모델과 경쟁하는 용도에는 맞지 않습니다.
그것은 더 넓은 제품군에 들어맞습니다. Cosmos 3 라인업 전반에서 NVIDIA는 추론(Robotics, Smart Space, Driving 평균)과 생성(R-Bench, Artificial Analysis, RoboLab, RoboArena)에 걸친 7개의 physical-AI 리더보드에서 #1 오픈 모델 순위를 보고합니다. 이는 벤더가 보고한 결과이므로, 이를 전체 Cosmos 모델 중 가장 강력한 것으로 보기보다 “온디바이스 인지 및 제어에서 같은 규모의 클래스 중 가장 강력한 모델”로 이해해야 합니다.
Cosmos 3 Edge의 부족한 점
Small-and-on-device는 일련의 절충안이며, 이를 선택하기 전에 명확히 짚고 넘어갈 가치가 있습니다:
- 해상도 한계. 640×360 관측은 궤적 예측에는 적합하지만, 작은 결함 검사처럼 미세한 시각적 디테일에 의존하는 작업에는 제약이 있습니다.
- 용량 한계. 4B 파라미터는 모델이 수행할 수 있는 장기 추론과 고정밀 생성의 범위를 제한합니다. 품질이 지연 시간보다 더 중요하다면 Nano 또는 Super가 적절합니다.
- 적응은 선택이 아니라 전제입니다. NVIDIA는 특정 로봇, 센서 세트 또는 환경에 맞게 기본 모델을 커스터마이즈하는 데 작은 H100 또는 DGX Station 클러스터에서 약 하루가 걸린다고 문서화합니다. 이는 빠른 속도이지만, 동시에 익숙하지 않고 구조화되지 않은 환경에서의 기본 동작은 보통 먼저 튜닝이 필요하다는 점도 시사합니다.
- 생성은 부차적 역량입니다. 이 모델은 비디오를 생성할 수 있지만, 그 점이 핵심 강점은 아닙니다. 생성 모델이라기보다, 생성도 할 수 있는 지각 및 행동 모델로 보는 것이 맞습니다.
실행하는 방법
가중치는 huggingface.co/nvidia/Cosmos3-Edge에서 공개되어 있으며, 상업적 사용과 미세 조정을 허용하는 오픈 모델 가중치 라이선스인 OpenMDW 1.1 라이선스 하에 배포됩니다. (일부 초기 소개 글에서는 이를 Apache 2.0이라고 불렀지만, 모델 카드에는 OpenMDW 1.1로 기재되어 있으므로, 배포하기 전에 저작자 표시 및 배포 조건에 대한 라이선스 텍스트를 확인하세요.)
배포를 위해 NVIDIA는 vLLM과 같은 오픈 inference framework로 checkpoint를 최적화하는 것과 자체 NIM microservices를 함께 활용하고, 모델을 Jetson hardware에 적용하기 위한 ONNX export를 제안합니다. 또한 더 넓은 family에는 Hugging Face Diffusers의 Cosmos3OmniPipeline도 포함되어 있습니다. robotics 팀을 위한 현실적인 경로는 다음과 같습니다: Hugging Face에서 다운로드한 뒤, NVIDIA의 가이드에 따라 약 하루 동안 자체 task data로 fine-tune하고, 그 다음 export하여 on-device target에 배포하는 것입니다.
동일한 weights는 새로운 T2000 및 T3000을 포함한 Jetson 모듈, Jetson Thor, GeForce RTX 및 RTX PRO GPU, 그리고 DGX 시스템 전반에서 실행되므로, 같은 모델을 재작성 없이 개발자의 데스크톱에서 배포된 머신으로 옮길 수 있습니다.
자주 묻는 질문
Cosmos 3 Edge는 오픈 소스인가요?
가중치는 상업적 사용과 파인튜닝을 허용하는 OpenMDW 1.1 라이선스 하에 공개적으로 다운로드할 수 있습니다. 이는 API 전용 출시가 아니라 직접 실행하고 조정할 수 있는 "open weights"라는 뜻입니다. 훈련 코드와 데이터는 별개의 문제이며, 라이선스 본문에 명시되어 있습니다.
Cosmos 3 Edge에는 어떤 하드웨어가 필요합니까?
이는 NVIDIA Jetson 모듈(새롭게 발표된 T2000 및 T3000 포함)과 Jetson Thor에서 디바이스 상에서 실행되도록 구축되었으며, GeForce RTX 및 RTX PRO GPU와 DGX 시스템에서도 실행됩니다. 15 Hz 제어 수치는 특히 Jetson Thor에서 제시된 것이므로, 더 작은 Jetson 모듈에서는 더 낮은 속도를 예상하세요.
Cosmos 3 Edge는 언제 출시되었나요?
Cosmos 3 Edge는 2026년 7월 20일에 출시되었으며, 2026년 5월 31일 GTC Taipei에서 처음 공개된 Cosmos 3 패밀리에 추가되었습니다.
Cosmos 3 Edge 또는 Nano: 무엇을 사용해야 하나요?
모델이 어디에서 실행되는지에 따라 선택하세요. 로봇이나 카메라 자체에서 실행되어야 한다면 Edge (4B)를 사용하세요. 기기 옆의 워크스테이션에서 실행된다면, Nano (16B)는 추가 연산 자원에 대한 더 높은 품질을 제공합니다.
