Cosmos 3 Edge: il modello world on-device da 4B di NVIDIA

Ultimo Aggiornamento: 2026-07-21 07:22:52

Un robot su un pavimento di fabbrica deve vedere una scena, prevedere come cambierà e decidere la sua prossima mossa più velocemente di quanto consenta un viaggio di andata e ritorno verso una GPU cloud. Per questo ciclo NVIDIA ha costruito Cosmos 3 Edge: è il primo world model della famiglia Cosmos ridotto a 4 miliardi di parametri, così può essere eseguito sulla macchina stessa, non in un data center. È utile per i cicli robotici on-device su hardware della classe Jetson, ma come mostrano i numeri qui sotto, non è un sostituto diretto dei modelli Cosmos più grandi quando serve la massima qualità.

NVIDIA's official Cosmos 3 Edge launch page on Hugging Face

Cos'è Cosmos 3 Edge

Cosmos 3 Edge è un "world model" open da 4 miliardi di parametri: un modello che impara come si comporta il mondo fisico così da poter ragionare sul movimento, sulla causalità e sulle conseguenze di un'azione. NVIDIA lo ha rilasciato il 20 luglio 2026 nel suo repository Cosmos 3 su Hugging Face.

Riceve in input visione, testo e audio (oltre a immagini, video e traiettorie di azione) e produce tre tipi di output: token di ragionamento, video e token di azione. In termini semplici, un unico modello osserva una scena, capisce cosa sta accadendo ed emette le azioni motorie che un robot dovrebbe compiere successivamente, semplificando la pipeline "vedere, ragionare, agire" che di solito coinvolge diversi sistemi separati.

La distinzione rispetto ai suoi fratelli sta nel luogo in cui viene eseguito. Cosmos 3 Super e Nano, rilasciati con la famiglia al GTC Taipei il 31 maggio 2026, sono destinati a workstation e data center. Edge è la variante progettata per funzionare sul robot, sul veicolo o direttamente sulla telecamera industriale stessa. Il lancio ha inoltre ampliato la Cosmos Coalition di NVIDIA, con aziende giapponesi del settore della robotica e della manifattura tra cui Fanuc, Kawasaki Heavy Industries, Yaskawa, Sony e SoftBank che hanno aderito per sviluppare sulla piattaforma.

I numeri sul dispositivo e cosa significano per un robot

NVIDIA cita tre cifre principali per Edge su un modulo Jetson Thor. Ognuna si traduce in un vincolo ingegneristico concreto:

  • Controllo in tempo reale a 15 Hz. Il modello chiude un intero ciclo percezione-azione all'incirca ogni 67 millisecondi. È abbastanza veloce per il controllo robotico a ciclo chiuso continuo, come la manipolazione stabile e la navigazione, anche se è al di sotto dei tassi che vorresti per manovre dinamiche ad alta velocità.
  • 32 azioni per inferenza. Un singolo forward pass emette una breve *sequenza* di azioni, non un solo passo. Il robot riceve un blocco di movimento pianificato da eseguire mentre gira la successiva inferenza, ed è questo che mantiene fluido un ciclo a 15 Hz invece che a scatti. Il compromesso è la reattività: un controller che non può interrompere un blocco reagirà in ritardo a un imprevisto, quindi il chunking delle azioni si abbina meglio alla ripianificazione a orizzonte mobile.
  • Osservazioni 640×360. Questa è la risoluzione su cui il modello ragiona sul dispositivo. È sufficiente per tracciare oggetti e prevedere traiettorie, ed è una scelta deliberata per rientrare nel budget di calcolo. L'ispezione visiva di precisione non è lo scopo di questa risoluzione.

La latenza su hardware più potente completa il quadro. Su un singolo H100, Edge restituisce una policy robotica (un'azione DROID) in 1,25 secondi ed esegue la dinamica diretta e inversa (prevedendo il successivo stato del mondo, oppure inferendo l'azione tra due stati) in circa 3,6 secondi ciascuna. La generazione completa da immagine a video è l'operazione più pesante, con 23,92 secondi, il che indica dove il modello è economico (azione e dinamica) e dove è costoso (generazione).

Cosmos 3 Edge inference latency on a single H100, in seconds

Come un modello da 4B ragiona e agisce

Riunire comprensione *e* generazione in 4 miliardi di parametri deriva dall'architettura. Edge esegue due torri transformer che condividono i loro livelli di attenzione multimodale: una torre autoregressiva che gestisce il ragionamento e la comprensione prevedendo il token successivo, e una torre diffusion che gestisce la generazione mediante denoising iterativo. Poiché condividono l'attenzione, il modello può ancorare ciò che genera a ciò su cui ha ragionato, facendo "vedi, poi agisci" in un'unica rete invece che in una catena di passaggi di consegna.

Edge si differenzia dai suoi fratelli in un altro modo. Cosmos 3 Nano e Super sono basati su pesi pretrained Qwen3-VL; Edge è un modello dense addestrato da zero per l’edge case. Questo focus è il motivo per cui un modello da 4B compete nella sua classe qui, invece di apparire come un ingenuo down-scaling di uno più grande.

Edge vs Nano vs Super: quale Cosmos 3 eseguire

Le tre varianti non sono livelli della stessa cosa che si sceglie in base al budget; sono abbinate a *dove il modello viene eseguito fisicamente*. Decidi prima l'hardware, poi segue la variante.

VarianteParametriComposizioneHardware di destinazioneIdeale per
Edge4BDenso, addestrato da zeroJetson (incl. new T2000 / T3000), Jetson Thor, GeForce RTX, DGXOn-device, cicli robot in tempo reale
Nano16Breasoner da 8B + generator da 8B (Qwen3-VL)workstation RTX PRO 6000Inferenza in tempo reale di livello workstation
Super64Breasoner da 32B + generator da 32B (Qwen3-VL)data center Hopper / BlackwellMassima qualità, generazione offline

Oltre la tabella, il compromesso che decide la maggior parte dei progetti è capacità vs latenza. Edge è l'unica variante che si adatta al robot, ma il suo singolo stack denso deve condividere il tempo tra ragionamento e generazione; Nano e Super dividono questi aspetti in metà separate di ragionatore e generatore, ed è per questo che scalano ulteriormente la qualità e che richiedono GPU da workstation o da data center per farlo. Escludi Edge quando il compito dipende da dettagli visivi fini, controllo ad alta velocità o video ad altissima fedeltà.

Benchmark, nel contesto

Tra i modelli di dimensioni simili da 4B, Cosmos 3 Edge si classifica al primo posto su VANTAGE-Bench per l’analisi visiva ed è all’avanguardia per il robot policy learning, i due ambiti a cui è destinato. Per la generazione produce image-to-video a 480p e 24 fps con qualità competitiva nelle suite PAIBench e RBench, il che lo rende adatto alla generazione di dati sintetici e di anteprime piuttosto che a competere con modelli video dedicati.

Si adatta alla famiglia più ampia. Nell’intera gamma Cosmos 3, NVIDIA riporta il ranking di modello open #1 in sette leaderboard di AI fisica, che spaziano dal ragionamento (medie di Robotics, Smart Space e Driving) alla generazione (R-Bench, Artificial Analysis, RoboLab e RoboArena). Si tratta di risultati riportati dal fornitore, quindi vanno letti come “il più forte nella sua classe dimensionale per la percezione e il controllo on-device”, non come il modello Cosmos complessivamente più forte.

Dove Cosmos 3 Edge è carente

Piccolo e su dispositivo è un insieme di compromessi, ed è bene nominarli prima di impegnarsi:

  • Soglia di risoluzione. Osservazioni a 640×360 vanno bene per la previsione delle traiettorie, ma sono limitanti per compiti che dipendono da dettagli visivi fini, come l’ispezione di piccoli difetti.
  • Soglia di capacità. 4B di parametri limitano quanto ragionamento a lungo orizzonte e quanta generazione ad alta fedeltà il modello può fare. Quando la qualità conta più della latenza, Nano o Super sono la scelta giusta.
  • L’adattamento è previsto, non facoltativo. NVIDIA documenta la personalizzazione del modello di base per uno specifico robot, set di sensori o ambiente in circa un giorno su un piccolo cluster H100 o DGX Station. È veloce, ma indica anche che il comportamento predefinito in un contesto sconosciuto e non strutturato di solito richiede prima una messa a punto.
  • La generazione è una competenza secondaria. Il modello può generare video, ma non è qui che eccelle; consideralo un modello di percezione e azione che può anche generare, non un modello di generazione.

Come avviarlo

I pesi sono pubblici su huggingface.co/nvidia/Cosmos3-Edge, rilasciati sotto licenza OpenMDW 1.1, una licenza aperta per i pesi del modello che consente l'uso commerciale e il fine-tuning. (Alcuni primi articoli lo definivano Apache 2.0; la model card indica OpenMDW 1.1, quindi controlla il testo della licenza per i termini di attribuzione e distribuzione prima di metterlo in produzione.)

Per il deployment, NVIDIA indica l’ottimizzazione dei checkpoint con framework di inference open come vLLM, insieme ai propri microservizi NIM, e l’esportazione ONNX per trasferire il modello sull’hardware Jetson. La famiglia più ampia include anche una Cosmos3OmniPipeline in Hugging Face Diffusers. Un percorso realistico per un team di robotica è: scaricare da Hugging Face, fare fine-tuning sui propri dati di task per circa un giorno (secondo le indicazioni di NVIDIA), quindi esportare e distribuire sul target on-device.

Gli stessi pesi funzionano su un ampio intervallo di hardware: moduli Jetson, inclusi i nuovi T2000 e T3000, Jetson Thor, GPU GeForce RTX e RTX PRO, e sistemi DGX, così lo stesso modello può passare dal desktop di uno sviluppatore alla macchina distribuita senza una riscrittura.

FAQ

Cosmos 3 Edge è open source?

I pesi sono liberamente scaricabili sotto la licenza OpenMDW 1.1, che consente l’uso commerciale e il fine-tuning. Questo lo rende un rilascio di "open weights" che puoi eseguire e adattare autonomamente, invece di una release solo via API; il codice di training e i dati sono una questione separata che il testo della licenza specifica chiaramente.

Di quale hardware ha bisogno Cosmos 3 Edge?

È progettato per essere eseguito on-device sui moduli NVIDIA Jetson (inclusi i nuovi T2000 e T3000) e su Jetson Thor, e funziona anche su GPU GeForce RTX e RTX PRO e sui sistemi DGX. La cifra di controllo di 15 Hz è indicata specificamente su Jetson Thor, quindi aspettati frequenze inferiori sui moduli Jetson più piccoli.

Quando è stato rilasciato Cosmos 3 Edge?

Cosmos 3 Edge è stato lanciato il 20 luglio 2026, aggiunto alla famiglia Cosmos 3 che ha debuttato per la prima volta al GTC Taipei il 31 maggio 2026.

Cosmos 3 Edge o Nano: quale dovrei usare?

Scegli in base a dove viene eseguito il modello. Se deve essere eseguito sul robot o sulla telecamera stessa, usa Edge (4B). Se viene eseguito su una workstation accanto alla macchina, Nano (16B) offre più qualità a fronte del compute aggiuntivo.