Um robô no chão de fábrica precisa ver uma cena, prever como ela vai mudar e decidir seu próximo movimento mais rápido do que uma ida e volta a uma GPU na nuvem permite. Foi para esse ciclo que a NVIDIA construiu o Cosmos 3 Edge: ele é o primeiro modelo de mundo da família Cosmos reduzido para 4 bilhões de parâmetros, para que possa ser executado na própria máquina, e não em um data center. Ele é útil para loops de robótica no dispositivo em hardware da classe Jetson, mas, como mostram os números abaixo, não é um substituto direto para os modelos Cosmos maiores quando você precisa da máxima qualidade.
O que é o Cosmos 3 Edge
Cosmos 3 Edge é um "world model" aberto de 4 bilhões de parâmetros: um modelo que aprende como o mundo físico se comporta para poder raciocinar sobre movimento, causalidade e as consequências de uma ação. A NVIDIA o lançou em 20 de julho de 2026 em seu repositório Cosmos 3 no Hugging Face.
Ele recebe visão, texto e áudio (além de imagens, vídeo e trajetórias de ação) e produz três tipos de saída: tokens de raciocínio, vídeo e tokens de ação. Em termos simples, um único modelo observa uma cena, descobre o que está acontecendo e emite as ações motoras que um robô deve realizar em seguida, simplificando o pipeline "ver, raciocinar, agir" que normalmente abrange vários sistemas separados.
A distinção em relação aos seus irmãos está em onde ele é executado. Cosmos 3 Super e Nano, lançados com a família no GTC Taipei em 31 de maio de 2026, são destinados a estações de trabalho e data centers. Edge é a variante criada para rodar no robô, no veículo ou na própria câmera industrial. O lançamento também ampliou a Cosmos Coalition da NVIDIA, com empresas japonesas de robótica e manufatura, incluindo Fanuc, Kawasaki Heavy Industries, Yaskawa, Sony e SoftBank, aderindo para construir na plataforma.
Os números no dispositivo e o que eles significam para um robô
A NVIDIA cita três números principais para o Edge em um módulo Jetson Thor. Cada um deles se traduz em uma restrição concreta de engenharia:
- Controle em tempo real de 15 Hz. O modelo fecha um ciclo completo de percepção-ação a cada cerca de 67 milissegundos. Isso é rápido o suficiente para controle robótico contínuo em malha fechada, como manipulação estável e navegação, embora abaixo das taxas que você desejaria para manobras dinâmicas de alta velocidade.
- 32 ações por inferência. Uma única passagem direta emite uma curta *sequência* de ações, não um único passo. O robô recebe um trecho de movimento planejado para executar enquanto a próxima inferência é executada, e é isso que mantém um loop de 15 Hz suave em vez de trêmulo. A desvantagem é a responsividade: um controlador que não consegue interromper um trecho reagirá tarde a uma surpresa, então o fracionamento de ações combina melhor com replanejamento em horizonte receding.
- Observações de 640×360. Essa é a resolução sobre a qual o modelo raciocina no dispositivo. É suficiente para rastrear objetos e prever trajetórias, e é uma compensação deliberada para caber no orçamento de computação. Inspeção visual detalhada não é o objetivo dessa resolução.
A latência em hardware mais potente completa o restante do panorama. Em uma única H100, o Edge retorna uma política de robô (uma ação DROID) em 1,25 segundos e executa a dinâmica direta e inversa (prevendo o próximo estado do mundo ou inferindo a ação entre dois estados) em cerca de 3,6 segundos cada. A geração completa de imagem para vídeo é a operação mais pesada, levando 23,92 segundos, o que mostra onde o modelo é barato (ação e dinâmica) e onde ele é caro (geração).
Como um modelo de 4B tanto raciocina quanto age
Inserir compreensão *e* geração em 4 bilhões de parâmetros vem da arquitetura. O Edge executa duas torres transformer que compartilham suas camadas de atenção multimodal: uma torre autoregressiva que lida com raciocínio e compreensão ao prever o próximo token, e uma torre de difusão que lida com a geração ao fazer denoising iterativamente. Como elas compartilham atenção, o modelo consegue fundamentar o que gera no que raciocinou, fazendo "ver, depois agir" em uma única rede em vez de uma cadeia de transferências.
O Edge difere de seus irmãos de mais uma forma. O Cosmos 3 Nano e o Super são construídos sobre pesos Qwen3-VL pré-treinados; o Edge é um modelo denso treinado do zero para o caso de uso na borda. Esse foco é o motivo pelo qual um modelo de 4B compete em sua classe aqui, em vez de parecer uma simples redução ingênua de um modelo maior.
Edge vs Nano vs Super: qual Cosmos 3 executar
As três variantes não são níveis da mesma coisa que você escolhe pelo orçamento; elas são correspondentes a *onde o modelo é executado fisicamente*. Decida primeiro o hardware, depois a variante.
| Variante | Parâmetros | Composição | Hardware de destino | Ideal para |
|---|---|---|---|---|
| Edge | 4B | Dense, treinado do zero | Jetson (incl. new T2000 / T3000), Jetson Thor, GeForce RTX, DGX | No dispositivo, loops de robô em tempo real |
| Nano | 16B | reasoner de 8B + generator de 8B (Qwen3-VL) | workstation RTX PRO 6000 | Inferência em tempo real de nível workstation |
| Super | 64B | reasoner de 32B + generator de 32B (Qwen3-VL) | data center Hopper / Blackwell | Qualidade máxima, geração offline |
Além da tabela, o compromisso que decide a maioria dos projetos é capacidade versus latência. Edge é a única variante que cabe no robô, mas sua única pilha densa precisa compartilhar tempo entre raciocínio e geração; Nano e Super dividem isso em metades separadas de raciocinador e gerador, e é por isso que eles ampliam ainda mais a qualidade e por que precisam de GPUs de workstation ou de data center para fazer isso. Descarte Edge quando a tarefa depender de detalhe visual fino, controle em alta velocidade ou vídeo de fidelidade máxima.
Benchmarks, em contexto
Entre modelos de tamanho semelhante de 4B, o Cosmos 3 Edge ocupa o #1 no VANTAGE-Bench para analytics de visão e é state of the art para aprendizado de políticas de robôs, os dois trabalhos que ele visa. Para geração, ele produz image-to-video em 480p e 24 fps com qualidade competitiva nas suítes PAIBench e RBench, o que o torna mais מתאים para geração de dados sintéticos e de pré-visualização do que para competir com modelos de vídeo dedicados.
Isso se encaixa na família mais ampla. Em toda a linha Cosmos 3, a NVIDIA informa classificações de modelo aberto em 1º lugar em sete leaderboards de IA física, abrangendo raciocínio (médias de Robotics, Smart Space e Driving) e geração (R-Bench, Artificial Analysis, RoboLab e RoboArena). Esses são resultados informados pelo fornecedor, então interprete-os como "o mais forte em sua categoria de tamanho para percepção e controle no dispositivo", e não como o modelo Cosmos mais forte no geral.
Onde o Cosmos 3 Edge fica aquém
Pequeno e no dispositivo é um conjunto de compensações, e vale a pena nomeá-las antes de você se comprometer:
- Limite de resolução. Observações em 640×360 são adequadas para previsão de trajetória, mas limitantes para tarefas que dependem de detalhes visuais finos, como inspeção de pequenos defeitos.
- Limite de capacidade. 4B de parâmetros limitam o quanto de raciocínio de longo horizonte e de geração de alta fidelidade o modelo pode fazer. Quando a qualidade importa mais do que a latência, Nano ou Super são a escolha certa.
- A adaptação é esperada, não opcional. A NVIDIA documenta a personalização do modelo base para um robô, conjunto de sensores ou ambiente específico em cerca de um dia em um pequeno H100 ou em um cluster DGX Station. Isso é rápido, mas também indica que o comportamento pronto para uso em um ambiente desconhecido e não estruturado normalmente precisa de ajuste primeiro.
- A geração é uma habilidade secundária. O modelo pode gerar vídeo, mas esse não é o seu ponto forte; trate-o como um modelo de percepção e ação que também pode gerar, e não como um modelo de geração.
Como colocá-lo em funcionamento
Os pesos estão disponíveis publicamente em huggingface.co/nvidia/Cosmos3-Edge, lançados sob a licença OpenMDW 1.1, uma licença aberta de pesos de modelo que permite uso comercial e ajuste fino. (Algumas publicações iniciais o chamaram de Apache 2.0; o cartão do modelo lista OpenMDW 1.1, então verifique o texto da licença quanto aos termos de atribuição e distribuição antes de colocá-lo em produção.)
Para a implantação, a NVIDIA aponta para a otimização dos checkpoints com frameworks de inferência abertos como vLLM, לצד de seus próprios microservices NIM, e exportação ONNX para levar o modelo ao hardware Jetson. A família mais ampla também inclui um Cosmos3OmniPipeline no Hugging Face Diffusers. Um caminho realista para uma equipe de robótica é: baixar do Hugging Face, fazer o fine-tuning nos seus próprios dados de tarefa por cerca de um dia (conforme a orientação da NVIDIA) e então exportar e implantar no destino embarcado.
Os mesmos pesos executam em uma ampla gama de hardware: módulos Jetson, incluindo os novos T2000 e T3000, Jetson Thor, GPUs GeForce RTX e RTX PRO, e sistemas DGX, de modo que o mesmo modelo pode passar do desktop de um desenvolvedor para a máquina em produção sem reescrita.
Perguntas Frequentes
O Cosmos 3 Edge é open source?
Os pesos estão disponíveis para download aberto sob a licença OpenMDW 1.1, que permite uso comercial e fine-tuning. Isso o torna um modelo de "open weights" que você pode executar e adaptar por conta própria, em vez de um lançamento apenas por API; o código de treinamento e os dados são uma questão separada que o texto da licença detalha.
Qual hardware o Cosmos 3 Edge precisa?
Ele foi criado para ser executado no dispositivo em módulos NVIDIA Jetson (incluindo os recém-anunciados T2000 e T3000) e no Jetson Thor, e também funciona em GPUs GeForce RTX e RTX PRO e em sistemas DGX. O valor de controle de 15 Hz é mencionado especificamente no Jetson Thor, portanto espere taxas menores em módulos Jetson menores.
Quando o Cosmos 3 Edge foi lançado?
O Cosmos 3 Edge foi lançado em 20 de julho de 2026, adicionando-se à família Cosmos 3, que estreou pela primeira vez na GTC Taipei em 31 de maio de 2026.
Cosmos 3 Edge ou Nano: qual devo usar?
Escolha com base em onde o modelo é executado. Se ele precisar rodar no próprio robô ou câmera, use Edge (4B). Se ele roda em uma estação de trabalho ao lado da máquina, Nano (16B) oferece mais qualidade pelo processamento extra.
