Cosmos 3 Edge: el modelo de mundo de 4B de NVIDIA para ejecución en el dispositivo

Última actualización: 2026-07-21 07:23:00

Un robot en el piso de una fábrica tiene que ver una escena, predecir cómo cambiará y decidir su siguiente movimiento más rápido de lo que permite un viaje de ida y vuelta a una GPU en la nube. Para ese bucle, NVIDIA creó Cosmos 3 Edge: es el primer modelo del mundo de la familia Cosmos reducido a 4 mil millones de parámetros para que pueda ejecutarse en la propia máquina, no en un centro de datos. Es útil para bucles de robots en el dispositivo en hardware de clase Jetson, pero, como muestran los números a continuación, no es un reemplazo directo de los modelos Cosmos más grandes cuando necesitas la máxima calidad.

NVIDIA's official Cosmos 3 Edge launch page on Hugging Face

Qué es Cosmos 3 Edge

Cosmos 3 Edge es un "world model" abierto de 4 mil millones de parámetros: un modelo que aprende cómo se comporta el mundo físico para poder razonar sobre el movimiento, la causalidad y las consecuencias de una acción. NVIDIA lo lanzó el 20 de julio de 2026 en su repositorio Cosmos 3 de Hugging Face.

Recibe visión, texto y audio (además de imágenes, video y trayectorias de acción) y produce tres tipos de salida: tokens de razonamiento, video y tokens de acción. En términos simples, un solo modelo observa una escena, determina lo que está sucediendo y emite las acciones motoras que un robot debería realizar a continuación, simplificando la canalización de "ver, razonar, actuar" que normalmente abarca varios sistemas separados.

La distinción respecto a sus hermanos está en dónde se ejecuta. Cosmos 3 Super y Nano, lanzados junto con la familia en GTC Taipei el 31 de mayo de 2026, están dirigidos a estaciones de trabajo y centros de datos. Edge es la variante diseñada para ejecutarse en el robot, el vehículo o la propia cámara industrial. El lanzamiento también amplió la Cosmos Coalition de NVIDIA, con empresas japonesas de robótica y manufactura, entre ellas Fanuc, Kawasaki Heavy Industries, Yaskawa, Sony y SoftBank, que se unieron para desarrollar sobre la plataforma.

Las cifras en el dispositivo, y lo que significan para un robot

NVIDIA cita tres cifras principales para Edge en un módulo Jetson Thor. Cada una se traduce en una restricción de ingeniería concreta:

  • Control en tiempo real de 15 Hz. El modelo cierra un ciclo completo de percepción a acción aproximadamente cada 67 milisegundos. Esto es lo suficientemente rápido para el control continuo en lazo cerrado de robots, como la manipulación estable y la navegación, aunque por debajo de las tasas que querrías para maniobras dinámicas de alta velocidad.
  • 32 acciones por inferencia. Una sola pasada hacia adelante emite una *secuencia* corta de acciones, no un solo paso. El robot obtiene un fragmento de movimiento পরিকল্পificado para ejecutar mientras se ejecuta la siguiente inferencia, lo que mantiene un bucle de 15 Hz fluido en lugar de brusco. La contrapartida es la capacidad de respuesta: un controlador que no puede interrumpir un fragmento reaccionará tarde ante una sorpresa, por lo que la fragmentación de acciones funciona mejor junto con la replanificación de horizonte rodante.
  • Observaciones de 640×360. Esa es la resolución sobre la que razona el modelo en el dispositivo. Es suficiente para rastrear objetos y predecir trayectorias, y es una compensación deliberada para ajustarse al presupuesto de cómputo. La inspección visual detallada no es para lo que sirve esta resolución.

La latencia en hardware más potente completa el resto del panorama. En una sola H100, Edge devuelve una política de robot (una acción DROID) en 1.25 segundos y ejecuta dinámicas directas e inversas (prediciendo el siguiente estado del mundo, o infiriendo la acción entre dos estados) en unos 3.6 segundos cada una. La generación completa de imagen a video es la operación más pesada, con 23.92 segundos, lo que te indica dónde el modelo es barato (acción y dinámicas) y dónde es costoso (generación).

Cosmos 3 Edge inference latency on a single H100, in seconds

Cómo un modelo de 4B tanto razona como actúa

Lograr que la comprensión *y* la generación quepan en 4 mil millones de parámetros proviene de la arquitectura. Edge ejecuta dos torres transformer que comparten sus capas de atención multimodal: una torre autoregresiva que se encarga del razonamiento y la comprensión al predecir el siguiente token, y una torre de difusión que se encarga de la generación mediante la eliminación iterativa de ruido. Como comparten la atención, el modelo puede fundamentar lo que genera en lo que ha razonado, haciendo "ver, luego actuar" en una sola red en lugar de una cadena de traspasos.

Edge se diferencia de sus hermanos de otra manera más. Cosmos 3 Nano y Super están construidos sobre pesos preentrenados de Qwen3-VL; Edge es un modelo denso entrenado desde cero para el caso extremo. Ese enfoque es la razón por la que un modelo de 4B compite en su clase aquí en lugar de parecer una reducción ingenua de uno más grande.

Edge vs Nano vs Super: cuál Cosmos 3 ejecutar

Las tres variantes no son niveles de lo mismo que eliges según el presupuesto; están adaptadas a *dónde se ejecuta físicamente el modelo*. Decide primero el hardware y luego sigue la variante.

VarianteParámetrosComposiciónHardware objetivoIdeal para
Edge4BDense, entrenado desde ceroJetson (incl. new T2000 / T3000), Jetson Thor, GeForce RTX, DGXEn el dispositivo, bucles robóticos en tiempo real
Nano16Brazonador de 8B + generador de 8B (Qwen3-VL)estación de trabajo RTX PRO 6000Inferencia en tiempo real de nivel estación de trabajo
Super64Brazonador de 32B + generador de 32B (Qwen3-VL)centro de datos Hopper / BlackwellMáxima calidad, generación sin conexión

Más allá de la tabla, la compensación que decide la mayoría de los proyectos es capacidad versus latencia. Edge es la única variante que cabe en el robot, pero su única pila densa tiene que compartir el tiempo entre el razonamiento y la generación; Nano y Super dividen eso en mitades separadas de razonador y generador, por lo que escalan la calidad aún más y por eso necesitan GPUs de workstation o de centro de datos para hacerlo. Descarta Edge cuando la tarea dependa de detalles visuales finos, control de alta velocidad o video de máxima fidelidad.

Benchmarks, en contexto

Entre los modelos de un tamaño similar de 4B, Cosmos 3 Edge ocupa el puesto #1 en VANTAGE-Bench para analítica de visión y es el estado del arte para el aprendizaje de políticas robóticas, las dos tareas a las que apunta. Para generación, produce video a partir de imagen a 480p y 24 fps con una calidad competitiva en las suites PAIBench y RBench, lo que lo hace adecuado para la generación de datos sintéticos y de previsualización en lugar de competir con modelos de video dedicados.

Eso encaja con la familia más amplia. En toda la línea Cosmos 3, NVIDIA informa clasificaciones de modelos abiertos n.º 1 en siete tablas de clasificación de IA física, que abarcan razonamiento (promedios de Robotics, Smart Space y Driving) y generación (R-Bench, Artificial Analysis, RoboLab y RoboArena). Estos son resultados informados por el proveedor, así que léalos como "el más fuerte en su clase de tamaño para percepción y control en el dispositivo", no como el modelo Cosmos más fuerte en general.

Dónde se queda corto Cosmos 3 Edge

Pequeño y en el dispositivo es un conjunto de compromisos, y vale la pena nombrarlos antes de comprometerse:

  • Techo de resolución. Las observaciones de 640×360 están bien para la predicción de trayectorias, pero son limitantes para tareas que dependen de detalles visuales finos, como la inspección de pequeños defectos.
  • Techo de capacidad. 4B de parámetros limitan cuánto razonamiento de largo horizonte y generación de alta fidelidad puede hacer el modelo. Cuando la calidad importa más que la latencia, Nano o Super son la opción correcta.
  • La adaptación se espera, no es opcional. NVIDIA documenta la personalización del modelo base para un robot, conjunto de sensores o entorno específicos en aproximadamente un día en un pequeño clúster H100 o DGX Station. Eso es rápido, pero también indica que el comportamiento listo para usar en un entorno desconocido y no estructurado suele necesitar ajustes primero.
  • La generación es una habilidad secundaria. El modelo puede generar video, pero ese no es su punto fuerte; trátelo como un modelo de percepción y acción que también puede generar, no como un modelo de generación.

Cómo ponerlo en marcha

Los pesos están disponibles públicamente en huggingface.co/nvidia/Cosmos3-Edge, publicados bajo la licencia OpenMDW 1.1, una licencia abierta para pesos de modelo que permite el uso comercial y el ajuste fino. (Algunas notas iniciales lo llamaban Apache 2.0; la tarjeta del modelo indica OpenMDW 1.1, así que revisa el texto de la licencia para conocer sus términos de atribución y distribución antes de ponerlo en producción.)

Para el despliegue, NVIDIA señala la optimización de los checkpoints con frameworks de inferencia abiertos como vLLM, junto con sus propios microservicios NIM, y la exportación a ONNX para llevar el modelo al hardware Jetson. La familia más amplia también incluye un Cosmos3OmniPipeline en Hugging Face Diffusers. Una ruta realista para un equipo de robótica es: descargar desde Hugging Face, hacer fine-tuning con los datos de tu propia tarea durante aproximadamente un día (según la guía de NVIDIA), y luego exportar e implementar en el dispositivo de destino.

Los mismos pesos funcionan en una amplia gama de hardware: módulos Jetson, incluidos los nuevos T2000 y T3000, Jetson Thor, GPUs GeForce RTX y RTX PRO, y sistemas DGX, de modo que el mismo modelo puede pasar del escritorio de un desarrollador a la máquina desplegada sin necesidad de reescribirlo.

Preguntas frecuentes

¿Cosmos 3 Edge es de código abierto?

Los pesos se pueden descargar abiertamente bajo la licencia OpenMDW 1.1, que permite el uso comercial y el fine-tuning. Eso lo convierte en "open weights" que puedes ejecutar y adaptar tú mismo, en lugar de un lanzamiento solo vía API; el código de entrenamiento y los datos son una cuestión aparte que el texto de la licencia detalla.

¿Qué hardware necesita Cosmos 3 Edge?

Está diseñado para ejecutarse en el dispositivo en los módulos NVIDIA Jetson (incluidos los recién anunciados T2000 y T3000) y Jetson Thor, y también se ejecuta en GPUs GeForce RTX y RTX PRO y en sistemas DGX. La cifra de control de 15 Hz se cita específicamente en Jetson Thor, así que espera tasas más bajas en módulos Jetson más pequeños.

¿Cuándo se lanzó Cosmos 3 Edge?

Cosmos 3 Edge se lanzó el 20 de julio de 2026, y se incorporó a la familia Cosmos 3, que debutó por primera vez en GTC Taipei el 31 de mayo de 2026.

Cosmos 3 Edge o Nano: ¿cuál debería usar?

Elija según dónde se ejecute el modelo. Si tiene que ejecutarse en el robot o en la propia cámara, use Edge (4B). Si se ejecuta en una estación de trabajo junto a la máquina, Nano (16B) ofrece más calidad a cambio del cómputo adicional.