工厂车间里的机器人必须看见场景、预测它将如何变化,并且在比往返云端 GPU 更快的时间内决定下一步动作。NVIDIA 构建 Cosmos 3 Edge 正是为了这个循环:它是 Cosmos 系列中第一个缩减到 40 亿参数的世界模型,因此可以在机器本身上运行,而不是在数据中心中运行。它适用于 Jetson 级硬件上的端侧机器人循环,但正如下方数据所示,当你需要最高质量时,它并不能直接替代更大的 Cosmos 模型。
什么是 Cosmos 3 Edge
Cosmos 3 Edge 是一个 40 亿参数的开放“世界模型”:一种学习物理世界如何运作的模型,因此它可以推理运动、因果关系以及某个动作的后果。NVIDIA 于 2026 年 7 月 20 日在其 Hugging Face Cosmos 3 仓库中发布了它。
它接收视觉、文本和音频(以及图像、视频和动作轨迹),并生成三类输出:推理 token、视频和动作 token。通俗地说,一个模型观察场景,推断正在发生什么,并输出机器人接下来应采取的运动动作,从而将通常跨越多个独立系统的“看、推理、行动”流程压缩为一个整体。
与其同系列产品的区别在于它运行的位置。Cosmos 3 Super 和 Nano 与该家族一同于 2026 年 5 月 31 日在 GTC Taipei 发布,面向工作站和数据中心。Edge 是专为在机器人、车辆或工业相机本体上运行而设计的变体。此次发布还扩大了 NVIDIA 的 Cosmos Coalition,日本机器人和制造企业也加入其中,包括 Fanuc、Kawasaki Heavy Industries、Yaskawa、Sony 和 SoftBank,签约在该平台上进行开发。
设备端数字,以及它们对机器人的意义
NVIDIA 为 Jetson Thor 模块上的 Edge 引用了三个关键指标。每一项都对应着一个具体的工程约束:
- 15 Hz 实时控制。 该模型大约每 67 毫秒完成一次完整的感知到动作闭环。这足够快,可用于连续闭环机器人控制,例如稳定操作和导航,不过低于你在高速动态机动中希望达到的频率。
- 每次推理输出 32 个动作。 一次前向传播输出的是一小段*动作序列*,而不是单个步骤。机器人会在下一次推理运行时执行一段计划好的运动块,这正是让 15 Hz 循环保持平滑而不是生硬的原因。代价是响应性:如果控制器不能中断一个动作块,它就会对突发情况反应滞后,因此动作分块最适合与滚动时域重规划配合使用。
- 640×360 观测。 这是模型在设备端进行推理时所使用的分辨率。它足以跟踪物体并预测轨迹,而且这是为了适配计算预算而做出的有意权衡。这种分辨率并不适合进行精细的视觉检查。
在更大规模硬件上的延迟补全了剩余情况。在单个 H100 上,Edge 会在 1.25 秒内返回一个机器人策略(DROID 动作),并且前向和逆向动力学(预测下一个世界状态,或推断两个状态之间的动作)各自运行时间约为 3.6 秒。完整的图像到视频生成是最耗时的操作,需要 23.92 秒,这说明了模型在哪些方面成本低(动作和动力学),以及在哪些方面成本高(生成)。
4B 模型如何同时进行推理和行动
将理解*和*生成都纳入 40 亿参数规模,得益于其架构。Edge 运行两个共享多模态注意力层的 transformer 塔:一个自回归塔,通过预测下一个 token 来处理推理和理解;一个扩散塔,通过迭代去噪来处理生成。由于它们共享注意力,模型能够将生成内容建立在其推理过的内容之上,在单一网络中实现“先看,再行动”,而不是一连串交接。
Edge 与其兄弟模型还有一个不同之处。Cosmos 3 Nano 和 Super 是基于预训练的 Qwen3-VL 权重构建的;Edge 则是一个从头训练的稠密模型,专为边缘场景而设计。这种专注使得这里的 4B 模型能够在同级别中展开竞争,而不是被看作对更大模型的简单缩小版。
Edge vs Nano vs Super:运行哪款 Cosmos 3
这三种变体不是你按预算选择的同一事物的不同层级;它们是根据*模型实际运行的位置*来匹配的。先确定硬件,然后再选择变体。
| 变体 | 参数 | 组成 | 目标硬件 | 最适合 |
|---|---|---|---|---|
| Edge | 4B | Dense, 从头训练 | Jetson(包括新的 T2000 / T3000)、Jetson Thor、GeForce RTX、DGX | 设备端、实时机器人循环 |
| Nano | 16B | 8B reasoner + 8B generator (Qwen3-VL) | RTX PRO 6000 工作站 | 工作站级实时推理 |
| Super | 64B | 32B reasoner + 32B generator (Qwen3-VL) | Hopper / Blackwell 数据中心 | 最高质量,离线生成 |
除了表格之外,决定大多数项目的权衡是容量与延迟。Edge 是唯一能装在机器人上的变体,但它的单个密集堆栈必须在推理和生成之间分时共享;Nano 和 Super 则将它们拆分为独立的推理器和生成器两部分,这也是它们能够进一步提升质量,以及为什么它们需要工作站或数据中心 GPU 来实现这一点。若任务取决于精细的视觉细节、高速控制或最高保真度的视频,则应排除 Edge。
基准测试,结合上下文来看
在类似 4B 规模的模型中,Cosmos 3 Edge 在 VANTAGE-Bench 的视觉分析任务中排名第 1,并且在其面向的两项任务——机器人策略学习——上达到了业界领先水平。对于生成任务,它可以以 480p 和 24 fps 生成 image-to-video,在 PAIBench 和 RBench 套件上具有有竞争力的质量,更适合合成数据和预览生成,而不是与专门的视频模型竞争。
这与更广泛的家族相契合。在整个 Cosmos 3 产品线中,NVIDIA 报告在七个物理 AI 排行榜上位居开源模型第 1 名,涵盖推理(Robotics、Smart Space 和 Driving 平均值)以及生成(R-Bench、Artificial Analysis、RoboLab 和 RoboArena)。这些结果由供应商报告,因此可将其理解为“在设备端感知和控制方面,在其规模级别中最强”,而不是整个 Cosmos 模型中最强。
Cosmos 3 Edge 的不足之处
小型和端侧部署是一组权衡,在你决定采用之前,值得先说明:
- 分辨率上限。 640×360 的观测对于轨迹预测来说足够,但对于依赖精细视觉细节的任务(例如小缺陷检测)则会受到限制。
- 容量上限。 4B 参数限制了模型能够进行多少长程推理和高保真生成。在质量比延迟更重要时,应选择 Nano 或 Super。
- 适配是预期内的,而非可选项。 NVIDIA 文档说明,可在一台小型 H100 或 DGX Station 集群上,约一天内将基础模型定制到特定机器人、传感器组合或环境。这虽然很快,但也表明在不熟悉、非结构化环境中的开箱即用行为通常需要先进行调优。
- 生成是次要能力。 该模型可以生成视频,但这并不是它的优势所在;应将其视为一个也能生成内容的感知与行动模型,而不是一个生成模型。
如何运行它
权重已公开于 huggingface.co/nvidia/Cosmos3-Edge,并在 OpenMDW 1.1 许可下发布,这是一项允许商业使用和微调的开放模型权重许可。(一些早期报道将其称为 Apache 2.0;模型卡列出的是 OpenMDW 1.1,因此在正式发布前,请先查看其许可证文本,了解其署名和分发条款。)
对于部署,NVIDIA 指出可以使用开源推理框架(如 vLLM)来优化 checkpoints,同时结合其自家的 NIM microservices,以及用于将模型推送到 Jetson 硬件上的 ONNX export。更广泛的家族还在 Hugging Face Diffusers 中提供了一个 Cosmos3OmniPipeline。对于 robotics 团队来说,一个现实的路径是:从 Hugging Face 下载,在自己的任务数据上进行大约一天的 fine-tune(按照 NVIDIA 的指导),然后导出并部署到设备端目标上。
相同的权重可在广泛的硬件范围内运行:包括新款 T2000 和 T3000、Jetson Thor、GeForce RTX 和 RTX PRO GPU 以及 DGX 系统在内的 Jetson 模块,因此同一个模型可以从开发者的桌面直接迁移到部署机器,而无需重写。
常见问题
Cosmos 3 Edge 是开源的吗?
这些权重可根据 OpenMDW 1.1 许可证公开下载,该许可证允许商业使用和微调。这意味着它是你可以自行运行和调整的“开放权重”,而不是仅通过 API 发布;训练代码和数据则是许可证文本中单独说明的另一回事。
Cosmos 3 Edge 需要什么硬件?
它旨在 NVIDIA Jetson 模块(包括新发布的 T2000 和 T3000)以及 Jetson Thor 上的设备端运行,同时也可在 GeForce RTX 和 RTX PRO GPU 以及 DGX 系统上运行。15 Hz 的控制频率是专门针对 Jetson Thor 报出的,因此在较小的 Jetson 模块上可预期更低的速率。
Cosmos 3 Edge 是什么时候发布的?
Cosmos 3 Edge 于 2026 年 7 月 20 日发布,加入了于 2026 年 5 月 31 日在 GTC Taipei 首次亮相的 Cosmos 3 家族。
Cosmos 3 Edge 还是 Nano:我应该使用哪一个?
根据模型运行的位置进行选择。如果必须在机器人或摄像头本身上运行,请使用 Edge(4B)。如果它运行在机器旁边的工作站上,Nano(16B)会用额外的算力换来更高的质量。
