工廠地板上的機器人必須看見場景、預測它將如何變化,並且比往返雲端 GPU 所需的時間更快地決定下一步動作。NVIDIA 為了這個迴圈打造了 Cosmos 3 Edge:它是 Cosmos 家族中第一個縮小到 40 億參數的世界模型,因此可以直接在機器本身上執行,而不是在資料中心中運行。它適用於 Jetson 級硬體上的裝置端機器人迴圈,但如下方數據所示,當你需要最高品質時,它並不能直接取代較大的 Cosmos 模型。
Cosmos 3 Edge 是什麼
Cosmos 3 Edge 是一個 40 億參數的開放「世界模型」:一種學習物理世界如何運作的模型,因此它可以推理運動、因果關係以及行動的後果。NVIDIA 於 2026 年 7 月 20 日在其 Hugging Face Cosmos 3 repository 中釋出它。
它可接收視覺、文字和音訊(以及圖片、影片和動作軌跡),並產生三種輸出:推理 tokens、影片和動作 tokens。簡單來說,單一模型會觀察場景、推斷正在發生什麼事,並輸出機器人下一步應採取的馬達動作,將通常跨越多個獨立系統的「看、推理、行動」流程整合在一起。
與其同系列產品的區別在於其運行位置。Cosmos 3 Super 和 Nano 於 2026 年 5 月 31 日在 GTC Taipei 與該系列一同發布,目標是工作站與資料中心。Edge 則是專為在機器人、車輛或工業攝影機本體上執行而設計的版本。此次發表也擴大了 NVIDIA 的 Cosmos Coalition,並有包括 Fanuc、Kawasaki Heavy Industries、Yaskawa、Sony 和 SoftBank 在內的日本機器人與製造公司加入,承諾在該平台上進行開發。
裝置端數據,以及它們對機器人意味著什麼
NVIDIA 為 Jetson Thor 模組上的 Edge 引用了三個關鍵數字。每一個都轉化為具體的工程限制:
- 15 Hz 即時控制。 該模型大約每 67 毫秒完成一次從感知到動作的完整迴圈。這個速度足以支援持續的閉迴路機器人控制,例如穩定的操作與導航,但仍低於你在高速動態動作中所期望的頻率。
- 每次推論 32 個動作。 單次前向傳播會輸出一小段動作*序列*,而不是單一步驟。機器人在下一次推論執行時,會獲得一段規劃好的運動片段來執行,這正是讓 15 Hz 迴圈保持平順而非顛簸的原因。其權衡在於反應性:無法中斷片段的控制器,對突發狀況的反應會較慢,因此動作分塊最適合與遞迴式視野重規劃搭配使用。
- 640×360 觀測。 這是模型在裝置端進行推理時所使用的解析度。它足以追蹤物體並預測軌跡,而且這也是為了符合運算預算而刻意做出的取捨。這個解析度並不是用於細緻的視覺檢查。
在較大硬體上的延遲補全了整體圖景。在單一 H100 上,Edge 會在 1.25 秒內回傳機器人策略(DROID 動作),並以約 3.6 秒分別執行前向與反向動力學(預測下一個世界狀態,或推斷兩個狀態之間的動作)。完整的影像到影片生成是最耗費的操作,需要 23.92 秒,這說明了模型在哪些地方成本較低(動作與動力學),以及哪些地方成本較高(生成)。
4B 模型如何同時推理與行動
將理解*和*生成納入 40 億個參數之內,來自於架構設計。Edge 運行兩個 transformer 主幹,並共享其多模態注意力層:一個自回歸主幹透過預測下一個 token 來處理推理與理解,另一個 diffusion 主幹則透過迭代去噪來處理生成。由於它們共享注意力,模型能將所生成的內容建立在其已推理出的內容之上,在單一網路中完成「先看,再行動」,而不是透過一連串交接來實現。
Edge 與其同系列產品還有另一個不同之處。Cosmos 3 Nano 和 Super 是建立在預訓練的 Qwen3-VL 權重之上;Edge 則是一個為 edge case 從頭訓練的稠密模型。正因為這樣的專注,這裡的 4B 模型才能在同級中具備競爭力,而不是被看作是一個較大模型的天真縮放版本。
Edge vs Nano vs Super:該執行哪個 Cosmos 3
這三個變體不是你依預算選擇的同一件事的不同等級;它們是依照模型實際運行的位置來匹配的。先決定硬體,再選擇變體。
| 版本 | 參數量 | 組成 | 目標硬體 | 最適合 |
|---|---|---|---|---|
| Edge | 4B | Dense,從頭訓練 | Jetson(含新的 T2000 / T3000)、Jetson Thor、GeForce RTX、DGX | 裝置端、即時機器人迴圈 |
| Nano | 16B | 8B reasoner + 8B generator (Qwen3-VL) | RTX PRO 6000 工作站 | 工作站級即時推理 |
| Super | 64B | 32B reasoner + 32B generator (Qwen3-VL) | Hopper / Blackwell 資料中心 | 最高品質、離線生成 |
除了表格之外,決定大多數專案的取捨是容量與延遲之間的平衡。Edge 是唯一能裝在機器人上的版本,但其單一的密集堆疊必須在推理與生成之間分時共享;Nano 和 Super 則將這兩者拆分為獨立的推理與生成兩半,這就是它們能進一步提升品質,以及為何它們需要工作站或資料中心 GPU 才能做到的原因。若任務取決於精細的視覺細節、高速控制,或最高保真度的影片,請排除 Edge。
基準測試,置於脈絡中
在相近 4B 規模的模型中,Cosmos 3 Edge 在 VANTAGE-Bench 的視覺分析方面排名第 1,並且在其所瞄準的兩項任務中——機器人策略學習——達到最先進水準。至於生成方面,它可輸出 480p、24 fps 的 image-to-video,並在 PAIBench 和 RBench 套件上展現具競爭力的品質,這使它更適合用於合成資料與預覽生成,而非與專門的影片模型競爭。
這符合更廣泛的系列。在 Cosmos 3 全系列中,NVIDIA 在七個實體 AI 排行榜上報告了 #1 的開放模型排名,涵蓋推理(Robotics、Smart Space 和 Driving 平均值)以及生成(R-Bench、Artificial Analysis、RoboLab 和 RoboArena)。這些結果由供應商自行報告,因此請將其解讀為「在其尺寸級別中,最強的裝置端感知與控制模型」,而非整體最強的 Cosmos 模型。
Cosmos 3 Edge 的不足之處
小型與裝置端是一組取捨,在你投入之前,值得先點出來:
- 解析度上限。 640×360 的觀測值對軌跡預測來說足夠,但對於依賴細微視覺細節的任務(例如小缺陷檢測)則有所限制。
- 容量上限。 40 億參數限制了模型能夠進行多少長程推理與高保真生成。當品質比延遲更重要時,Nano 或 Super 才是正確選擇。
- 適應是預期中的需求,而非可有可無。 NVIDIA 文件指出,針對特定機器人、感測器組合或環境客製化基礎模型,在一台小型 H100 或 DGX Station 叢集上大約一天即可完成。這很快,但也表示在不熟悉、非結構化的環境中,開箱即用的行為通常需要先調整。
- 生成是次要能力。 這個模型可以生成影片,但那並不是它的強項;應將其視為一個同時也能生成的感知與動作模型,而不是生成模型。
如何讓它運作
權重已公開於 huggingface.co/nvidia/Cosmos3-Edge,並依 OpenMDW 1.1 授權釋出,這是一個允許商業使用與微調的開放模型權重授權。(有些早期報導將其稱為 Apache 2.0;模型卡列出的是 OpenMDW 1.1,因此在正式上線前,請先查看授權條款中的署名與散布規定。)
在部署方面,NVIDIA 指出可透過 vLLM 等開放推理框架來最佳化 checkpoints,同時搭配其自家的 NIM 微服務,以及用於將模型推送到 Jetson 硬體上的 ONNX 匯出。更廣泛的家族也在 Hugging Face Diffusers 中提供了一個 Cosmos3OmniPipeline。對於機器人團隊來說,一條切實可行的路徑是:從 Hugging Face 下載,針對自己的任務資料進行大約一天的微調(依 NVIDIA 的指引),然後匯出並部署到裝置端目標。
相同的權重可在廣泛的硬體範圍內運行:包括新的 T2000 和 T3000、Jetson Thor、GeForce RTX 和 RTX PRO GPU,以及 DGX 系統,因此同一個模型可以從開發者的桌面電腦直接移植到部署中的機器,而無需重寫。
常見問題
Cosmos 3 Edge 是開源的嗎?
這些權重可依據 OpenMDW 1.1 授權條款公開下載,允許商業使用與微調。這使其成為你可以自行執行與調整的「開放權重」,而不是僅透過 API 提供的版本;訓練程式碼與資料則是另一個問題,授權文字中已有說明。
Cosmos 3 Edge 需要什麼硬體?
它設計為可在 NVIDIA Jetson 模組(包括新近公布的 T2000 和 T3000)以及 Jetson Thor 上於裝置端執行,也可在 GeForce RTX 和 RTX PRO GPU 以及 DGX 系統上運行。15 Hz 的控制數值是專門針對 Jetson Thor 所引用,因此在較小的 Jetson 模組上預期會有較低的速率。
Cosmos 3 Edge 是什麼時候發布的?
Cosmos 3 Edge 於 2026 年 7 月 20 日推出,加入了 Cosmos 3 系列,該系列最初於 2026 年 5 月 31 日在 GTC Taipei 首次亮相。
Cosmos 3 Edge 或 Nano:我應該使用哪一個?
根據模型執行的位置來選擇。如果必須在機器人或攝影機本體上執行,請使用 Edge(4B)。如果是在機器旁邊的工作站上執行,Nano(16B)則能以額外的運算資源換取更好的品質。
