
NVIDIA 正將開放式世界模型視為實體 AI 的關鍵層,主張機器人、自動駕駛車與工業視覺系統需要能預測環境如何變化的模型——而不僅僅是描述它們看起來如何。該公司最新的 NVIDIA Blog 文章將 NVIDIA Cosmos 3、Omniverse 與 OpenUSD 放在這項策略的核心。
這則公告與其說是新產品發表,不如說是 NVIDIA 實體 AI 技術堆疊的方向宣示。公司表示,開放模型可讓開發者下載、檢視、修改並在自有基礎設施上執行系統,之後再將其調整為特定的機器人、感測器、車輛與作業環境。隨著實體 AI 從示範走向部署,這種專門化正逐漸成為實務上的必要條件。
實體 AI 系統必須面對後果、不確定性與罕見情況。機器人可能需要預測物體在接觸後是否會移動;自動駕駛車必須推理不尋常的道路事件;視覺系統可能需要解讀變化中的光線、天氣或工業活動。NVIDIA 表示,傳統資料集在所需規模下蒐集成本高昂,尤其是對於在現實世界中難以或不安全重現的長尾情境更是如此。
世界模型透過學習場景、動作與未來狀態之間的關係來解決這個問題。它們可以生成具有物理基礎的資料、模擬可能結果,並協助團隊在部署前測試策略。NVIDIA 將開放式世界模型描述為可針對特定任務調整的基礎,而不是可直接適用於任何環境的完整智慧系統。
該公司將此論點與其參與 7 月由 NVIDIA 與 200 多家企業及組織共同簽署的「Open Weights and American AI Leadership」公開信連結。該信主張,AI 領導力應以開放生態系統能否覆蓋廣泛產業來衡量,而非單一前沿模型的表現。這份聲明屬於倡議立場,而非市場採用的獨立證據,但它說明了 NVIDIA 對可下載權重與開發者控制的重視。
NVIDIA 表示,NVIDIA Cosmos 3 的設計目標是將視覺推理、世界生成與動作預測整合到同一個模型家族中。開發者可將它用作視覺語言模型、未來世界狀態的模擬器、合成資料生成器,或是專用世界-動作模型的基礎。
這個家族包括 Cosmos 3 Super,這是一個 640 億參數模型,目標是高保真世界建模;Cosmos 3 Nano 具備 160 億參數,適合更高效率的推理與後訓練;而 Cosmos 3 Edge 則是 40 億參數模型,旨在支援裝置端視覺推理與機器人策略部署。NVIDIA 表示,Cosmos 3 Edge 可跨 RTX GPU、DGX 系統與 Jetson 硬體執行,包括 Jetson Thor 平台。
NVIDIA 也表示,其世界基礎模型是依照 Linux Foundation 的 OpenMDW 1.1 授權釋出。根據公司說法,該授權允許團隊以自己的資料與硬體對模型進行後訓練。對建構者而言,重要的不僅是取得模型權重,還包括能在不將敏感營運資料送往外部服務的情況下修改模型。
周邊工具同樣重要。NVIDIA Omniverse 的函式庫提供建立可供模擬環境的能力,而 OpenUSD 則提供一個開放框架,可在數位孿生、模擬與合成資料工作流程之間組合與交換 3D 資料。原則上,當開發者更改資產、感測器設定或環境條件時,這種組合可以減少重複工作。
這份公告中最強的效能與採用主張都來自 NVIDIA 自身。公司表示,Cosmos 3 在多項評估中名列第一,包括 Artificial Analysis 的開放權重文字轉圖片與圖片轉影片生成類別、PAI-Bench 的世界生成,以及 Physics-IQ 的圖片轉影片類別。NVIDIA 也回報在 RoboLab 的機器人策略評測中排名第一,並表示 Cosmos 3 Super 是 VANTAGE-Bench 視覺理解項目中排名最高的開放模型。
這些結果顯示了 NVIDIA 希望市場將 Cosmos 3 與哪些能力聯想在一起,但來源並未提供底層分數、測試設定或獨立重現。因而,基準測試領先應被視為供應商自述,而非可證明模型在特定生產環境中會優於替代方案的決定性證據。
NVIDIA 也列出在機器人領域與 Doosan Robotics、LG Electronics、Samsung Electronics 與 Skild AI 的部署或合作;在自動駕駛車領域與 Li Auto、Xiaomi 與 Afari 的合作;以及多家投入工業與智慧空間視覺系統的公司。公告並未量化使用量、正式部署、營收或效能提升。這些名稱顯示生態系統的參與,但並不能證明 Cosmos 3 已成為標準平台。
對 AI 建構者而言,NVIDIA 的主張是一條更整合的開發路徑:用 Cosmos 3 生成或推理情境,透過 Omniverse 與 OpenUSD 建立環境,在模擬中訓練或測試策略,然後將最佳化模型移到邊緣裝置。當真實世界資料昂貴、涉及安全風險或過於稀少而不足以覆蓋罕見事件時,這種工作流程可能很有價值。
代價是複雜度。即使某個世界模型在一般場景表現良好,也可能無法理解企業特定的機器人幾何結構、攝影機位置、感測器雜訊或作業程序。後訓練仍然必要,而如果環境無法準確呈現接觸、運動、天氣或人類行為,模擬品質就可能成為瓶頸。
NVIDIA 更廣泛的實體 AI 產品組合反映了這種專門化策略。Isaac GR00T 對應機器人技術,Alpamayo 針對自動駕駛車,Metropolis 則支援視覺 AI。公司實際上是圍繞共同的硬體與模擬生態系統,提供一系列面向特定領域的元件,而不是要求客戶採用單一通用模型。
對企業來說,實務問題將涉及授權、硬體成本、資料治理、驗證與營運可靠性。將模型部署在自有基礎設施上可能提升對敏感資料的控制,但也可能把模型服務、監控與更新的負擔轉移給客戶。在安全關鍵環境中,合成資料與模擬會支援測試——但不會取代真實世界驗證的需求。
下一批有意義的訊號將是獨立基準測試結果,需公開評估設定,並將 Cosmos 3 與其他開放及專有世界模型比較。實際生產證據比合作夥伴名單更重要:買家應留意訓練時間、策略成功率、故障偵測或部署成本的可量化改善。
Cosmos Coalition 擴展至日本也是值得追蹤的發展。公司表示,機器人與製造業領導者打算為工廠、物流、農業、營建、醫療與運輸貢獻模型、研究與評估方法。這些努力是否會產生可重複使用的資料集、公開評估或特定領域模型,將顯示生態系在實務上有多開放。
Cosmos 3 Edge 在 Jetson 硬體上的可用性與易用性也很重要。邊緣部署可降低延遲與對連線的依賴,但前提是較小模型在真實感測與運算限制下仍能維持可接受的可靠性。
NVIDIA 的公告指出了實體 AI 中一個真實的瓶頸:團隊需要的不只是能力強的模型。他們還需要可控的權重、專門訓練、逼真的環境,以及在機器與人員及昂貴設備共處前,能反覆測試行為的方法。
公司的優勢在於試圖透過 Cosmos 3、NVIDIA Omniverse、OpenUSD 與其硬體平台將這些層級串接起來。尚待解答的問題是,開放性與基準測試結果是否能轉化為可靠且經濟的部署。對建構者與企業買家而言,關鍵證據將來自透明評估與在明確定義環境中的營運結果,而不僅僅是 NVIDIA 生態系敘事的廣度。
NVIDIA 正將開放式世界模型與 Cosmos 3 定位為可調適的實體 AI 基礎,涵蓋從機器人訓練到自動駕駛車與視覺系統。