AI News

NVIDIA 正透過為期一個月的本地 AI 行銷活動,強調一系列可在其硬體上執行的開放權重模型、開發者工具與社群專案。這份陣容涵蓋機器人、影片生成、程式設計與自主軟體代理,系統範圍從消費級 GeForce PC 到 NVIDIA DGX Spark 與 DGX Station。

這項公告與其說是單一產品發表,不如說是 NVIDIA 試圖圍繞其 GPU、軟體函式庫與緊湊型 AI 系統所打造之本地 AI 生態系的一個縮影。它也顯示,模型開發者正愈來愈多地瞄準較小、量化或稀疏啟用的系統,讓複雜工作負載能在雲端資料中心之外運行。

以本地優先為核心的發布潮

NVIDIA 表示,其 8 月的本地 AI 系列將介紹開源社群、合作夥伴、模型與應用程式,協助開發者在自己的機器上建構並自訂 AI 系統。公司會把這些專案與自身的開放模型、加速軟體與 آموزشی(教學)材料結合。

幾個受矚目的模型在技術上都很大,但設計目標是降低推論所需的硬體需求。例如,Poolside AI 的 Laguna S 2.1 被 NVIDIA 描述為一款 1180 億參數的 agentic coding 模型,適合長時間執行的任務。根據 NVIDIA,一個 NVFP4 checkpoint 可讓它在單一 DGX Spark 上執行,且降低運算與記憶體需求。

DeepSeek-V4-Flash 也是另一個例子。據稱,更新後的模型總參數為 2840 億,在 mixture-of-experts 架構中有 130 億個活躍參數,並擁有 100 萬 token 的上下文視窗。公司表示,社群打造的 GGUF 版本可在 NVIDIA DGX Station 上本地運作。

硬體焦點之所以重要,是因為本地部署改變了開發者所面臨的限制。模型團隊不再只是為雲端規模吞吐量最佳化,而必須考慮記憶體容量、量化、啟動時間、持續效能,以及讓系統持續可用的成本。

模型鎖定代理、創作者與機器人

對代理建構者來說,最直接相關的發布是 Meta 的 Muse Glimmer。NVIDIA 將其描述為一款 300 億參數的密集型開放權重模型,擁有超過 12 萬 token 的上下文視窗,並針對程式設計與本地 agentic AI 進行最佳化。

NVIDIA 表示,Muse Glimmer 在 RTX 5090 上每秒可產生超過 200 個 token。其混合注意力設計旨在讓代理在保留上下文、呼叫工具並完成多步驟任務時,仍能維持可控的記憶體與處理需求。這款模型被定位於函式呼叫、本地程式設計、自訂代理,以及在單一消費級 GPU 上進行模型評估。

根據公告,開發者可以將 Muse Glimmer 與 NemoClaw 結合,並使用 NVIDIA NeMo Automodel 在本地進行微調。這種組合可能吸引處理無法輕易送往外部模型供應商的私有或專門資料的團隊。不過,公告並未說明該模型在獨立代理基準測試或生產工作負載中的表現。

其他專案則對應不同形式的本地生成。NVIDIA 表示,Cosmos 3 Edge 是一款四十億參數的開放世界模型,適用於機器人、自主車輛與視覺應用。它可在 NVIDIA DGX Spark 與 NVIDIA Jetson 上執行,因此比需要資料中心基礎設施的模型更適合邊緣端實驗。

對創作者而言,MiniMax-H3 被描述為一款 330 億參數的開放權重模型,可從文字、圖片、影片、音訊或這些輸入的組合生成具同步立體聲音訊的影片。它可透過 ComfyUI 使用,且有為 NVIDIA GPU 最佳化的 checkpoints。

阿里巴巴的 Wan-Animate-2 是一款 140 億參數模型,可將驅動影片中的動作與臉部表情轉移到靜態角色圖片上。NVIDIA 表示,它在 ComfyUI 中自第一天即支援,並且在 RTX PRO 5000 Blackwell 上的速度比 Apple M3 Ultra 快最多 16 倍,在 RTX 5090 上快最多 26 倍。這些比較是 NVIDIA 提供的,不能視為獨立效能測量。

證據主要集中在 NVIDIA 自身的說法

目前可得的證據來自 NVIDIA 的官方部落格,以及該貼文在 Google News 上的重複列表。所提供的材料中,沒有獨立報導可用來驗證受介紹系統的效能數字、採用訊號或實際可靠性。

這種區分很重要。像 Muse Glimmer 每秒超過 200 個 token、Wan-Animate-2 的相對速度,以及 LTX-2.5 的效率提升,都是有助於理解 NVIDIA 定位的指標,但不能取代跨模型版本、量化設定、批次大小與完整工作流程的可重現測試。

NVIDIA 也以需要謹慎解讀的術語介紹了多個專案。有些被稱為 open source,有些則被描述為 open weight。Open weight 可能允許開發者下載並執行模型,而不提供完整訓練程式碼、資料,或不受限制的商業權利。評估這些系統的建構者,在商業部署前需要檢視每個模型的授權、checkpoint 限制與再散布條款。

LTX-2.5 展現了這場活動的廣度。這款影片模型新增了多鏡頭生成、改良的解碼、生成式編輯與提示詞增強。NVIDIA 表示,它針對 RTX GPU、DGX Spark 與 DGX Station 進行最佳化,在 RTX 6000 PRO GPU 上可獲得最高 20% 的效能提升與 40% 的記憶體節省。公司將這些進展歸功於其本地最佳化工作,包括 NVFP4、FastVideo 與 ComfyUI 增強。

Unsloth Desktop 是這個生態系中另一個值得注意的部分。NVIDIA 表示,這款完全開源的桌面應用程式結合了本地推論、圖片與影片擴散、微調、代理整合、網路研究與程式碼執行。這項產品的重要性與其說在於單一基準,不如說在於工作流程整合:開發者可能可以在訓練、推論與代理實驗之間切換,而不必組裝多個分離的工具。

本地部署對建構者意味著什麼

對獨立開發者與產品團隊而言,這些發布指向更模組化的 AI 開發方式。團隊可以使用像 Muse Glimmer 這類緊湊模型進行本地程式設計或工具使用,使用視覺模型進行邊緣感知,並透過 ComfyUI 使用影片模型,同時將資料與中間輸出保留在受控硬體上。

這種架構可降低對 API 可用性與按用量計費雲端費用的依賴,也有助於隱私敏感工作負載、離線運作與低延遲應用。不過,這些好處伴隨代價:本地系統需要採購硬體、維護軟體、更新模型,以及審慎規劃容量。

代理可靠性仍然是一個核心且尚未解決的問題。更大的上下文視窗與更快的 token 生成,可以讓代理看起來更靈敏,但這並不能單獨保證工具選擇正確、安全執行,或長任務成功完成。團隊需要衡量的是失敗恢復、權限、資料外洩與每個完成工作流程的成本,而不只是速度。

這些模型發布也強化了 NVIDIA 更廣泛的策略。透過支援消費級 GPU、工作站、邊緣設備與 DGX 系統上的本地推論,公司正試圖讓自家硬體成為廣泛開放模型的預設執行層。這為開發者創造機會,同時也提高了在競爭晶片與執行環境之間可攜性的的重要性。

接下來值得觀察的重點

接下來有用的訊號將是對這些模型在記憶體使用、吞吐量、品質與長時間代理表現方面的獨立測試。開發者也應留意所宣稱的 checkpoints 是否持續可得、授權是否允許商業部署,以及重現 NVIDIA 結果需要多少設定。

對企業採購者而言,實務問題包括部署支援、安全控制、模型治理,以及與現有開發工具的整合。對研究者與創業者來說,更重要的訊號可能是本地模型生態系是否能在不依賴專有雲端端點的情況下持續快速改進。

NVIDIA 的系列預計會在 8 月持續更新。這些新增內容或可釐清,這主要是一場硬體行銷活動,還是本地 AI 系統出現持久社群採用的證據。

Creati.ai 觀點

NVIDIA 將本地 AI 描繪為一個生態系,而不是單一裝置:模型、量化方法、桌面應用程式、代理框架與硬體是一起推廣的。這種做法在策略上是一致的,因為每一次新的 open-weight 發布都可能創造對 NVIDIA 系統的需求,而每一次硬體改善都讓更多模型能夠實際在本地執行。

對開發者而言,機會是真實存在的,尤其是在私有、離線與低延遲工作流程中。不過,這份公告仍然是由供應商控制的證據。最強的主張只有在開發者能夠重現、可靠運行系統,並在符合自身產品條件下使用模型時才會真正有意義。

精選

NVIDIA 在其 AI 硬體生態系中展示開放模型與本地代理工具

NVIDIA 正在展示開放權重模型與本地 AI 工具,讓開發者能在其硬體上執行代理、程式設計、影片與機器人工作負載。