AI News

NVIDIA 推出了 Nemotron 3.5 Lightning,一款 300 億參數的 mixture-of-experts 模型,並同時發表 NeMo Switchyard,一個用於在多個 AI 模型之間路由請求的開放原始碼函式庫。公司表示,這些發表是為了支援全天候運作的 agentic 系統,這類系統必須在準確度、回應時間、營運成本與部署控制之間取得平衡。

這次發表反映出 NVIDIA 對開放模型定位的轉變。公司並未將 Lightning 描述為可取代所有 frontier model 的單一方案,而是將其視為可在大型系統內處理高流量任務的專業模型。Switchyard 的目標是決定 agent workflow 的每個步驟應由哪個模型處理,進而可能減少送往更昂貴模型的請求數量。

多代理系統的專業模型

Nemotron 3.5 Lightning 被定位用於 code review、工具使用、安全警示監控以及帳單支援等特定工作負載。NVIDIA 表示,更大型的推理模型可以規劃或協調作業,而較小的專業模型則可執行個別任務。這種架構對於打造持續運作、而非僅回應偶發聊天提示的代理程式開發者來說,越來越重要。

根據 NVIDIA 的說法,這款模型是開放且可自訂的。組織可使用 NVIDIA NeMo 以自身的領域資料、工具與工作流程進行後訓練。NVIDIA 也發布了 Nemotron-RL-Agentic-Terminal-Pivot,這是一個在模型後訓練中用於 coding-agent 能力的強化學習資料集。

公司表示,Lightning 的輸出速度最高可快 4 倍,完成 agentic 任務的速度比同級其他模型快 30%。這些都是 NVIDIA 所主張的效能數據,並非根據所提供證據獨立驗證的結果。可取得的公告並未詳列比較對象與測試條件,因此買家需要用自己的提示、工具與硬體來驗證這些效益。

NVIDIA 表示,該模型可在 NVIDIA RTX PC、DGX Spark、DGX Station、Jetson 系統、RTX PRO 工作站、資料中心與雲端環境中執行。這樣的部署範圍對於處理敏感資料,或希望使用既有基礎設施而非將每個請求都送到託管 API 的團隊而言,特別重要。

Switchyard 將模型選擇變成基礎設施

NeMo Switchyard 處理的是 agent 開發中的一個實際問題:不同任務常常需要不同模型,但手動管理這些決策會變成巨大的整合負擔。NVIDIA 的函式庫可以在組織的開放、專有與 NVIDIA 模型組合之間路由請求,而不需要開發者重寫應用程式。

這個路由器可以針對品質、延遲與成本等優先項目進行調校。在一個使用 frontier model 進行規劃、但以較小模型執行例行工作的系統中,這種方法可能讓模型選擇成為應用程式執行期間的一部分,而不是固定的架構決策。

NVIDIA 的說法也指向 AI 基礎設施的更廣泛變化。由於代理在單一工作流程中會進行多次呼叫,token 使用量與延遲會快速累積。只將困難請求送往高階模型的路由層,可能比單一模型的基準分數小幅提升更有價值,尤其在客服、程式設計、安全與後勤辦公室自動化方面。

Switchyard 將以開放原始碼函式庫形式提供。NVIDIA 表示,正與生態系夥伴合作,將路由整合至既有開發工具與平台,包括 Kong AI Gateway、LiteLLM 以及 Nous Research 的 Hermes。LangChain 也被列為整合夥伴,而 Cognition 已在 Devin Desktop 上測試分層路由器,供 NVIDIA 內部使用。

效能證據顯示了什麼——以及沒有顯示什麼

NVIDIA 報告指出,內部基準測試在維持 frontier 等級準確度的同時,將任務完成成本降至僅使用 Opus 4.8 的將近三分之一。由於該基準測試是內部且由供應商控制,這項主張應被視為方向性訊號,而非普遍保證。結果會取決於模型池、路由策略、工作負載組成,以及組織可接受多少品質下降。

夥伴案例提供了額外但仍由供應商提供的訊號。NVIDIA 表示,Boomi 在五項路由能力上達到 100% 的領域路由準確度,將 59% 的流量送往一個經過微調、速度快 5 倍的模型,並將後續回合延遲降低 21%。Classmethod 報告在維持品質下先行降低 27% 成本,而 Cognition 則報告相較於將所有請求送往單一 frontier model,平均成本降低 28%。

其他引用結果則不盡相同。NVIDIA 表示,Cadence 在正式驗證的使用案例中提升了 9.9% 的效率。LangChain 則回報,在 145 個 Deep Agents 多回合任務中,僅將 7% 的呼叫送往 frontier model,便讓成本降低 74%,但準確度犧牲 6%。這些數字說明了路由的核心取捨:節省可能相當可觀,但更低成本可能伴隨準確度、延遲或工作流程行為的改變。

NVIDIA 也指出 CrowdStrike、Harvey with Trajectory、CodeRabbit with Baseten、Lila Sciences 與 Fastino Labs 等組織正在自訂 Nemotron 3.5 Lightning。不過,公告並未提供獨立的客戶評估、量產規模、合約細節或採用指標。因此,關於速度、成本與客戶效能最強的說法,仍屬於 NVIDIA 與其所提及夥伴的陳述。

為何這對 AI 建構者與企業很重要

對建構者而言,可自訂模型與路由層的組合,可能降低對單一供應商的依賴。團隊可以將敏感或重複性任務交給本地部署模型,同時在較難的情況下保留對專有系統的存取。這有助於滿足隱私需求、降低持續性的推論成本,並讓工程團隊更能掌控模型更新。

代價是營運複雜度。路由器不僅要以平均準確度評估,還要看失敗處理、工具呼叫可靠性、上下文保留,以及在多回合任務中的行為。一個看似微小的準確度下降,在代理於工作流程中做出數十次決策時,就可能變得很重要。組織也需要具備可觀測性,能說明為何某個請求被路由到特定模型,以及該決策是否改善結果。

對企業買家而言,Switchyard 的價值取決於互通性與治理。跨不同供應商的模型進行路由可以降低鎖定效應,但同時也引入更多需要保護、監控與稽核的元件。NVIDIA 強調在授權允許時公開訓練資料與技術,這可能有助於研究人員與治理團隊檢視模型;但單靠揭露並不能證明其在生產環境中的可靠性。

這項發表也讓 AI 應用堆疊的競爭更加明顯。模型供應商如今不僅競爭原始能力,也競爭推論周邊的控制平面:路由、微調、部署位置與成本管理。NVIDIA 正以其硬體生態系與 NeMo 軟體,將這些層次從本地 PC 串接到雲端基礎設施。

接下來要關注什麼

第一個訊號將是對 Nemotron 3.5 Lightning 在程式設計、安全性與企業工具使用工作負載上的獨立測試,包括與相近規模開放模型的比較。已發表的評估應能釐清 NVIDIA 的速度主張是否能在不同硬體與長上下文代理任務中維持。

開發者也應觀察 NeMo Switchyard 在生產框架中的普及程度,特別是 LiteLLM 與 Kong 等整合是否能降低現有應用的設定成本。關於路由失敗、準確度取捨與監控能力的證據,會比單純標榜節省更有參考價值。

最後,企業採用將取決於部署經濟學。重要的問題是,本地與 on-premises 執行能否與託管替代方案匹敵、為了達到領域準確度需要多少後訓練,以及在計入基礎設施、評估與治理成本後,模型路由是否仍能帶來可靠節省。

Creati.ai 觀點

NVIDIA 的公告最重要之處,在於它是一項基礎設施層面的押注:agentic 應用可能由一組協同的模型專家所構成,而非單一通用模型。Nemotron 3.5 Lightning 提供了可自訂的專業模型,而 NeMo Switchyard 則處理何時使用它的執行時決策。

這個機會是可信的,但現有證據大多來自 NVIDIA 自身。對建構者而言,真正的測試不在於路由是否能降低某個孤立基準的成本;而在於它能否在讓部署、隱私與模型營運更容易管理的同時,維持端到端任務的可靠性。

精選

NVIDIA 以 Nemotron 3.5 Lightning 與 NeMo Switchyard 鎖定全天候 AI 代理

NVIDIA 推出了一款高效率的開放模型與一個路由函式庫,旨在降低企業 AI 代理的成本、延遲與部署摩擦。