
NVIDIA 正將 NeMo Switchyard 定位為一個編排層,供需要使用多個模型的 AI 代理使用。在一篇技術部落格中,該公司介紹了一個 SDK 與路由框架,能夠依據能力、成本、延遲與基礎設施條件,將個別請求、代理步驟或任務階段導向不同模型。
這項公告回應了一個日益嚴峻的工程問題:對每個代理動作都使用前沿模型,會提高推理成本與延遲;而處處依賴較小模型,則可能降低任務品質。NVIDIA 的做法是把模型選擇視為執行時決策,而不是固定的應用程式設定。
NeMo Switchyard 將路由邏輯與最終處理請求的模型端點分離。該貼文中稱為 switchyard-libsy 的供應商無關 SDK,負責表示請求、定義可用的模型目標,並管理對所選供應商的呼叫。
每個目標都有一個語意名稱,而用戶端設定則將該名稱對應到供應商端點與模型識別碼。這種設計讓開發者可以變更部署或模型供應商,而無需在整個代理應用程式中重寫路由邏輯。NVIDIA 也表示,開發者可以提供自己的路由演算法與自訂資料。
在執行時,路由器可以在選擇模型之前評估請求及其上下文。路由可以只對完整請求執行一次、在多輪互動的每一步執行,或跨越同一任務的不同階段。適當的設計取決於錯誤容忍度、延遲、吞吐量與部署複雜度等因素。
這對於結合分類、推理、工具使用與例行跟進工作的 AI 代理 特別相關。這些步驟不一定需要相同的模型能力,而其成本結構也可能差異很大。
NVIDIA 將路由系統可用的訊號分為三大類:模型能力、模型成本結構與基礎設施條件。能力訊號可包含請求分類、預估難度、嵌入向量,或從提示詞萃取的特徵。根據實作不同,路由器也可能使用模型層級訊號,例如對數機率、代理追蹤紀錄,或其他內部與輸出相關資訊。
系統訊號包括定價、延遲、負載與錯誤狀況。這些都很重要,因為理論上最強的模型若不可用、速度慢、成本高,或失敗率偏高,未必是最佳營運選擇。在代理工作流程中,基礎設施還必須支援對使用者不可見、且不會破壞應用程式上下文的交接。
因此,這個框架超越了單純的「小模型對大模型」串接。路由器可以為子代理使用不同的模型池、依主題路由,或在同一任務的不同階段切換模型。NVIDIA 將這種彈性視為讓模型選擇同時回應工作內容與服務系統狀態的一種方式。
資料中最強的效能證據來自供應商本身。NVIDIA 以 Terminal-Bench Hard 的一組模型系統來說明這種方法;Terminal-Bench Hard 是針對電腦使用任務的基準測試。在公司的例子中,DeepSeek V4 的整體準確率最高,但其他模型在特定任務群組中表現更好:Kimi K2.6 在機器學習與強化學習類別表現較佳,Qwen3.5 397B A17B 則在數學與科學類別表現較佳。
NVIDIA 主張,將每個任務群組分配給最強的模型,能在對部署重要的面向上優於單一模型策略。貼文也指出,成本與完成時間會使選擇更複雜,因為不同模型在存取或運作成本、延遲、token 使用量與工具呼叫行為上各不相同。
來源引用了 LangChain 與 Cognition 相關的基準測試與實驗,作為路由在維持高準確度的同時降低成本的例子。不過,所提供的材料並未給出詳細測試條件、基準配置、百分比降幅或獨立驗證。因此,這些結果應視為 NVIDIA 所報告的證據,而不是對每一種代理工作負載的普遍保證。
這個限定很重要。路由器本身會帶來工程與評估需求。錯誤分類、過時的成本資料、薄弱的任務估計,或不可靠的交接,都可能抵銷使用更適合請求的模型所帶來的好處。團隊需要同時衡量路由開銷與失敗模式,以及模型品質。
對開發者而言,NeMo Switchyard 可能降低將單一模型硬編碼進代理控制流程的需求。建構研究助理、程式設計系統或電腦使用代理的團隊,可以把較強的模型保留給困難推理,並把較簡單的分類或後續動作送往較便宜的目標。
供應商抽象化也有助於團隊管理快速變動的模型組合。模型品質、定價、可用性與延遲都可能獨立改變,使得靜態的模型選擇更難維護。將語意化模型名稱與供應商專屬識別碼分離,讓營運人員有地方可以更新這些對應關係,而不必更動更高層的路由策略。
企業買家應少關注自動降成本的承諾,多關注治理。生產環境的路由器需要針對敏感請求的明確政策、模型選擇的可稽核性、失敗回退行為,以及哪些供應商可以接收特定資料的控制。它也需要針對工作負載的評估:看最終代理結果的準確度,而不只是單次模型呼叫的表現。
其競爭意涵不僅限於 NVIDIA 的 SDK。模型路由正在成為應用程式與日益碎片化的模型市場之間的控制點。能提供可靠路由、可觀測性、政策執行與部署可攜性的供應商,即使不提供池中的全部模型,也可能影響客戶消費模型的方式。
接下來的訊號會更偏向實務,而非宣傳。開發者應留意公開文件與範例,了解 NeMo Switchyard 如何與服務堆疊、代理框架與生產可觀測性系統整合。若能取得更詳細的 LangChain 與 Cognition 測試結果,將有助於說明路由在特定工作負載下究竟能帶來多少成本或延遲改善。
同樣重要的是,該 SDK 是否支援強健的政策控制、評估迴圈、模型回退,以及即時基礎設施訊號。這些功能將決定路由是停留在基準測試技術,還是成為可靠的生產基礎設施。
最後,採用與否將取決於團隊把不同供應商的模型納入共同池中的容易程度。供應商無關的設計是明確目標,但實際可攜性會在驗證、資料處理、工具相容性、上下文限制與模型行為差異上受到考驗。
NVIDIA 的 NeMo Switchyard 值得注意,因為它把代理最佳化框架視為系統問題,而不是模型選擇競賽。核心機會在於,將每個工作單元對應到合適的模型,同時考量其服務的營運現實。
這個概念是可信的,但其價值將由路由品質與生產控制來決定。在 NVIDIA 公布更細緻、可獨立驗證的結果之前,建置者應把這個框架視為一種需要針對自身工作負載加以評估的架構,而不是多模型路由能在沒有任何取捨的情況下自動降低成本的證據。
NVIDIA 的 NeMo Switchyard 可將 AI 代理任務在多個模型之間路由,以在生產工作流程中平衡準確度、延遲、基礎設施限制與推理成本。