
Nvidia 已推出 Nemotron 3.5 Lightning,這是一款開放權重推理模型,目標是讓 AI 代理工作負載執行得更快、更便宜,而不是在每一項智慧基準測試上都追求最佳表現。
該模型結合了 316 億總參數,以及一種稀疏架構:每個 token 只會啟用 36 億參數。根據 The Decoder 報導的基準測試,在使用 Nvidia 最終 NVFP4 權重的預發布測試中,它的速度接近每秒 670 個 token,讓吞吐量成為這次 Nemotron 3.5 發布的核心特徵。
隨著開發者從偶爾的聊天機器人請求,轉向會產生長串工具呼叫、程式碼與中間推理的代理系統,這種定位就變得很重要。對這類工作負載而言,延遲、硬體使用率與服務成本,可能和模型在基準測試中的最高分一樣重要。
Nemotron 3.5 Lightning 接替 Nemotron 3 Nano 30B A3B,並保留了前一代模型的混合式 Mamba-Transformer 設計。其總參數量明顯大於任何單次計算實際使用的數量,這種結構旨在提供更多容量,同時不必承擔 316 億參數密集模型的完整運算成本。
Nvidia 提供 BF16 與 NVFP4 兩種格式的推理模型。後者使用較低精度權重,以降低推理所需的記憶體與運算量。The Decoder 報導指出,NVFP4 在 Artificial Analysis Intelligence Index 上與 BF16 版本拿到相同分數,而且根據該評估,品質差異很小。
這款模型僅支援文字,並可提供最長達一百萬 token 的上下文視窗。這種容量對程式代理、文件密集型工作流程,以及需要維持大量任務歷史的應用程式可能很有用,不過,單靠上下文長度並不能證明系統在處理超長輸入時會有多高效率或多可靠。
權重可依照 Nvidia 寬鬆的 OpenMDW-1.1 授權取得。The Decoder 也列出了透過 DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius 與 Crusoe 等供應商的無伺服器存取。可在多個推理平台上使用,降低了團隊想先測試模型、而不立即營運自己的 Nvidia 基礎設施時的門檻。
根據 The Decoder 的報導,Artificial Analysis 給 Nemotron 3.5 Lightning 的 Intelligence Index 評分為 24。這與 OpenAI 的 gpt-oss-120b 持平,但落後 Nvidia 的 Nemotron 3 Super,後者得分 26。這個結果比 Nemotron 3 Nano 報導中的 15 分提升了 9 分。
這項比較也顯示出 Nvidia 方法的限制。The Decoder 報導,Qwen3.6 35B A3B 與 Meta 的 Muse Glimmer 得分更高,分別為 32 與 35。在所引述的分析中,綜合速度與智慧的權衡上,專有系統仍然領先:Google 的 Gemini 3.5 Flash-Lite 據稱拿到 37 分,而 GPT-5.6 Luna 則達到 52 分。
Lightning 最強的報告結果出現在代理導向測試中。在 GDPval-AA v2 上,Artificial Analysis 記錄到 Elo 評分 824,相較之下 gpt-oss-120b 為 800,Nemotron 3 Super 為 698。在 Terminal-Bench v2.1 上,該模型的分數從前代的 7% 升至 24.3%,接近 gpt-oss-120b 報導中的 26.2%。
這些數據來自獨立的基準測試平台,但此處是透過 The Decoder 的報導呈現,並非在所提供證據中完整且可獨立重現的結果集。因此,它們應被視為基準快照,而不是證明 Lightning 將在所有生產工作負載上擊敗更大模型。推理速度會因硬體、批次大小、量化、服務軟體、提示長度與輸出長度而有顯著差異。
最受矚目的吞吐量數字同樣來自使用最終 NVFP4 權重的預發布測試。The Decoder 表示,Lightning 完成一項 Intelligence Index 任務約需半分鐘;而在所引述比較中,Qwen3.6 35B A3B 約需 3.5 分鐘,Gemma 4 31B 則需 5.8 分鐘。這些時間有助於說明 Nvidia 的目標:反覆執行、對延遲敏感的任務,其等待成本或服務更大型模型的成本會在多次互動中累積。
對產品團隊來說,Lightning 提供了小型低成本模型與專門留給艱難推理的大型系統之間的一個可能中間層。企業可以把它用在例行的代理步驟——分類、工具選擇、程式碼導覽、文件擷取或結構化執行——而將模糊或高風險案例升級給更有能力的模型。
這種架構可以減少送往昂貴專有 API 的請求數,但前提是較小模型在特定工作流程中必須可靠地運作。Terminal-Bench 上的優勢,並不會自動轉化為穩定的資料庫變更、財務分析、客服操作或生產程式碼。團隊需要測試失敗復原、工具使用準確度、幻覺率,以及任務需要升級處理的頻率。
稀疏設計與 NVFP4 選項也可能影響部署經濟性。每一步啟用 36 億參數,與同等總規模的密集模型相比,可降低運算需求,而量化則能減少記憶體需求。實際效益取決於團隊是否擁有相容的硬體與服務基礎設施,以及長上下文、批次處理與代理編排帶來多少額外負擔。
Nvidia 更廣泛的策略也可從這次發布看出來。該公司先前曾主張,活躍參數少於 100 億的模型,能以遠低於更大型系統的成本完成許多代理任務。Lightning 把這個效率論點做成一個產品:採用 316 億參數的 mixture 風格設計,但只有 36 億參數的啟用路徑。
Fastino Labs 的相關發布提供了可能下游用途的早期訊號。StreetInsider 報導,該公司發布了專門用於金融與醫療的開放權重模型,並以代理完全在 Nemotron 3.5 Lightning 上進行後訓練。所提供的來源並未給出這些模型的技術細節、評估結果或採用數據,因此這項公告較適合被理解為生態系活動的例子,而非生產規模需求的證據。
最重要的後續觀察將是對端到端代理可靠性的獨立測試。開發者應關注衡量完成任務的評估,而不只是 token 吞吐量或基準分數,涵蓋程式開發、瀏覽、企業軟體與長時間執行的工作流程。
服務經濟性會是另一個關鍵訊號。公開部署可以顯示 NVFP4 與稀疏啟用在真實工作負載上是否帶來實質節省,特別是當模型必須處理大型上下文或大量並行使用者時。對於在控制權與營運簡便性之間權衡的企業來說,本地部署與託管推理之間的效能差距也很重要。
Nvidia 的後訓練合作也值得關注。Artificial Analysis 報導,CodeRabbit 與 Harvey 曾與 Nvidia 合作進行特定領域的後訓練。更專門化的變體,可能決定 Lightning 會成為通用代理模型,還是高流量窄領域系統的基礎。
最後,買家應留意授權清晰度、工具支援,以及模型在安全約束下的行為。開放權重模型比封閉 API 更容易檢視與部署,但組織仍需對監控、存取控制、資料處理與故障封鎖負責。
Nemotron 3.5 Lightning 並不是 Nvidia 想在原始智慧排行榜上奪冠的嘗試。它是在押注:許多有用的 AI 代理,需要的是快速、可重複的執行,而不是每個任務都要得到最強答案。
這使得這次發布即使在基準領先者仍然占優時,也具有戰略意義。如果報導中的吞吐量能在常見部署設定中維持,Lightning 可能為高流量代理步驟提供一個實用的路由選項。它的成功,最終不會只由參數數量決定,而是看團隊能否在不增加不可接受的可靠性或安全風險下,以更低延遲與成本完成真實工作流程。
Nvidia 的 Nemotron 3.5 Lightning 透過稀疏啟用與量化提供快速的開放權重推理,鎖定高流量 AI 代理,而非追求最高分數。