AI News

Alibaba 已釋出 Qwen3.8-2.4T-A95B 的開放權重,這是一個 2.4 兆參數的 mixture-of-experts 模型;同時 NVIDIA 也公布了在其機架級系統 GB300 NVL72 上執行該模型的部署路徑。這項公告把一個極大型的開放權重模型,置於為長上下文推理與 agentic 應用所設計的硬體與軟體 serving 堆疊核心。

該模型不是在每次請求都使用完整參數量,而是每個 token 啟用 950 億個參數。NVIDIA 表示,其初始 FP8 部署在 GB300 NVL72 上可達到每 GPU 每秒 4,000 個以上 token,以及每位使用者每秒 350 個以上 token,不過這些數據來自 NVIDIA 自家的基礎設施測試,不應被視為獨立基準。

為長時間運作工作流程而打造的 2.4T 模型

Qwen3.8-2.4T-A95B,在 NVIDIA 文章中也被稱為 Qwen3.8-Max,定位於程式撰寫、大規模文件分析與多步驟 agentic 工作負載。根據 NVIDIA 的說法,Alibaba 的釋出讓模型權重可透過 Hugging Face 與 ModelScope 取得。

其架構結合了細粒度的 mixture-of-experts 路由,以及交替的 full-attention 與 linear-attention 層。經訓練的路由器會為每個 token 選出所需的專家,因此模型的 serving 成本更取決於其啟用中的參數,而非整體 2.4T 參數容量。

這種 attention 設計針對 agentic 系統中的一個特定問題:上下文可能在多輪互動中累積系統指令、工具結果、檢索文件、原始碼、日誌與中間推理。NVIDIA 表示,該模型支援高達一百萬 token 的 context window,以及高達 128K token 的輸出。其 linear-attention 層以受限的 recurrent state 取代不斷增長的 key-value cache,而 full-attention 層則在需要時保留更廣泛的 token 對 token 互動。

這些能力與打造必須在長時間工作流程中維持狀態的 agent 的產品團隊息息相關。同時也帶來實務上的基礎設施問題,因為一百萬 token 的上下文可能會把瓶頸從單純的模型計算,轉移到記憶體容量、通訊與快取管理。

GB300 系統為何重要

NVIDIA 的 GB300 NVL72 將 72 顆 Blackwell Ultra GPU 整合到單一機架級平台中。根據 NVIDIA,該系統提供 72-GPU 的 NVLink domain,以及 130 TB/s 的 all-to-all 通訊。這種互連對大型 MoE 模型很重要,因為透過傳統伺服器網路路由專家請求可能會引入通訊開銷與使用不均。

因此,服務 Qwen3.8-2.4T-A95B 依賴的不只是把模型檔案放到一組加速器上而已。部署需要分散式執行、最佳化的 kernels,以及能在整個機架中協調專家流量的 inference runtime。NVIDIA 的部落格把 GB300 組態描述為一種方式,讓這種協調成為系統設計的一部分,而不是只依賴現成網路。

NVIDIA 表示,所報告的 Day 0 結果是在 FP8 下、未額外調校模型便達成的。公司預期 NVFP4 精度可帶來進一步提升,但在提供的公告中並未給出未來效能數字。FP8 與更低精度執行可減少記憶體與運算需求,但實際買家仍需評估輸出品質、數值穩定性與整個機架級部署的營運成本。

可配置推理改變 serving 的取捨

一個值得注意的產品功能是 Qwen3.8-2.4T-A95B 內建的推理控制。根據 NVIDIA,開發者可針對每次請求選擇 low、high 或 xhigh 推理模式。這些控制旨在讓應用在推理深度、回應品質與延遲之間進行取捨。

這比把推理視為固定的全域設定更具操作價值。處理含糊架構問題的程式代理,可能會使用較高設定;而文件處理管線則可能降低推理深度,以最大化吞吐量。在企業系統中,這個選擇也可能與工作優先級、使用者層級或應用的延遲預算相連結。

這些控制並不會消除評估需求。團隊仍需測量較高的推理設定是否能顯著提升任務完成度,以合理化額外算力;同時也要確認較低設定是否能在重複性工作負載中維持準確性。公告並未提供三種模式之間品質差異的獨立分析。

證據、軟體選擇與供應商主張

這次部署的主要證據來自 NVIDIA Developer Blog 文章,因此性能數字、系統描述與 serving 建議都以 NVIDIA 為來源。另一則 NVIDIA Developer 條目僅連結到相同公告,並未增加獨立報導。現有來源資料中沒有第三方基準測試結果、客戶部署或已驗證的生產採用。

NVIDIA 列出 SGLang、vLLM 與 NVIDIA Dynamo,作為想要控制 serving 效能的開發者可用的開放原始碼 inference 選項。它也提供 NVIDIA NIM,文章中將其描述為可 serving 支援模型的無模型 inference 容器。預期流程是下載模型權重,透過容器部署,並按需求擴充服務。

在客製化方面,NVIDIA 建議使用 NVIDIA NeMo AutoModel。根據公司說法,這個原生於 PyTorch 的 fine-tuning 函式庫支援直接使用 Hugging Face checkpoints、完整的 supervised fine-tuning,以及基於 LoRA 的適配。這為團隊提供了從公開 checkpoint 到領域專屬版本的一條可能路徑,但由於模型規模龐大,訓練、checkpoint 儲存與評估仍然是相當龐大的基礎設施工程。

「每 GPU 每秒 4K 以上 token」與「每位使用者每秒 350 以上 token」這兩項數字尤其需要謹慎解讀。NVIDIA 將其標示為在自家硬體與軟體堆疊上的 Day 0 結果。這些數據指的是部署方案的效能目標,而不是可不加改動地移植到其他伺服器、精度設定、批次配置或應用工作負載上的普遍結果。

這項部署對開發者與採購方意味著什麼

對 AI 開發者而言,這項公告把開放權重設計空間推向總容量以兆計、但每 token 啟用量較低的模型。這可能在不需要一個稠密的 2.4T 模型對每個 token 執行全部參數的情況下,支援專門推理與 agentic 行為。

然而,硬體門檻很高。72 GPU 的機架級平台並不是一般的開發環境,團隊除了 tokens-per-second 指標外,還必須考慮使用率、排程、模型複本、故障復原與電力成本。模型在技術上雖然是開放的,但要在其宣稱規模上運作,可能仍主要集中於資金充足的企業、雲端供應商與具備先進基礎設施的研究機構。

這項部署也顯示出模型開放性與營運可及性之間日益明顯的落差。開放權重可讓實驗與 fine-tuning 成為可能,但長上下文 serving 與大規模 MoE 通訊仍依賴專門系統。評估這個模型的買家,應比較完成任務的端到端成本,而不只是原始生成速度。他們也應測試工具使用、長上下文檢索、多步驟執行下的可靠性,以及在不同推理設定下的行為。

接下來值得關注的事項

最清楚的後續訊號,將是針對 Qwen3.8-2.4T-A95B 在 SGLang、vLLM 與 NVIDIA Dynamo 上的獨立測試,包括各推理等級下的延遲、吞吐量、記憶體使用量與品質。與其他開放權重模型的比較,將顯示其架構是否帶來超越參數數量的實務優勢。

開發者也應關注承諾中的 NVFP4 最佳化、更多部署方案,以及來自真實生產工作負載的證據。模型權重、微調後 checkpoints 與長上下文 agentic 應用的採用,會比單純的下載量更有意義。最後,GB300 NVL72 系統的成本與可用性,將決定這究竟是主要作為機架級基礎設施展示,還是成為可廣泛使用的 serving 選項。

Creati.ai 觀點

NVIDIA 這項公告的重要性,與其說是讓一個 2.4T 參數模型普及可用,不如說是展示了開放權重、MoE 路由、可配置推理與機架級互連正如何被一起設計。這次部署把 inference 視為一個系統問題,使通訊與記憶體和加速器運算同等重要。

對產品團隊來說,實際問題不是最大模型能否快速產生 token,而是它的推理控制與長上下文架構,是否能把某個明確工作流程改善到足以合理化專用基礎設施。在獨立基準測試與生產證據出現之前,Qwen3.8-2.4T-A95B 最適合被視為一個有潛力的開放模型,加上一份由供應商提供的 serving 藍圖,而不是企業部署的經過驗證預設值。

精選

NVIDIA 詳述 Alibaba 2.4T 參數 Qwen3.8 模型的 GB300 NVL72 部署

NVIDIA 說明 Alibaba 的開放權重 Qwen3.8 模型如何在 GB300 NVL72 上執行,並提供可配置推理以應對大規模 agentic 工作負載。