
阿里巴巴的 Qwen 團隊正在以 Qwen3.8-Flash-Next 預覽其下一代模型架構;這是一個多模態 mixture-of-experts 系統,旨在以顯著更低的運算需求,提供大型模型等級的表現。這項發布之所以重要,是因為它把成本效率推到模型供應商競爭的核心,特別是針對程式設計代理、辦公自動化,以及其他高量工作負載。
根據 The Decoder 的報導,Qwen3.8-Flash-Next 總共有 1250 億參數,但每個 token 只會啟用 60 億參數。這個模型被呈現為 Qwen4 規劃架構的早期預覽,而不只是現有 Qwen3 系列中的又一次漸進式更新。
Qwen 團隊表示,這個模型以大約九分之一的訓練成本,取得比 Qwen3.7-Plus 更強的結果。這些數字,以及報導中面向生產環境的 Qwen3.8-Flash 版本定價,都是供應商主張,不應被視為經過獨立驗證的效能或成本基準。
Qwen3.8-Flash-Next 採用 mixture-of-experts 設計。對於任何給定的 token,只會使用其參數中的一小部分,因此阿里巴巴可以宣傳一款整體容量很大的模型,而不必為每次請求都支付完整的運算成本。
這個架構還包含一個 510 億參數的 N-gram embedding 層。The Decoder 將這個元件描述為一種片語字典,把常見的詞組作為獨立條目儲存。Qwen 表示,這一層可以在一般系統 RAM 上運作,而不必要求所有記憶體都留在 GPU 上,這可能在相對低的額外成本下減輕硬體壓力。
這個模型原生支援 262,144 token 的上下文視窗,並且據報可透過 YaRN 將其擴展到一百萬 token。這種容量對軟體儲存庫、長篇商務文件,以及多步驟代理工作流程可能都很有用,不過僅有上下文視窗支援並不能證明模型能可靠地對其接受的每個 token 進行推理。
技術報告可在 GitHub 上取得,而模型權重則列於 Hugging Face 與 ModelScope。阿里巴巴也正在為 QwenCloud 準備 Qwen3.8-Flash。據報價格為每百萬輸入 token 0.16 美元、每百萬輸出 token 0.47 美元,Qwen 團隊表示 API 預計很快就會上線。
阿里巴巴公布的比較將 Qwen3.8-Flash-Next 與 DeepSeek-V4-Flash 及 Anthropic 的 Claude Opus 4.6 相比,來源材料將兩者都描述為具有大得多或更昂貴的配置。據報 Qwen 模型在大多數測試任務中領先。
最強的報告結果出現在代理式程式設計與職場生產力方面。根據阿里巴巴的比較,Qwen3.8-Flash-Next 在 DeepSWE 得到 58.7 分,在 SWE-bench Pro 得到 62.5 分。這些基準旨在衡量 AI 系統是否能獨立檢視並修復軟體專案。在以生產力為主的評估中,它在 CoWorkBench 得到 73.9 分,相較於 DeepSeek-V4-Flash 的 45.1 分;在 JobBench 得到 55.7 分,相較於 Qwen3.7-Plus 的 27.6 分。
報導中的分數在科學推理與競技程式設計方面較為接近:GPQA Diamond 為 91.7 分,LiveCodeBench v6 為 91.9 分。Claude Opus 4.6 據報仍在 Humanity’s Last Exam 中保持優勢,這是一項聚焦困難跨領域問題的測試。
這些比較來自阿里巴巴,而非獨立評測者。即便如此,它們仍可提供有用的方向性證據,顯示 Qwen3.8-Flash-Next 是為哪些任務所優化,但基準設計、提示詞、模型設定與實作方式都可能影響結果。實際生產環境表現將取決於延遲、工具使用、故障復原,以及部署團隊周邊系統的品質。
對開發者而言,主要機會不只是取得另一個模型而已,而是能在 token 數量與重複呼叫主導預算的工作負載中,使用相對便宜的模型。程式設計助理、儲存庫分析、文件處理、客服自動化,以及內部辦公工具,可能產生成千上萬甚至數百萬次模型請求,因此每 token 價格與輸出效率成為核心設計約束。
報導中的 QwenCloud 定價,也為在託管 API 與自管部署之間做選擇的團隊提供更清晰的比較基準。Qwen3.8-Flash-Next 在 Hugging Face 與 ModelScope 上提供的權重,可能讓組織對基礎設施與資料處理擁有更多控制權;但即使每個 token 只有 60 億參數啟用,運行一個 1250 億參數模型仍是嚴肅的營運工作。稀疏啟用可以降低運算量,卻無法消除記憶體、網路、服務與可靠性方面的挑戰。
這個模型明顯偏重軟體與辦公任務,也可能影響團隊如何評估它。若一個模型在程式設計代理基準上表現良好,它對修 bug 與瀏覽儲存庫可能很有價值,但生產環境的採購者需要以專有程式碼、權限邊界、工具呼叫與回滾程序來測試其行為。對於企業 AI來說,較低的 token 帳單只有在系統錯誤率與監督需求不會抹去節省時才真正有用。
這項發布也為原本就朝向降價的市場增加壓力。The Decoder 報導,Qwen3.8-Flash-Next 的表現低於阿里巴巴的旗艦 Qwen3.8-Max,但成本大約只有十二分之一。若這個差距在實際工作負載中也成立,模型供應商可能會愈來愈把高階推理系統與較便宜的高吞吐量模型分開,而不再期待單一模型能服務所有使用情境。
第一個信號將是 Qwen3.8-Flash 是否會透過 QwenCloud 以報導中的價格廣泛供應,以及實際延遲是否符合成本主張。建構者也應關注程式設計、辦公自動化、長上下文檢索,以及工具使用可靠性的獨立評測。
Qwen4 路線圖是另一個重要後續。Qwen3.8-Flash-Next 被描述為架構預覽,因此未來版本將顯示 N-gram embedding 層與其他稀疏模型技術是否會成為阿里巴巴主線模型的穩定部分。模型服務結果的重要性不亞於基準分數:GPU 記憶體使用量、系統 RAM 需求、吞吐量與擴展行為,將決定這種架構在阿里巴巴自身基礎設施之外是否經濟實用。
最後,企業買家應追蹤託管版與可下載版的授權、資料控制、區域可用性與支援條款。這些細節將決定模型是否能從試驗階段走向受監管或業務關鍵的工作流程。
Qwen3.8-Flash-Next 之所以重要,不是因為阿里巴巴聲稱已超越所有競爭對手,而是因為它把效率本身變成了產品故事。面向程式設計與辦公工作的稀疏、低成本模型,可能讓團隊在不預設使用最昂貴前沿系統的情況下,執行更多代理步驟、更廣泛的評估,以及更頻繁的自動化。
這些主張仍需要外部驗證,而較少的啟用數並不會自動轉化為較低的整體部署成本。但如果 Qwen 的架構在真實工作流程中能提供相近的可靠性,競爭優勢或許會從原始參數數量,轉向模型能以多低的成本、多穩定地完成有用工作。
阿里巴巴的 Qwen 團隊以一款稀疏模型預覽 Qwen4,目標是在降低訓練與推理成本的同時,鎖定程式設計與辦公工作流程。