AI News

一個德國研究聯盟發布了 Soofi S,這是一款擁有 300 億參數的開放式語言模型;該聯盟表示,它在英文與德文綜合基準上領先於完全開放的競品,同時推論成本卻相當於更小型系統。這次發布不只是又一個模型上線而已,因為團隊正直接主張:歐洲打造、以德語為重點的基礎模型,可以在不依賴美國超大規模雲端業者 API 的前提下,依然具備競爭力。

這次發布還附帶一個少見的但書。根據 The Decoder 的報導,以及其所引用、由聯盟更新的技術報告,團隊發現科學基準 GPQA 的測試題,因為資料集切分的失誤,意外進入了訓練資料。社群發現問題後,聯盟將 GPQA 自評估中移除,重新計算所有比較模型的結果,並表示排名並未改變。這種雄心勃勃的基準宣稱與公開的資料污染修正並存,使 Soofi S 不僅在技術設計上引人注目,也因其現在面臨的透明度考驗而備受關注。

Soofi S 想做出哪些不同

根據 The Decoder,Soofi S 30B-A3B 是一個 Mixture-of-Experts 系統,總參數為 316 億,但每個 token 只有約 32 億個參數 सक्रिय。據報導,該聯盟採用了 Nvidia Nemotron 3 Nano 的混合式設計,將 Mamba-2 層與傳統注意力層結合,而非全程使用標準的稠密 Transformer。

這項架構選擇是整個專案主張的核心。一般 Transformer 模型中,長提示詞會增加注意力所用 KV cache 的負擔,當上下文視窗變大或同時服務更多請求時,吞吐量就可能下降。Soofi S 的設計據報可限制這種影響,因為只有少數層需要維持該快取。The Decoder 表示,聯盟測得從 4,000 到 256,000 tokens 的吞吐量幾乎持平;在 40,000 tokens 與 32 個平行請求時,Soofi S 每 GPU 每秒生成的 tokens 數量,約為 14B 到 24B 級稠密模型的 8 倍。

這些數字是聯盟材料中報告的測量結果,並非第三方獨立基準測試。不過,如果它們在實際部署中同樣成立,Soofi S 將對那些建立文件密集型應用、長上下文 copilot,以及延遲與 GPU 使用率和原始基準分數同樣重要的企業系統的團隊,具有相當實用性。

根據 The Decoder,這款模型完全在 Deutsche Telekom 的基礎設施上訓練,具體是在其位於慕尼黑的 Industrial AI Cloud。這件事之所以重要,原因在於:歐洲的主權 AI 專案常常難以同時證明可被信任的算力存取與可被信任的技術成果。Soofi S 明確被定位為一個例子,證明在本地基礎設施上訓練、公開釋出的模型,仍能在主流評測中具備競爭力。

以德語優先的資料策略,但不放棄英文

聯盟最大的戰略賭注,看起來更多在於資料配比,而不僅是架構本身。The Decoder 報導,德語在第一階段訓練中占 7.2%,第二階段占 15.3%;相較之下,Nvidia 的 Nemotron 參考配方中,所有非英語語言合計約只占 5%。

據報導,整個訓練約涵蓋 27 兆個 tokens,分三個階段:第一階段廣泛掃描網頁、程式碼、數學與領域文本;第二階段使用品質更高的材料;第三階段則是較短的長上下文階段,文件長度最長可達一百萬 tokens。德語部分來源包括 HPLT、German Commons、FinePDFs、FineWiki,以及商業授權的德國新聞內容檔案 Genios。團隊也使用了機器翻譯與合成的德語文本。

這種資料權重看起來在聯盟自己的評估中取得了成效。The Decoder 指出,Soofi S 在與 16 個開放競品(包括 OLMo 3 32B 與 Apertus 70B)的比較中,在英文與德文的整體分數上領先所有完全開放的模型。在德國特定知識方面,它在 INCLUDE-DE 上與 Qwen3.5 35B-A3B 打成平手。至於程式設計測試,報告中的分數為 HumanEval 73.8、MBPP 70.2,以及德文 MBPP 84.2,讓它在聯盟的基準套件中超越開源同儕。

對歐洲 AI 團隊而言,這才是最實際的商業吸引力。一個能處理雙語企業工作流程、程式碼生成,以及本地事實或法規脈絡,且不犧牲英文能力的模型,比起只在國內任務表現優秀的狹義國家型模型,更容易合理化。如果 Soofi S 在實務中證明足夠穩健,它可能會對內部助理、搜尋與摘要工具、程式助理產品,以及服務德語知識工作者的垂直系統很有吸引力。

基準問題改變了這次發布將如何被評判

之所以要謹慎看待這則基準故事,最強的理由就是污染問題並非假設性的。The Decoder 報導,GPQA 與 GPQA Diamond 經改寫的測試問題,進入了訓練時使用的 QA-base 資料集,其中還包括英文與機器翻譯的德文版本。

根據報導,原因是 Hugging Face 上的標記怪異:GPQA 沒有獨立的訓練切分,而它的測試內容被放在預設標籤「train」之下。由於流程是依切分名稱挑選資料,這個基準就滲入了訓練語料。後來的稽核據報又發現另外三個也有相同模式的基準——TruthfulQA、BLiMP、Inverse Scaling——不過 The Decoder 表示,這些並未納入 Soofi S 的評估。

The Decoder 所描述的聯盟回應,是將 GPQA 完全從評估中移除,並重新計算全部 16 個模型的比較排名。團隊也表示,現在會直接將訓練資料與基準問題交叉比對,而不再只依賴切分標籤。The Decoder 引述的聯盟參與者主張,資料的公開釋出讓社群得以發現問題,因此證明了開放路線的價值。

這個說法有其道理,但並不能抹去整起事件。對模型買家與開發者而言,這件事再次提醒了一個更廣泛的教訓:基準領先很有用,但前提是資料管線與評估流程能經得起外部檢驗。據報約 152,000 筆個別結果可供使用,以及合作夥伴 Ellamind 在保留的內部資料上做了另一次評估,這些都對聯盟有利,但仍緊密連結於專案參與者,而非中立的外部實驗室。

Soofi S 看起來強在哪裡,弱在哪裡

The Decoder 的描述顯示,Soofi S 並非全面勝出,而是有相當明確的優勢輪廓。據報導,它在德文與英文的綜合測試,以及程式碼基準上表現特別好,同時也受益於高效率的長上下文服務能力。這些特性更貼近實際企業工作負載,而不是一次性的消費級聊天機器人展示。

但同一篇報導也指出了弱點。在德文競賽數學上,Soofi S 在 Minerva MATH-DE 上據報僅得 56 分,落後於 Qwen3.5 35B-A3B 與 Gemma 3 27B。它在 NaturalQuestions 上也落後,作者據報將此與其每個 token 只有約 32 億活躍參數、因此事實儲存能力較低有關。

在 RULER 長上下文測試中,也出現了顯著的失敗模式。根據 The Decoder,當要求從長文本中擷取高頻詞時,Soofi S 在超過 32,000 tokens 後的命中率掉到約 3%;相比之下,類似的 Nemotron 模型則維持在 60% 到 64%。作者據報將此弱點歸因於長上下文訓練資料包含長文件,但缺乏足夠的合成抽取型任務。

這個區別對 AI 建構者很重要。「長上下文」不是單一能力。模型可以高效率處理長輸入,卻仍可能在這些輸入中的特定檢索或抽取行為上表現不佳。考慮將 Soofi S 用於企業 AI的產品團隊,應該測試自己的實際工作流程:法律審查、客服摘要、程式助理使用、研究 copilot 或多語言知識檢索,會對系統不同部分形成壓力。

證據、主張,以及哪些是獨立驗證的

這則報導中有關效能、效率與訓練的大多數細節,都來自 The Decoder 對該聯盟技術材料的報導。也就是說,關鍵的基準與吞吐量主張,仍是由聯盟自己報告,而非獨立重現。

目前最有力的證據,是這次發布本身、基於 Nvidia Nemotron 的架構選擇、Deutsche Telekom 基礎設施的使用、明顯偏向德語的訓練組合,以及聯盟揭露 GPQA 測試內容流入訓練資料、之後又從評估中移除的事實。

目前較難從現有來源驗證的,則是相對於 OLMo 3 32B、Apertus 70B 和 Qwen3.5 35B-A3B 的精確領先幅度,以及在生產負載下的實際服務優勢。這些主張可能大致正確,但外部重現會比發布當天的圖表更重要。

授權時間表也值得關注。The Decoder 表示,instruct 與 reasoning 變體目前處於 beta,預計未來幾週會以寬鬆授權釋出;而更大的 Soofi L 模型也已在訓練中。在這些變體正式推出、開發者能直接測試之前,這個系列的商業實用性仍只部分可見。

接下來要觀察什麼

首先,關注獨立評測者是否能重現「Soofi S 在德語與英語上領先完全開放模型」這一標題。由於 GPQA 問題已公開,HumanEval、MBPP、RULER 與德語測試套件的第三方測試將更具分量。

第二,關注部署基準,而不是靜態 model card。如果 Soofi S 真的能在長上下文中比稠密競品更好地維持吞吐量,這對企業 AI 預算和想用有限 GPU 容量服務大量並行使用者的團隊都很重要。

第三,關注德語圈產業的採用訊號。一個在 Deutsche Telekom 基礎設施上訓練、並針對德語優化的模型,可能吸引有資料落地、採購或主權 AI 要求的客戶,但這些買家也會想看到可靠性、安全性與支援方面的證據。

最後,觀察 Soofi L 與即將推出的 instruct 模型是否維持同樣的透明度標準。只有當未來的發布持續讓資料集、方法與發布後修正接受外部審視時,聯盟的開放論點才會更強。

Creati.ai 觀點

Soofi S 的有趣之處,不在於歐洲又推出了一款開放模型,而在於它瞄準了一個更實用的利基:在本地基礎設施上,同時具備雙語企業效能與長上下文效率。這比單純抽象的主權敘事更有實際價值。如果吞吐量的說法能在重現中成立,Soofi S 對那些需要大上下文系統、又不想支付通常與稠密前沿模型相關的服務成本的建構者,會很有吸引力。

不過,污染揭露是這個故事的一部分,而不是腳註。在今天的模型市場裡,透明度正逐漸成為一種競爭力。Soofi S 最終也許會因為公開修正錯誤而受益,但它仍需要獨立驗證。對創業者與企業團隊而言,正確的結論不是「忽略這個模型」,也不是「相信基準」,而是「用自己的工作負載測試開放權重」。這正是 Soofi S 會成為嚴肅的區域平台候選者,或只是停留在一份令人印象深刻的技術報告的分水嶺。

精選

德國聯盟推出 Soofi S:一款開放式 30B 模型,主打長上下文效率與更強的德語表現

德國的開放模型 Soofi S 宣稱在完全開放的英文與德文基準測試中名列前茅,同時其創作者也揭露並修正了一次測試資料外洩。