MBZUAI 的 Foundation Models Institute 宣布 K2 Horizon 開放模型艦隊

MBZUAI 的 Foundation Models Institute 表示,K2 Horizon 開放權重、程式碼、資料與方法,挑戰封閉式 AI 的可重現性。

AI News

MBZUAI 的 Foundation Models Institute 已宣布 K2 Horizon,這是一組 AI 模型,該機構將其描述為業界最大規模的完全開源釋出。這項公告聲稱,這次釋出包含模型權重、原始碼、訓練資料,以及用來建立這些模型的方法論。

這則消息之所以重要,是因為大多數廣泛使用的前沿系統只公開了技術的一小部分。開發者可能透過應用程式介面取得存取權,研究人員也可能拿到模型權重,但底層的訓練資料與開發過程往往無法取得。K2 Horizon 被定位為更完整的替代方案,不過目前可得的來源資料並未提供模型規格、授權、評估結果或發布時程。

K2 Horizon 公告說了什麼

隸屬於 Mohamed bin Zayed University of Artificial Intelligence 的 Foundation Models Institute,是這次釋出的幕後組織。Zawya 將這個專案識別為 K2 Horizon,並稱其為「史上世界最大、完全開放的 AI 模型」。另一則 PR Newswire 標題則將這次發表描述為業界最大規模的完全開源 AI 模型艦隊。

這些描述是附在公告上的主張,而非經獨立驗證的排名。此次報導可取得的來源內容只有標題與摘要,並沒有新聞稿全文。因此,許多重要問題仍未解答:包含多少模型、支援哪些模態、有哪些參數規模可用,以及開發者可以在哪裡下載或檢視這些成果物。

核心承諾不只是釋出權重。公告表示,這套內容還包含建立與執行模型所使用的程式碼、訓練資料,以及背後的開發方法。如果如描述般提供,外部團隊就可能重現部分訓練流程、稽核資料來源、將模型調整為特定工作用途,並在不完全依賴託管服務的情況下比較結果。

為何「完全開放」是一項關鍵主張

在 AI 領域,「開放」可以指涉多種不同的發布層級。公司可能公開模型權重,但保留訓練資料。也可能分享原始碼,卻透過授權限制商業使用。或者提供文件,卻不釋出重現訓練所需的工具。K2 Horizon 的聲明範圍似乎是要填補這些缺口,但這次公告所附的證據並未說明適用的授權,也沒有界定釋出的精確邊界。

這個區別對 AI 建構者與企業買家都很重要。取得 AI 模型權重可以降低對供應商推論端點的依賴,而取得訓練資料與方法則能提升可稽核性。同時,資料授權、隱私限制、版權問題與安全控管,會決定一個看似開放的模型能否真正用於生產環境。

因此,這項公告設定了一個將由技術文件來檢驗的期待。真正全面的釋出,必須以研究人員與產品團隊可以檢視、執行並合法調整的形式,讓各項組件都可取得。單靠名稱本身,並不能建立這個標準。

證據、基準與尚未解答的細節

目前可得報導沒有提供 K2 Horizon 的效能基準、獨立評估、客戶部署或採用數據。這則報導所提供的來源資料中,沒有任何證據顯示這些模型優於專有系統或競爭的開放釋出。關於準確率、推論效率、安全性或訓練成本的未來主張,在外部研究人員重現之前,都應視為供應商或研究機構的說法。

「最大」這個說法也很難從提供的資料中判斷。它可能指模型數量、釋出成果物的總量、模型規模、訓練資料範圍,或其他衡量方式。若沒有明確的比較對象,這項主張就不是可量測的業界排名。

缺少的技術細節對研究人員尤其重要。他們會想知道訓練資料是完整釋出,還是只以參照與中繼資料呈現;程式碼是否涵蓋預訓練與後訓練;以及方法論是否包含足夠的設定資訊以重現所報告的結果。產品團隊也需要硬體需求、支援的執行環境、商業條款與安全測試資訊。

這次釋出對 AI 團隊可能意味著什麼

對 AI 建構者來說,最直接的機會是對部署擁有更大的控制權。如果 K2 Horizon 包含可用的權重與寬鬆條款,團隊就能評估本機或私有雲推論、降低對外部應用程式介面的依賴,並為特定領域工作流程調整模型。這對於資料所在地、稽核軌跡或可預測可用性很重要的受監管環境尤其有價值。

研究人員則可從取得完整開發紀錄中獲益,而不是只有黑箱端點。訓練資料與方法論有助於研究偏差、資料汙染、記憶化與模型行為。它們也能讓故障更容易診斷,儘管釋出更多成果物並不會自動讓模型變得安全或可重現。

對企業而言,開放並不會消除營運成本。運行大型模型需要硬體、工程專業、監控與安全控管。組織也必須檢視訓練資料的來源,以及與模型授權相關的義務。開放釋出可能只是把成本從供應商訂閱轉移到基礎設施、整合與治理,而不是消除成本。

即便如此,這項公告仍可能增加對封閉式模型供應商與其他開放模型專案的壓力。一個結合權重、程式碼、資料與方法的釋出,會讓買家有更強的基礎來比較供應商依賴與自架控制的差異。其實際影響力,將更多取決於開發者是否能可靠地下載、執行與修改這些模型,而不只是發表時的宣傳語。

接下來要關注什麼

第一個訊號會是真正的 K2 Horizon 儲存庫或發布管道,包括模型數量、支援的模態與發布日期。授權條款將顯示是否允許商業部署與衍生訓練。

研究人員應留意涵蓋資料集組成、篩選、來源與精確訓練方法論的文件。來自 MBZUAI 以外機構的獨立評估,對驗證效能與安全性主張非常重要。

AI 產品團隊也應關注部署基準、硬體需求、推論工具,以及實際使用案例。若有證據顯示 K2 Horizon 能在私有環境中有效運作,這項釋出對企業 AI 買家而言,將比單純的標題排名更具相關性。

Creati.ai 觀點

K2 Horizon 之所以可能重要,是因為它鎖定了 AI 堆疊中最常被保留不公開的部分:不只是權重,還有程式碼、資料與方法。這可能提升可重現性,並讓建構者在部署與客製化上擁有更大的主導權。

不過,就目前而言,這仍是一項公告,而非經驗證的技術里程碑。最強的主張來自 PR Newswire 與 Zawya 所指認的發表材料,而提供的證據缺少規格、基準與獨立確認。釋出應該在成果物實際可取得後,依其品質、合法性與可用性來評估,而不是依照發表時附帶的規模說法來判斷。

廣告