Base Labs 與 Hugging Face、Goodfire 合作打造開放權重 AI 安全基礎設施

Base Labs、Hugging Face 與 Goodfire 正在打造開放權重 AI 安全基礎設施,目標是在模型風險持續升高之際,讓防護措施更透明。

AI News

由 AI 推論公司 Baseten 創立的研究團隊 Base Labs,正與 Hugging Face 及 Goodfire AI 合作,開發開放權重模型的安全基礎設施。這項倡議旨在讓安全評估與監控成為模型開發與部署流程的一部分,而不是之後才額外加上的獨立層。

這項宣布發生在開發者與政策制定者持續辯論如何管理那些權重可被下載、修改,且可被移除內建防護的模型之際。對 AI 建構者與企業團隊而言,這項合作可能成為一個早期測試:開放模型生態系是否能在不依賴少數模型供應商集中控制的情況下,建立可信的安全實務。

三家公司共同推動開放模型安全

Base Labs 表示,將開發並公開訓練與監控開放模型的方法,長期目標是為開放權重生態系建立一套透明的安全「標準」。Hugging Face 這個大型的開源與開放權重模型託管平台參與了這項工作,而 Goodfire AI 則帶來模型可解釋性的專業能力。

各公司尚未公開這項合作的技術設計,因此仍有一些基本問題尚未明朗,例如這項工作究竟會產生評估基準、部署工具、訓練方法、監控系統,或是這些元件的組合。

Goodfire 一向強調讓模型行為更易理解,這顯示可解釋性可能會成為提議框架的一部分。Goodfire 在回應 Baseten 的宣布時表示,安全性應該被建構進開放模型中,並由提供模型服務的組織負責提供。這是一個廣泛的目標,但尚不是一份已發布的規格。

Baseten 在 2026 年初將 Base Labs 作為其研究部門啟動。公司也邀請開發者與研究社群中的其他成員參與該框架,顯示它希望這個專案能超越三個創始合作夥伴。

為何開放權重模型成為爭論核心

眼前的背景是,大家越來越擔心可下載模型中的防護措施可能被移除。TechCrunch 報導稱,一種名為「abliteration」的技術正越來越常被用來停用或削弱拒答行為與其他安全控制。根據該報導,Hugging Face 目前列出超過 6,000 個被識別為 abliterated 的模型。

這個數字反映的是平台目錄中的內容與標示,而非整個開放模型市場的獨立測量。不過,它仍說明了一個實務上的難題:一旦模型權重公開,就很難把其原始安全行為視為永久不變。

對模型開發者來說,問題已不再只是供應商是否加上防護,而是這些防護在重新散布或修改後是否仍然有意義。監控工具也可能需要評估模型在不同提示、微調、量化或下游使用者進行的其他修改下的表現。

Base Labs 主張,開放性有助於安全研究,因為外部人士可以檢視模型行為並開發更透明的控制方式。這是該公司的立場,而不是這項合作已被證實的結論。開放存取確實能提升審視能力,但也可能更容易移除保護,或重現不安全的變體。

證據顯示了什麼——以及沒有顯示什麼

目前已確認的宣布僅限於合作成立,以及各公司打算建立並公開安全方法。現有報導並未提供技術架構、發布時程、評估結果、模型清單或治理流程。

最具體的市場訊號,是 TechCrunch 報導的 Hugging Face 目錄中超過 6,000 個 abliterated 模型。這個目錄顯示,任何想在開放分發網路中維持安全屬性的努力都將面對多大的挑戰,但它無法證明這些模型中有多少被廣泛使用,或是否構成可量化的現實風險。

參與者的財務資源也提供了背景,但不能證明技術進展。Baseten 在 6 月完成 15 億美元的 F 輪融資,估值據報達到 130 億美元。Goodfire AI 則在今年稍早由 B Capital 領投,完成 1.5 億美元的 B 輪融資。這些數字可能讓專案取得工程與研究能力,但無法驗證所提議的標準或其可能的採用情況。

由於目前可得的細節主要來自公司公告與媒體報導,因此關於透明性、生態系參與與未來安全改善的說法,都應視為已宣示的目標。眼下還沒有獨立的基準測試結果能證明這種做法能減少有害輸出,或在模型被修改後仍然有效。

這項合作對建構者與企業可能意味著什麼

如果 Base Labs、Hugging Face 與 Goodfire 能產出可用工具,模型創作者或許能獲得一套共同流程,用於在發布前測試模型行為,以及在部署後持續監控模型。這有助於團隊記錄安全評估、比較模型版本,並找出微調或下游散布所造成的變化。

對企業採購方而言,實際價值取決於這個框架是否能產生可納入採購、風險審查與合規流程的證據。一張 model card 或一次性基準測試,對於部署會更新、客製化或由不同供應商託管的模型的組織來說,可能還不夠。買方很可能需要可重現的測試、稽核軌跡、版本追蹤,以及關於衍生模型仍保留哪些防護的清楚資訊。

這項合作也可能讓 Hugging Face 站上相當有影響力的位置。作為重要的分發與探索平台,它可以協助讓安全中繼資料與評估結果在開發者選擇模型的當下變得可見。但單靠託管基礎設施,無法保證下載下來的模型仍保有原始防護。

對 Base Labs 與 Goodfire 而言,這個專案也可能在模型推論、可解釋性與安全工具日益緊密相連的市場中建立競爭地位。這些公司必須證明,他們的方法不只是對資金充裕的研究團隊有用,也適合開源開發者。若工具成本高、速度慢或難以整合,即使評估技術表現優異,也可能限制採用。

接下來要關注什麼

第一個訊號會是公開的技術發布:例如規格、基準測試套件、訓練配方、監控工具或參考實作。其範圍將揭示這項合作主要是研究計畫,還是面向正式生產使用的營運標準。

開發者也應留意,在該框架下測試過的模型是否有獨立評估,尤其是在微調或移除安全控制之後。若能證明這些方法在修改過的模型中仍能偵測風險行為,會比單純的上線宣稱更有意義。

其他重要訊號包括:創始團隊以外的模型創作者是否參與、是否整合進 Hugging Face 工作流程、是否公布成本與延遲數據,以及當新的攻擊技術出現時,是否有更新評估的機制。治理也很關鍵:合作夥伴目前尚未說明由誰定義可接受行為、解決爭議或維護框架。

Creati.ai 觀點

這項合作正面處理了開放權重 AI 的一個真實弱點:一旦模型能被複製與修改,安全控制就很難保留下來。其核心主張——透明性與共享工具可以提升安全——是合理的,但在公司公布可供他人重現與挑戰的方法之前,仍未被證實。

對建構者與企業團隊而言,這項宣布最好被視為基礎設施提案,而不是完整的安全解決方案。Base Labs、Hugging Face 與 Goodfire 的可信度,與其說取決於合作本身,不如說取決於他們是否能交付開放評估、可量化成果,以及當模型離開原始開發環境後仍能持續運作的控制機制。

廣告