Zuckerberg 支持的 Biohub 協調 18 億美元計畫,打造細胞行為 AI 模型

Zuckerberg 支持的 Biohub 正在協調 18 億美元的資金與資料,用於訓練可能讓藥物研究更快速、更具預測性的 AI 模型。

AI News

據 Reuters 與 The Decoder 報導,一家由 Mark Zuckerberg 和 Priscilla Chan 支持的研究組織,正在協調一項規模 18 億美元的計畫,用於打造能預測細胞如何運作的人工智慧模型。這項倡議集合了科技公司、製藥研究企業與美國政府,圍繞生物資料、實驗室測量結果和運算資源建立共享基礎設施。

這項計畫之所以重要,是因為藥物開發仍依賴昂貴實驗來判斷細胞如何回應治療。如果模型能在每項實驗進行前可靠預測這些反應,研究人員便可利用它們排列化合物優先順序、設計研究,並更早找出生物機制。這項工作的規模也顯示,AI 生物學正從個別模型發布,走向大型、協調式的資料與實驗室計畫。

協調式生物學計畫

與 Zuckerberg 和 Chan 有關聯的非營利研究組織 Biohub 正在主導這項計畫。The Decoder 表示,該組織先前曾承諾在五年內投入 5 億美元,推動其「Virtual Biology Initiative」。更廣義的 18 億美元數字包括資料蒐集、實驗室設備與運算資源的投入,而非對單一模型的一筆現金投資。

The Decoder 引述 Reuters 報導,Meta、Google DeepMind 與 Isomorphic Labs 將合計投入 3 億美元。美國能源部預計在五年內投資超過 5 億美元,用於實驗室測量與運算。National Institutes of Health 正在協調由過去超過 5 億美元聯邦資金建立的資料集,而 Biohub 負責將這些資料標準化,以供 AI 訓練使用。

Reuters 將這項工作描述為一項由美國政府與 Google 參與的合作,The Decoder 則提供了參與組織與資金結構的更多細節。現有報導並未證實所有資金都是新增支出,因此 18 億美元應理解為一項多部分計畫的宣稱價值,當中結合了新的承諾與過去的公共投資。

細胞預測背後的資料問題

這些模型需要的不只是傳統生物醫學資料庫。若要預測細胞行為,AI 系統需要把生物條件與觀察結果連結起來的訓練案例:哪些基因處於活化狀態、細胞在接受介入後如何改變,以及這些改變如何因組織、疾病或實驗環境而異。

因此,資料標準化是計畫的核心。公共資金支持的研究經常分散在不同機構、測量平台與不一致的格式中。The Decoder 描述,Biohub 的角色是把這些資料集整理成更一致的形式,讓它們能用於模型訓練與評估。

首個資料集預計約一年後推出。這是近期的重要里程碑,但並不代表由此產生的模型能準確預測藥物反應,或能直接轉化為獲批准的藥物。困難的工作包括以可重現的方式測量生物結果、記錄實驗條件,以及測試預測在訓練資料集之外是否仍然成立。

這項倡議的存取模式也存在取捨。據 The Decoder 引述 Biohub 研究主管 Alex Rives 的說法,商業資助者在其出資的資料公開前,將獲得一年的獨家存取權。政府資助的工作不受相同限制。這項安排可能有助於吸引私人資本,但也可能延後外界廣泛取得部分最有價值訓練資料的時間。

證據、主張與競爭環境

目前確認的主要進展,是由 Biohub 主導的計畫獲得協調,以及大型科技與公共部門資助者的參與。現有證據並不包括已發表的模型結果、獨立基準測試,或該計畫能以藥物開發所需品質預測細胞行為的示範。

這項區分對 AI 建構者與企業買家十分重要。龐大預算可以支援更好的實驗與更多運算,但本身無法解決測量雜訊、 生物覆蓋不完整、分布偏移或難以解讀的預測等問題。任何效能主張都必須與保留的實驗結果,以及最終的前瞻性實驗室工作進行比較。

這項計畫也進入日益競爭的領域。The Decoder 報導,Anthropic 已建立一座用於 AI 輔助藥物開發的生物學實驗室,而 OpenAI Foundation 正將超過 1.25 億美元投入生物與醫療資料集。這些工作顯示商業界與慈善界都高度關注,但來源資料沒有提供各計畫之間可比較的結果。

對 Google DeepMind 和 Isomorphic Labs 而言,參與這項計畫可取得更大型的資料與測量生態系。對 Meta 而言,這項工作將公司對大規模 AI 研究的興趣延伸到一個資料生成可能比模型規模本身更能決定進展的領域。對政府機構而言,這項合作可能把過去的公共研究支出轉化為研究人員與私人企業都能使用的基礎設施,但仍須遵守計畫的存取規則。

這項計畫對建構者與企業的意義

眼前的機會可能更偏向基礎設施,而不是可以立即使用的應用程式。研究團隊可以使用標準化資料集來預訓練模型、比較生物表徵,或建立能提出實驗建議的工具。製藥公司最終可能利用這類系統排列化合物、探索標的生物學,或找出最可能降低不確定性的實驗。

然而,部署需要的不只是 API 和有利的基準測試結果。產品團隊需要每項測量的來源資訊、模型預測內容的清楚定義,以及實驗室驗證工作流程。在受監管的藥物研究中,錯誤預測可能浪費數月實驗,或扭曲開發決策。可靠性、可追溯性與重現結果的能力,可能與原始預測準確度同樣重要。

一年的商業獨家存取期也可能影響企業參與方式。資助者可能透過專有存取取得早期優勢,而新創公司與學術團隊可能必須等待公開發布,或依賴其他資料集。這可能加速私人實驗,但如果最有用的測量結果仍分散在不同計畫中,也可能造成生態系統碎片化。

對創業者而言,這項發展顯示,具防禦性的生物學產品可能建立在專門資料、實驗回饋迴路和領域專屬評估之上,而不只是單靠通用模型。對企業買家而言,關鍵問題是未來 Biohub 發布的資料能否在真實研究流程中支援可驗證的決策,而不只是產生令人印象深刻的示範。

接下來值得關注的事項

第一個訊號將是 Biohub 是否能在約一年內交付承諾的初始資料集,並發布足夠文件,讓外部研究人員評估其覆蓋範圍與品質。哪些測量結果被納入、如何標準化,以及哪些資料仍屬獨家,將決定這項資源能被多廣泛地使用。

研究人員也應關注以新的實驗室實驗進行的獨立評估,而不是只針對過去蒐集資料的測試。如果模型能跨越細胞類型、介入方式與測量系統進行泛化,這樣的證據會比單一內部基準測試更有意義。

最後,未來的資金結構將顯示這項 18 億美元計畫會成為持久的公私合作平台,還是維持一組彼此相關的計畫。更多企業、大學與政府實驗室加入,將表示更廣泛的採用;若碎片化持續,則可能限制共享資料層的價值。

Creati.ai 的觀點

Biohub 的計畫之所以重要,與其說是因為它承諾立即實現一位「AI 科學家」,不如說是因為它把生物資料生產視為戰略基礎設施。細胞行為預測受到實驗品質與可比性的限制,因此對測量與標準化的投資,可能和對模型架構的投資同等重要。

考驗將在於開放性是否與問責相伴。如果計畫能產生記錄完善的資料集與驗證結果,讓外部研究人員能夠檢視,便可能降低建立可信生物學工具的成本。如果存取仍過度受限,或評估主要由供應商控制,新聞標題中的資金就更難轉化為廣受信任的進展。

廣告