PrismML 發布了 Bonsai 2 27B,一款為電腦與手機設計的壓縮推理模型,進一步強化了私有、端側 AI 的可行性。

PrismML 已發布 Bonsai 2 27B,這是一款壓縮推理模型,該新創公司表示,它在僅佔用 5.9 GB 儲存空間的情況下,幾乎可提供與更大型模型相當的效能。這次發布,是 PrismML 努力將有能力的語言模型從雲端伺服器搬到 PC、並且未來可能搬到高階智慧型手機上的最明確測試。
這家公司的做法可能對 AI 開發者與產品團隊很重要,因為本地推論可降低雲端成本、改善回應延遲,並讓敏感資料留在使用者裝置上。不過,目前可取得的最強效能與採用數據都來自 PrismML 自身,而這家新創尚未證明這些基準測試結果能夠同樣反映到真實世界應用中。
根據 TechCrunch 的報導,Bonsai 2 27B 將 Alibaba 的開源模型 Qwen3.8 27B 壓縮成一個約比原始版本小 9 到 10 倍的檔案。以 5.9 GB 來看,這個模型應該能輕鬆放入許多個人電腦,並且也可能在某些高階手機上執行,但實際表現會取決於記憶體、處理器能力、量化方式,以及執行所使用的軟體。
PrismML 由 Caltech 研究人員創立,並由以壓縮研究聞名的 Caltech 教授 Babak Hassibi 領導。Databricks 共同創辦人、加州大學柏克萊分校 Sky Computing Lab 主任 Ion Stoica 擔任顧問。這家新創已從 Khosla Ventures、Cerberus Capital 與 Caltech 籌得 2,225 萬美元種子輪資金。
這家公司並不是唯一投入 LLM 壓縮的業者。Multiverse Computing 也在開發縮小模型大小的方法。依 Hassibi 所說,PrismML 的不同之處在於,它的模型幾乎保留了原始模型經測量後的全部能力,而不是以大幅犧牲準確度來換取更小的體積。
PrismML 的方法使用它所稱的三值權重。模型權重通常以相對較大的數值表示來儲存學到的資訊。該公司將這些數值縮減為三種可能狀態:正一、負一或零。這樣就限制了表示每個權重所需的資訊量,並大幅降低記憶體需求。
這項廣義上稱為 LLM 壓縮的技術,目標是改變推論可以發生的地方。應用程式不必把每個提示都送到代管服務,而可以在本地執行至少部分任務。這可能支援離線功能、更快的互動,以及對資料流向更高的控制。
PrismML 在 Bonsai 2 27B 之前幾個月發布的第一個 Bonsai 模型,據報導可達到原始模型整體基準分數的 95%。新版本則宣稱可達 98%。這些數字顯示版本之間有所進展,但並不等同於在廣泛任務、裝置與評估方法上的獨立驗證。
98% 的結果是 PrismML 所提供的供應商端基準測試主張。它顯示與原始 Qwen 模型在公司所選的整體評估上只有很小的差距,但並不能證明 Bonsai 2 27B 在生產環境中的表現會完全相同。基準測試可能無法捕捉涉及長上下文、工具使用、特定領域知識、多語提示,或模型周邊協調層的失敗。
Hassibi 承認,壓縮大概總是會帶來某種程度的效能影響。他也主張,2% 的基準差距未必具有多大實際意義,因為未壓縮的語言模型本來就不完美,而且基準分數也無法精確預測使用者結果。這是一個合理的工程論點,但仍然只是產品團隊必須用自己的工作負載來驗證的主張。
PrismML 也表示,其原始 Bonsai 模型已被下載超過 1,100 萬次,而較小的模型又獲得了另外 260 萬次下載。這些數字是公司自述的採用訊號,並不能證明持續的生產使用、活躍使用者或商業部署。下載總數可能包含實驗、自动化活動以及重複抓取。
如果這個模型能在消費級硬體上穩定運作,Bonsai 2 27B 可能會擴展端側 AI 的設計空間。開發者可以打造在沒有網路連線時仍能運作的助理、在本地處理私密文件,或只在任務超出本地能力時才使用雲端模型。對企業買家而言,這種架構可降低敏感提示與文件暴露給外部推論供應商的風險。
取捨同樣重要。即使模型能放進儲存空間,若要以實用速度執行,仍可能相當吃力。記憶體頻寬、散熱限制、電池耗電、作業系統支援,以及最佳化執行環境的可用性,都會決定本地模型是否真的有回應感。應用團隊也必須評估,壓縮推理是否足以支援程式撰寫輔助、文件分析、客服支援或 AI 代理 等工作流程。
PrismML 的長期計畫是壓縮具備數千億參數的模型。Hassibi 告訴 TechCrunch,更大型的模型可能為壓縮提供更多空間,而不會損失太多智能。如果這項說法成立,該公司最終可能會鎖定比現今小型模型更有能力的本地系統。這仍然只是前瞻性目標,而非已證明的產品能力。
下一個重要訊號,將是對 Bonsai 2 27B 在消費級 PC 與智慧型手機上的獨立測試,包括速度、記憶體使用量、電池影響,以及在實務任務上的準確度。開發者也應留意支援的執行環境、授權細節、模型可得性,以及可重現的評估資料。
PrismML 表示,希望在未來幾個月內推出數千億參數等級的模型。這些發布是否能如期到來、是否能維持所宣稱的品質,以及是否能在商業上有意義的硬體上執行,將顯示該公司的做法是否能從一個引人注目的壓縮示範,進一步擴展。
有關 PrismML 可能正在與 Apple 洽談的報導尚未獲得證實;Hassibi 拒絕評論。任何正式的裝置或平台合作,都會提供更清楚的商業部署訊號,但現有證據並未證實存在這樣的協議。
PrismML 的發布之所以重要,不是因為一個 5.9 GB 的模型會自動取代雲端 AI,而是因為它讓本地與雲端之間的選擇變得更靈活。對許多範圍較窄的產品工作流程來說,一個稍弱但私密、營運成本低且可離線使用的壓縮模型,可能比更大型模型更實用。
關鍵問題不是 Bonsai 2 27B 是否能達到 98% 的基準分數,而是建構者能否在真實限制下依賴它:有限記憶體、變動的提示、工具呼叫、安全政策,以及混亂的企業資料。如果 PrismML 能證明它的壓縮可通過這些測試,並且能擴展到更大型模型,它或許能讓本地 AI 成為一個實際可部署的層級,而不只是專家導向的最佳化。