Sentence Transformers v6.0 新增多向量檢索模型訓練

Sentence Transformers v6.0 新增 MultiVectorEncoder 訓練與延後互動檢索,為開發者提供一條通往更強、領域特化搜尋的統一路徑。

AI News

Sentence Transformers v6.0 現在支援多向量嵌入模型的訓練與微調,將 ColBERT 風格的延後互動檢索納入函式庫,並與稠密嵌入、稀疏模型及 reranker 並列。這次更新讓 AI 開發者能以單一 Python 工具組建構 token 級檢索系統,包括文字搜尋與視覺文件檢索模型。

這項變更之所以重要,是因為多向量檢索能保留傳統單向量嵌入會壓縮掉的細節。它也能在微調後提供更強的領域特化搜尋,但需要更大的索引以及更複雜的部署決策。Hugging Face 的公告與訓練指南展示了這些能力與效能範例;由於兩者都是 Hugging Face 的官方開發者材料,最強的基準主張仍屬供應商報告。

Sentence Transformers v6.0 有哪些改變

核心新增功能是 MultiVectorEncoder,它是 Sentence Transformers v6.0 的第四種模型類型。它支援為延後互動而打造的模型,包括 PyLate checkpoints、Stanford-NLP ColBERT checkpoints,以及在額外設定下,供視覺文件檢索使用的 ColPali 家族模型。

先前,Sentence Transformers 生態系可處理稠密與稀疏嵌入模型,但沒有原生的延後互動支援。LightOn 曾在該函式庫之上開發 PyLate,為這些模型提供訓練、推論與檢索功能。新版本將這些能力直接納入 Sentence Transformers 本身,減少開發者需要評估與維護的獨立元件數量。

這次釋出也將函式庫熟悉的載入與編碼介面延伸到多向量 checkpoints。開發者可以安裝標準套件進行推論,而訓練流程則可透過 training extras 使用。來源指出,此版本需要較新的 Transformers、PyTorch 與 Hugging Face Hub 版本,因此已鎖定依賴的團隊在升級前必須先評估遷移。

為什麼延後互動可以改善檢索

稠密嵌入模型會用單一向量表示整份文件。這種表示方式效率高,但會迫使模型把所有可能相關的細節都濃縮成固定大小的物件。多向量模型則是為每個 token 保留較小的向量。

在查詢時,系統會使用 MaxSim 運算子。每個查詢 token 都會在文件 token 中找出最強的匹配,接著將這些最大相似度加總以產生文件分數。這比單一內積更昂貴,但能保留 token 層級的證據,例如精確識別碼、罕見詞、複數需求與細粒度條款。

這種差異對長文件與專業搜尋尤其重要。某個查詢可能取決於一個化學名稱、法律片語、產品代碼或函式識別碼,而這些在單一文件向量中都會被稀釋。Hugging Face 的說明也指出,具上下文的 token 表徵可以匹配相關詞,而不只是依賴精確的字面重疊。

同樣的設計也用在視覺文件檢索中。ColPali 風格系統可以直接將文字查詢與頁面影像比對,在某些工作流程中避開先 OCR 的管線。這將新支援的範圍從一般文字檢索擴展出去,不過影像模型的相容性仍取決於儲存庫設定,以及來源中所描述整合工作的進度。

訓練主張與更大索引的成本

Hugging Face 的訓練指南主張,當生產語料與用來訓練通用檢索模型的資料不同時,微調尤其有價值。醫療、法律、金融、程式碼與企業內部資料集合,可能使用不同術語、查詢風格、文件長度與相關性判定。

指南報告稱,一個內部微調模型 mLateOn-medical 在作者的醫療評估中,表現優於所測試的通用檢索模型。文中指出,該模型在單張 RTX 3090 上訓練了 14.5 小時。根據貼文,比較涵蓋了稠密、稀疏、詞彙與多向量系統。這些都是有用的工程訊號,但不是獨立的基準結果:評估設定、訓練資料與模型選擇都是由教學作者呈現。

貼文也報告,醫療段落平均為 941 個 token,而現有模型中的截斷在該實驗中讓 NDCG@10 最多下降 0.24。關鍵教訓是:對專門資料集合而言,文件長度設定可能和架構選擇一樣重要。因此,在比較模型前,團隊應先測試目前的 retriever 實際處理了每份文件的多少內容。

代價在於儲存。多向量索引不是每個段落只有一個向量,而是有很多向量。以 Hugging Face 提供的例子來看,4,874 個 Natural Questions 段落在 LateOn 模型下產生了 608,414 個 token 向量,平均每段 124.8 個向量。貼文估計,這在壓縮前大約是 MiniLM 索引儲存空間的 42 倍。

壓縮會改變實際營運情況。來源指出,fast-plaid 索引把同一個例子縮減到 92 MB,約每個段落 62 KiB。這並不代表不需要容量規劃,但它顯示壓縮後的延後互動索引,可能落在某些稠密檢索部署原本就考慮的儲存範圍內。

這對 AI 建構者與企業搜尋代表什麼

對建構者而言,最重要的改變是能控制完整的檢索配方。團隊可以從既有的多向量 checkpoint 出發,保留其查詢與文件標記、投影頭與計分設定,再把文件長度與 token 跳過規則調整為適合自己的語料。或者,也可以在基礎 transformer 上接上一個新的 token 級投影,從零開始訓練該投影。

訓練指南報告稱,在 Alibaba-NLP/gte-modernbert-base 上新增投影後,經過 25,000 組訓練配對,作者實驗中的結果與既有 checkpoint 起點相比差距縮小到 0.03。這同樣只是來源所報告的實驗,並非普遍保證。不過,這確實指出一條較低成本的路徑,適合那些擁有有用領域內配對、但沒有專門 checkpoint 的團隊。

企業採購者應將此功能視為檢索品質的一種選項,而不是稠密搜尋的自動替代品。多向量系統可以改善長文件,以及精確或多部分查詢的召回,但會增加索引、記憶體、延遲與監控需求。合適的架構可能是混合式:以稠密檢索做廣泛候選生成,以延後互動做更高保真度的評分,或只在較小候選集上進行 reranking。

這次更新也讓產品團隊從實驗到部署的路徑更一致。同一個函式庫現在可涵蓋稠密、稀疏、reranker 與多向量模型,而像 fast-plaid 這樣相容的索引也部分解決了儲存問題。不過,團隊仍需衡量端到端回應時間與總基礎架構成本,而不能只依賴檢索分數。

接下來該關注什麼

第一個訊號會是新的模型類型在 Hugging Face Hub 的採用情況,尤其是現有 checkpoints 是否加入多向量標籤與設定中繼資料。ColPali 家族視覺模型的相容性也是需要觀察的方向,因為這些模型在透過 Sentence Transformers 正常載入前,仍需要儲存庫層級的設定。

開發者也應關注對醫療與程式碼檢索提升的獨立評估、壓縮索引格式之間的比較,以及長文件工作負載的生產環境量測。最有分量的證據,很可能來自同時回報 recall、延遲、索引大小與維護成本的團隊,而不是只單獨看檢索品質。

最後,社群仍需要更清楚的混合式檢索指引。如果延後互動可以在稠密候選生成之後選擇性套用,那麼從營運角度來看,它可能比覆蓋所有文件的完整多向量索引更容易被證明合理。

Creati.ai 觀點

Sentence Transformers v6.0 是一個有意義的基礎架構版本,因為它把延後互動從專門擴充,提升為廣泛使用的嵌入函式庫中的一等選項。實務價值不在於再多加一種模型分類,而在於讓領域特化檢索實驗更容易重現與整合。

這次釋出並沒有消除核心取捨:更好的 token 級匹配通常意味著更多向量、更複雜的索引,以及更昂貴的計分。對 AI 團隊來說,最強的應用場景會是那些長文件、精確術語或多重需求查詢,能暴露單向量壓縮弱點的資料集合。下一個考驗是:獨立部署能否證明,品質提升足以抵消額外的系統成本。

廣告