AI News

Thomson Reuters 在超過兩年的時間裡,已花費約 4,000 萬美元打造 Thomson,這是一個用於法律與專業資訊工作的內部語言模型。該公司的這項決策,代表它正從完全依賴 OpenAI 與 Anthropic 等前沿模型供應商的租用算力,轉向另一種模式。

這個模型建立在阿里巴巴的 Qwen 之上,並率先在 CoCounsel Legal 內部用於以文件為主的工作。Thomson Reuters 表示,這項投資旨在改善經濟效益、保護其專有內容的控制權,並讓公司能在自家軟體工具中訓練模型。不過,截至目前最強的效能結果,出現在 Thomson 能存取 Thomson Reuters 的內容與工作流程,而不是作為通用模型運作時。

Thomson 是為受控的法律工作流程而設計

根據 The Decoder 的報導,Thomson Reuters 使用公司資料與領域專家開發了這個模型,並在連接 Westlaw、Practical Law、Checkpoint 和 Reuters 等產品的環境中進行訓練與評估。公司表示,截至目前,投入訓練的可用內容不到 10%。

開發流程最初以 Qwen 作為開放模型基礎。Thomson Reuters 與 Imperial College 合作開發了一個名為 Snowdon 的中間版本,並針對安全性、倫理與政治中立性重新訓練;The Decoder 如此報導。之後,公司再加入了以自有素材進行的預訓練、專家主導的後訓練,以及在內部工具環境中的強化學習。

Thomson 並非被定位為取代所有外部模型。上線初期,它接手 CoCounsel Legal 中的 Tabular Analysis 功能,讓較小、成本較低的模型能處理明確定義且高量的任務。管理員仍可切換模型,而產品依舊維持多模型架構。Thomson Reuters 也表示,客戶資料不會被用於訓練。

Thomson 的較小版本預計將在 Hugging Face 上以非商業授權釋出。公司還計劃發布技術報告並建立開發者入口網站;至於與律師事務所的直接授權洽談,則被描述為非具約束力的初步討論。

基準測試優勢取決於專有存取

The Decoder 提供的證據顯示,Thomson 的競爭力案例,比起宣稱全面超越前沿模型,更為狹窄。在 Stanford LegalBench 上,Thomson 據報取得 0.823,落後於 Gemini 3.1 Pro 與 GPT-5.5。在 Harvey Legal Agent Benchmark 上,它僅略微落後 Opus 4.8,但在指令遵循與困難的 PrBench Legal 評估中領先。

據報導,這個模型在一般推理與程式撰寫方面表現較弱。比較結果也會受到評估方法影響:Thomson 使用 test-time scaling,而 GPT-5.5 則是在沒有推理模式的情況下測試。公司自己的 Deep Research 評估也呈現類似的保留說法。僅有網路存取時,Thomson 的事實正確性得分為 0.53,而 GPT-5.4 為 0.65。當加入 Thomson Reuters 的內容後,Thomson 提升到 0.83,些微領先 GPT-5.4 的 0.82。

這些結果是公司透過 The Decoder 所呈現的基準測試,而非獨立驗證。它們也顯示,專有存取所發揮的作用,可能至少與模型專門化同等重要。相同內容也讓 GPT-5.4 有顯著提升,這意味著目前還不能把優勢完全歸因於 Thomson 的訓練或架構。

Thomson Reuters 的評估負責人 Andrew Bean 承認,當模型僅限於網路存取時,它還不是領先者。若公司使用更多自有內容,或轉向更新的 Qwen 變體,結果可能會改善,但那仍屬未來可能性,而非已被證明的成果。

為什麼 Thomson Reuters 想要擁有整個技術堆疊

公司的論點建立在三個相互連結的問題上:成本、資料控制與累積專業知識。Thomson Reuters 表示,微調外部前沿模型可能會降低一般能力;而持續使用則使買方暴露於供應商的推論定價與產品路線圖之下。

一個由內部控制的模型,可以為文件審查或引文檢查等重複性工作做得更小、更便宜。當模型被部署在高量工作流程中時,這比偶爾用於開放式研究更重要。因此,相關的比較不只是 Thomson 是否比 GPT-5.4 或其他前沿系統更聰明,而是它能否在一個明確定義的產品中,以更低的營運成本提供可接受的品質。

第二個因素是資料存取。若在 Westlaw 與相關工具內進行訓練和測試,Thomson Reuters 就能針對外部供應商若沒有公司受保護素材與工作流程遙測就無法完整重現的任務進行最佳化。公司表示,這項優勢是其不完全依賴第三方模型的核心原因。

第三個因素是累積性的開發知識。Thomson Reuters 的高管 Joel Hron 與 Jonathan Schwartz 將公司的投資描述為建立模型開發能力,而不是購買單一成品模型。每一次專家審查、產品評估與工作流程改善,都可能影響後續版本。這是公司高管的策略性論述,而非經過衡量的投資報酬。

這項決策對 AI 建構者與採購者意味著什麼

對企業而言,這項公告提供了更具體的選擇性模型擁有案例。Thomson Reuters 擁有專屬資訊資產、數百位領域專家,以及可依專業標準評估結果的工作流程。在這些條件下,專門化模型比缺乏專有資料或可靠測試的內部專案更具說服力。

對缺少這些條件的公司來說,這則消息就沒那麼有說服力。僅僅用一般企業文件來訓練模型,並不會自動帶來持久優勢,尤其當組織仍依賴外部基礎設施、無法大規模衡量品質,或可用於改進系統的範例太少時更是如此。在這些情況下,模型客製化、檢索系統或多模型產品策略,可能比擁有完整訓練管線更有彈性。

這次部署也說明,模型選擇正逐漸成為產品管理決策,而非一次性的技術決策。CoCounsel Legal 保留多個模型可用,並將 Thomson 指派給更窄的工作負載。這樣的安排讓 Thomson Reuters 能在廣泛推理有價值的地方使用前沿系統,同時把自家模型保留給成本、資料存取與可重複性更重要的任務。

AI 代理與企業軟體團隊而言,重要的教訓是:工具存取與評估環境的重要性,可能不亞於基礎模型本身。一個被訓練為在公司自有應用中運作的模型,或許能在有限工作流程中勝過更強的通用模型,但前提是組織能維持其周邊的工具、資料權限與品質控制。

接下來要觀察什麼

第一個訊號將是 CoCounsel Legal 中的實際效能與成本,尤其是 Tabular Analysis 與其他文件審查任務。Thomson Reuters 在所提供的報導中,並未提出獨立證據證明該模型能在正式環境中帶來明確的成本下降或可衡量的客戶品質改善。

較小版本的 Hugging Face 模型與技術報告的發布,應該會提供更多關於架構、訓練方法、授權與可重現性的資訊。這也會顯示外部開發者是否能在 Thomson Reuters 自身受控環境之外使用 Thomson。

與律師事務所的授權談判也是另一個訊號,儘管 The Decoder 將其描述為初期且不具約束力。若外部法律組織採用,將更能檢驗 Thomson 是一個產品資產,而不只是內部最佳化工具。

最後,未來的評估應在相同推理設定下比較 Thomson 與目前的前沿模型,並清楚區分僅網路、專有內容與工具啟用三種條件。這樣會更容易判斷報導中的優勢有多少真正來自模型本身。

Creati.ai 觀點

Thomson Reuters 的投資,並不表示每一家企業都應該訓練自己的語言模型。它證明的是:當公司控制稀缺資料、擁有可監督系統的專家,且營運的是推論經濟性可被衡量的重複性工作流程時,擁有模型是有道理的。

更重要的策略動作,或許是把內部模型開發與持續使用外部模型結合起來。Thomson Reuters 並沒有離開前沿市場;它是在試圖掌握堆疊中那一段,讓專有內容與高量法律任務產生槓桿。對建構者與企業買家來說,這比把完整的內部訓練視為目的本身,更像是一種可信的模型策略。

精選

Thomson Reuters 投資 4,000 萬美元打造自有法律 AI 模型

Thomson Reuters 正投入 4,000 萬美元打造自有法律 AI 模型,目標是降低成本,並掌控專有資料與高量工作流程。