Tencent 的 Gander 將對話與背景 AI 工作分離

Tencent 的 Gander 將即時對話與背景代理工作分離,承諾減少中斷,同時也暴露了在準確度與多模態理解上的取捨。

AI News

Tencent 推出了 Gander,這是一個研究模型,旨在在背景執行較慢、較複雜的工作時,仍能維持即時對話。該系統可以同時處理語音、圖片與文字,回應插話,並在代理搜尋檔案、撰寫程式碼或處理其他任務時提供進度更新。

這種做法鎖定的是語音助理的長期弱點:系統常常會暫停、等待使用者說完,或在規劃動作時停止回應。根據 The Decoder 依據 Tencent 技術報告所做的報導,Gander 與多個競品相比,提升了對話的時序表現,但也因此犧牲了一部分任務準確度與多模態效能。

一個對話層與可替換的推理層

Gander 將工作分配給兩個元件,Tencent 的研究人員以人體解剖作比喻來描述它們。「小腦」負責即時互動,決定何時傾聽、發話,或在使用者插話時停止。「可替換的大腦」則執行更高要求的推理與代理任務。

這種分工的目的,是避免單一模型同時優化兩個互相衝突的需求。對話需要低延遲與準確的輪替,而像程式撰寫或檔案擷取這類任務則需要更多規劃時間。根據 The Decoder 所描述的技術報告,背景元件可替換成 Codex 或 Claude Code 之類的代理系統,而無需重新訓練對話模型。

Gander 將互動切分為一秒一段,並使用大約前兩分鐘的對話作為其時序決策的上下文。依據 The Decoder 所描述的技術報告,這個模型不依賴獨立的語音開始與停止偵測器。使用者可以在 Gander 發言時打斷它、改變要求的任務,或在工作進行時回答後續問題。

這種架構與產業更廣泛地朝向協調式 AI 代理 發展的方向相似,而不是由單一模型處理互動的每個階段。OpenAI 也曾探索將即時對話與背景推理分開,而其他研究系統則把工作分派給多個模型。

時序表現伴隨取捨

關於 Gander 的最強證據著重於輪替,而非一般智慧。在 Full-Duplex-Bench v3——一個針對多種任務情境的語音助理基準測試——中,Tencent 系統據稱在所有 100 個測試情境中都能在適當時機開始說話,且只有 8% 的情況會插話打斷使用者。

The Decoder 報導,在同一評估中,GPT-Realtime 的數值為 13.5%,而表現最弱的競品接近 48%。這些數字來自研究團隊所報告的基準結果,而非獨立評估;而且該基準並不是專門用來評估結合對話與背景代理的系統標準。

Gander 在任務準確度上較弱。研究人員將部分差距歸因於整體系統的評估方式:語音辨識與生成輸出錯誤會與推理模型的表現一併計算。根據報告,當底層「大腦」直接接收文字時,表現會顯著更好。

這個模型在至少一項音訊與影片理解測試中的表現也低於其基礎模型。研究人員將此結果歸因於訓練目標偏向流暢對話,而非精確感知,包括計數物體或在影像中定位物體等任務。這項限制很重要,因為一個被定位為持續多模態互動的系統,不僅要管理對話,還必須準確解讀使用者展示與描述的內容。

這是早期研究發布,而非成熟產品

據報導,Tencent 團隊用約 270 萬筆範例訓練 Gander。其中一些範例教模型在有背景噪音,或群組中似乎沒有人在對它說話時保持沉默。這類行為對實際部署很重要,因為誤觸發與延遲回應一樣具有干擾性。

研究人員將這項工作描述為早期階段,並承認架構擴展仍未解決。同時,目前也沒有廣泛建立的評估框架,能夠用來衡量低延遲對話、插話處理、多模態感知與長時間任務執行的組合。

Tencent 計畫在完成其所稱的開源釋出流程後,公開模型權重與訓練資料。根據 The Decoder,這個專案的程式碼與示範影片的 GitHub 倉庫已經存在。然而,在權重與資料公開之前,外部開發者無法完整重現報導中的結果,也難以評估系統的訓練選擇。

該公司的更廣泛 AI 動向也提供了背景。Gander 接續 Tencent 報導中的 Hy3 釋出,Hy3 是一個開放語言模型,已被用於 WorkBuddy、Yuanbao 與 WeChat 等產品。據報導,Tencent 也正在就代理新創 Manus 的大額股權進行談判,這與 Tencent 想將代理能力嵌入現有消費平台的興趣相符。

Gander 對開發者與企業的意義

對於打造語音介面的開發者來說,Gander 突顯了一個實用的系統設計原則:對話回應速度與任務執行,或許應由不同元件分工處理。輕量級互動模型可維持使用者的控制感,而更強大的模型則可非同步運作。這或許能減少讓使用者靜靜等待搜尋、程式碼生成步驟或工作流程動作的需要。

代價是營運複雜度。分離式系統必須協調對話層與背景代理之間的狀態,決定哪些插話應該取消工作,並避免在使用者改變方向後仍送出過時結果。它也需要清楚的狀態訊號,讓使用者理解系統是在傾聽、推理、等待資料,還是仍在執行動作。

準確度仍是核心問題。基準結果顯示,較少的中斷並不會自動帶來更好的結果。部署 AI 代理的產品團隊不僅要測試延遲與輪替,還必須測試轉錄品質、視覺對齊、任務完成度、被打斷後的恢復能力,以及同時執行多個模型的成本。

對企業買家而言,這次計畫中的釋出,可能會讓 Gander 更像參考架構,而非可立即部署的產品。開放權重與訓練資料將讓團隊能研究 Tencent 如何處理吵雜環境、重疊語音與上下文保留,也更容易在一致條件下與 GPT-Realtime、Gemini Live 與 Grok 等商業系統比較。

接下來要觀察什麼

第一個訊號是 Tencent 是否會釋出承諾中的權重與訓練資料,以及公開套件是否包含足夠的程式碼與評估材料,以便獨立重現。開發者也應關注更長任務的結果,因為背景規劃與插話在這類任務中會創造更多狀態管理失敗的機會。

第二個訊號是 Gander 能否在不失去時序優勢的情況下改善音訊與影片理解。更好的感知能力將決定這種架構能否支援真正的多模態助理,而不只是帶有視覺輸入的語音系統。

最後,市場需要更清楚的持續互動基準。Full-Duplex-Bench v3 的結果對輪替很有幫助,但開發者需要的是結合插話處理、任務準確度、安全性、可靠性與營運成本的評估。

Creati.ai 觀點

Gander 的意義與其說在於單一基準分數,不如說在於它明確劃出了對話與工作的控制邊界。使用者期待助理在動作執行期間仍能保持可用,但這種體驗依賴細緻的協調,而不只是更大的模型。

Tencent 的結果也顯示,產品團隊不應把流暢對話視為可靠執行的替代品。Gander 在時序上看來有潛力,但其在任務準確度與多模態理解上的報導弱點,留下了更難的問題:當工作真的重要時,助理能否在不變得更不可靠的情況下,仍保持自然?

廣告