據報 AI 代理人使用的 Token 是人類的五倍,但數據並不明確

據報 AI 代理人與人類使用者之間的 Token 使用量相差五倍,凸顯推論成本正在上升,但背後的數據仍未公開。

AI News

Yahoo Finance 與 24/7 Wall St. 流傳的一則標題稱,AI 代理人消耗的 Token 是人類使用者的五倍,而且差距仍在擴大。如果這一趨勢獲得確認,將代表圍繞大型語言模型打造的軟體,其成本結構正在快速變化:自主系統可能生成並處理遠多於人類直接產生的模型輸出。

然而,目前可取得的報導並未提供原始文章內容、資料集、方法論、時間範圍,或進行這項比較的具名組織。因此,五倍這個數字仍是媒體報導的說法,而不是可獨立驗證的產業統計。這則消息對 AI 開發者與企業買家仍然具有參考價值,但最重要的問題不只是代理人是否使用更多 Token,而是這些 Token 如何生成、哪些任務需要它們,以及額外的模型運算是否能創造足夠價值,來合理化其成本與營運風險。

報導中的五倍差距可能代表什麼

在 AI 應用程式中,Token 是語言模型處理的文字單位。當系統接收冗長指令、擷取文件、保留對話歷史、呼叫工具、重試失敗的操作,或要求模型檢查並修改自己的工作時,Token 消耗量可能上升。因此,AI 代理人可能產生遠多於人類使用聊天介面提出單一要求時的模型互動。

兩家媒體的標題都將比較對象描述為AI 代理人與人類,但沒有說明「人類」是指使用聊天機器人的人、在沒有 AI 的情況下完成相同工作流程的員工,還是其他使用者類別。報導也沒有說明這五倍差距衡量的是輸入 Token、輸出 Token,還是兩者皆包括。

這些區別很重要。程式設計助理可能消耗大型上下文視窗,但只產生相對簡短的回答。研究代理人可能反覆搜尋、摘要、比較並驗證資訊。客服代理人可能在向使用者呈現簡短回答之前,先產生多次隱藏的模型呼叫。將這些模式彙總成單一數字,可能掩蓋產品與任務之間的重大差異。

證據過於薄弱,無法驗證這項說法

Yahoo Finance 與 24/7 Wall St. 刊登了相同的核心標題,差別只有標點符號,但所提供的來源資料並沒有完整文章內容。兩份來源摘錄都沒有指出提出這項說法的研究人員、公司、基準測試、樣本數量、模型供應商或測量期間。

因此,五倍這個數字不應被視為已確認的基準。現有資料也沒有證據表明,所報導的差距擴大是在整個 AI 代理人市場中測量的。它可能只描述某個特定平台、客戶群、工作流程或內部分析。

這項限制尤其重要,因為 Token 使用量會隨模型選擇與應用程式設計而變化。使用較小模型進行例行分類的系統,與將每個步驟都交由前沿模型處理的系統,會呈現不同的使用特徵。同樣地,設定為一次工具呼叫後就停止的代理人,不能直接與設計成規劃、執行、檢查結果並持續重試直到任務完成的代理人相比。

因此,現有報導只支持一項有限結論:媒體正在強調 AI 代理人 Token 消耗量增加的說法。目前仍不足以精確估算整個市場的使用量,也無法證明代理人正變得不具經濟效率。

為什麼這個數字對開發者與買家很重要

對產品團隊而言,較高的 Token 使用量不只是模型帳單變大而已。它可能影響回應延遲、速率限制、基礎設施規劃、可觀測性,以及多步驟工作流程的可靠性。一個會在不知不覺中擴大上下文或重試操作的系統,即使維持準確,也可能變得太慢或太昂貴,無法用於正式環境。

建構 AI 代理人的團隊應在工作流程層級測量 Token,而不只是按使用者請求測量。有用的指標包括每項已完成任務的 Token 數、每個成功結果的模型呼叫次數、重試頻率、工具呼叫失敗率,以及由不同模型處理的工作占比。這些指標可以顯示額外推理是否改善任務完成率,還是只帶來更多活動。

企業買家也面臨類似挑戰。介面中的簡短回答,可能掩蓋一連串規模大得多的模型呼叫。採購與財務團隊應詢問供應商如何計算使用量、是否包括背景呼叫,以及使用者、文件、工具和保留上下文數量增加時,成本如何變化。

這項報導中的趨勢也提出了產品設計問題。代理人系統通常以自主性作為賣點,但自主性可能需要更多規劃與驗證。因此,正確的比較不只是 Token 數量,而是與現有軟體、人力或更簡單的 AI 工作流程相比,完成某項明確業務流程所需的成本與品質。

對市場的影響:效率成為產品功能

如果代理人消耗的 Token 比人類使用者更多,而且差距還在擴大,模型效率將成為核心競爭因素。開發者可能會偏好使用較小模型進行路由與擷取,將能力更強的模型保留給困難決策,並將上下文限制在直接影響任務的資訊上。

其他控制措施包括快取重複指令、摘要長篇歷史記錄、限制不必要的工具呼叫,以及為規劃和重試設定明確預算。這些技術可以減少浪費,但也可能帶來取捨。過度壓縮上下文可能刪除有用證據,而嚴格的 Token 限制可能導致代理人在驗證工作之前就停止。

對平台公司而言,透明的使用量報告可能變得與模型的宣稱品質同樣重要。客戶需要知道代理人是否取得更好成果,還是只產生更多推論活動。只測量 Token、卻不測量任務是否成功完成的供應商基準,會呈現不完整的情況。

這項說法對模型供應商之間的競爭也很重要。隨著 AI 代理人處理更長的工作流程,能以更少呼叫或成本更低的模型提供可靠結果的供應商,可能取得優勢。然而,現有來源並未指出目前是哪家供應商、哪項產品或哪個模型擁有這種優勢。

接下來應關注什麼

第一個後續訊號是五倍估算的原始來源。可信的更新應說明資料由誰收集、什麼被定義為代理人、人類使用量如何測量,以及輸入與輸出 Token 是否分開計算。

第二個是分母:每位使用者、每段對話、每項任務或每個成功結果的 Token 數,會導出非常不同的結論。買家也應尋找按工作流程、模型與自動化程度細分的數據,而不是單一的全市場平均值。

最後,應關注將較高 Token 使用量與商業成果連結起來的證據。完成率、錯誤減少量、節省時間,以及每項已解決任務的總成本等指標,可以顯示消耗增加反映的是有效推理,還是低效率的系統設計。

Creati.ai 的觀點

報導中的五倍差距是一項有用的警示,但尚不是可靠的基準。根據現有證據,最有力且可合理辯護的解讀是:AI 代理人可能正在創造一層傳統聊天機器人使用指標無法捕捉的隱性模型需求。

對開發者與企業而言,實際的應對方式是測量,而不是恐慌。追蹤完整的代理人工作流程,將 Token 消耗與成功結果連結起來,並要求供應商揭露背景推論如何計費。在基礎數據公開之前,關於差距擴大的說法應該用來引導對部署經濟性的提問,而不是替這些問題下定論。

廣告