隨著 OpenRouter 上代理人 Token 使用量激增,AI 也成為 AI 最大的客戶

OpenRouter 數據顯示,AI 代理人如今消耗的 token 已超過人類,迫使開發者在代理人工作負載擴張之際重新思考成本、容量與可靠性。

AI News

AI 代理人如今在 OpenRouter 上消耗的 token 可能已經比人類使用者還多,這標誌著模型推理需求的生成與付費方式正在轉變。這項變化之所以重要,是因為 AI 系統愈來愈多地在替其他 AI 系統產生工作,而不只是回應直接的人類提示。

根據 The Decoder 引述 OpenRouter 分析師 Peter Walker 的報導,2026 年 2 月 6 日可能是平台上人類消耗 token 數量最後一次多於代理人的日子。自此之後,代理人的 token 使用量增加了 14 倍,而人類使用量則增加了 2.8 倍。

這些數據指向一類快速擴張的工作負載:其中一個模型呼叫另一個模型、持續運作更長時間,或啟動額外的 AI 流程。不過,這並不代表推理支出也以相同倍數增加。被測得的使用量中很大一部分,來自較便宜的快取提示所提供的重複上下文。

OpenRouter 的數據顯示了什麼

核心數據點是 OpenRouter 上人類主導使用與代理人主導使用的 token 消耗比較。The Decoder 報導指出,根據 Walker 的分析,代理人在 2 月 6 日之後,總 token 消耗已超越人類。不過,該報導並未提供底層圖表、token 絕對總量,或 OpenRouter 如何分類代理人流量的詳細定義。

儘管如此,報導中的成長率仍然相當顯著。代理人使用量成長 14 倍,而人類使用量僅成長 2.8 倍,這表示在平台上,自主或半自主工作流程的擴張速度,已經快於傳統聊天機器人互動。

這個結果應被視為平台訊號,而非 AI 市場的完整衡量。據報導,OpenRouter 的流量偏向 open-weight 模型,而 The Decoder 指出,這些模型通常比 OpenAI 或 Anthropic 的模型更不具 token 效率。因此,這些模型的使用者在執行類似任務時可能會產生更多 token,使得該平台的組成與封閉模型供應商不同。

Token 成長不等於成本成長

據報導,近 70% 的代理人 token 消耗來自快取提示。快取可讓重複的指令或上下文以遠低於新處理輸入的費率計費,因此原始 token 總量可能比實際推理成本增長得快得多。

這種差異對規劃代理人部署的產品團隊很重要。若只按 token 衡量,一個看起來很昂貴的工作流程,在大部分上下文都能被有效重用時,帳單可能其實是可控的。反之,若團隊把快取視為保證,當提示頻繁變動、快取命中率下降,或代理人產生大量新輸出時,可能會面臨更高成本。

這些資料也凸顯了測量上的問題。token 數能反映模型上下文被處理了多少,但不一定能反映完成了多少有用工作。一個反覆檢視相同指令或在得出答案前呼叫多個模型的代理人,可能造成大量使用量,卻未帶來相應的品質提升。

為什麼代理人在推動需求

代理人工作流程通常比單輪對話消耗更多 token,因為它們會保留狀態、檢查中間結果、呼叫工具,並修正計畫。它們也可能把子任務委派給不同的模型實例。每一步都可能為下一次請求增加上下文、工具輸出、推理軌跡或指令。

The Decoder 將這波成長與代理人更長時間獨立工作並觸發額外 AI 流程連結在一起。這種行為與更廣泛的趨勢一致:從聊天介面轉向可執行多步驟任務的系統;不過,目前可得證據尚不足以說明究竟是哪些特定應用或產業推動了 OpenRouter 的成長。

該報導也把這個趨勢與推理模型的興起並列。這類系統在回覆前可能會使用更多內部處理,因此即使使用者的請求很短,也會增加 token 消耗。The Decoder 將此形容為「token 通膨」的來源,但現有證據並未顯示 OpenRouter 代理人成長中,有多少來自推理模型、多少來自較長時間的協調流程。

對開發者與企業採購者的影響

對 AI 開發者而言,直接的教訓是:僅靠模型選擇,無法決定營運成本。代理人架構同樣重要。團隊需要監控快取命中率、上下文大小、工具呼叫頻率、重試行為,以及每完成一項任務所需的模型呼叫次數。

可靠性也是另一項考量。運作時間更長的代理人,會讓錯誤假設、失敗的工具呼叫或不必要的迴圈有更多累積的機會。一個單次請求成本低廉的系統,若在沒有明確限制的情況下運作,仍可能變得昂貴。預算、執行逾時、核准關卡與清楚的停止條件,可能和提示品質同樣重要。

企業採購者應向供應商索取工作流程層級的指標,而不是只看標題式的模型價格。實用的問題包括:代理人每項任務會呼叫幾次、多少流量受益於快取、在委派代理人之間如何衡量使用量,以及客戶是否能設定支出或執行限制。

市場意涵也值得注意。如果 AI 愈來愈多地替 AI 產生需求,模型供應商銷售的對象就不只是人類使用者,也包括持續消耗推理的軟體系統。這可能支撐大量使用量,同時也增加供應商在快取、協調、延遲與價格透明度上改進的壓力。

接下來要觀察什麼

首先要觀察的是,其他大型模型平台是否也會報告類似的人類與代理人使用交叉。OpenRouter 偏重 open-weight 模型的流量是有用的證據,但不是整個市場的最終基準。

其次,開發者應尋找更完整的成本資料。70% 的快取提示比例說明了為什麼 token 成長可能高估支出,但它無法揭示總營收、每項任務的平均成本,或未快取輸出的比例。這些指標能說明代理人究竟是在實質擴大付費推理,還是主要在增加低成本上下文處理。

第三,採用說法應以任務完成率與留存來驗證。token 增加可能反映高效率的自主工作、低效率提示,或兩者皆有。關於成功任務率、人類介入與重複使用的證據,會比單純數量更有資訊價值。

最後,模型供應商的回應會很重要。更好的上下文快取、更小型的專用模型,以及更有效率的推理,都可能降低代理人成長的成本。同時,供應商也可能推出專為軟體對軟體需求設計的定價與控制機制。

Creati.ai 觀點

OpenRouter 報告的數字捕捉到 AI 經濟中的一項重要變化:成長最快的模型使用者,可能是另一個模型。但這些證據仍是基於分析師評論的平台特定訊號,而非跨產業、經獨立驗證的代理人活動普查。

對部署 AI 代理人 的團隊來說,實務上的優先事項是衡量每一美元帶來的有用工作,而不只是 token 數量。代理人成長可以擴大推理的可服務市場,但要實現可持續部署,仍取決於對迴圈的控制、任務可靠性的證明,以及理解何時快取真的能降低自主執行成本。

廣告