Aikido Security 表示為尋找網路 AI 模型花費了 117 億個 token

Aikido Security 表示,為了比較網路 AI 模型已花費 117 億個 token,這引發了對基準設計、成本,以及對買家的證據的疑問。

AI News

Aikido Security 表示,為了找出最強的網路 AI 模型,它使用了 117 億個 token,讓模型評估的成本與複雜度成為一則網路安全研究故事的核心。

這份標題為「We burned 11.7bn tokens to find the best cyber AI model」的報告,是所提供來源群組中唯一具實質內容的項目。由於完整文章內容不可取得,因此無法根據現有證據獨立確認測試了哪些具體模型、使用了哪些任務、花費多少、評分方法為何,以及最後的建議是什麼。兩則索引來源條目也是重複項,並非分別的驗證。

對 AI 開發者與資安團隊來說,這個標題仍然指出了一個實際問題:為安全工作選擇模型,與從一般用途排行榜中挑選模型並不相同。結果可能取決於測試期間所使用的漏洞分析類型、程式碼庫、警示資料、工具存取、上下文視窗,以及人工審查。

報導中的實驗告訴我們什麼——以及沒有告訴我們什麼

已確認的事實相當有限。Aikido Security 發布了一份說明,描述一項以找出最佳網路 AI 模型為目標、耗用 117 億個 token 的評估。現有證據無法指出這個數字代表輸入 token、輸出 token,或兩者合計。也沒有揭露這項工作是否涉及託管的應用程式介面、在地部署模型、代理迴圈,或是多種方法的混合。

這個缺少的細節很重要,因為 token 消耗並不是研究品質的直接衡量標準。長時間的評估可能反映廣泛的測試覆蓋、重複提示、自動重試、大型程式碼儲存庫,或效率不佳的工作流程。反過來說,較小的測試可能漏掉重要的失敗模式。若沒有實驗流程,讀者無法判斷這項投入到底是受控基準測試、內部產品實驗,還是更廣泛的實務安全工作流程模型試驗。

因此,這則來源應被視為供應商提出的評估主張,而非獨立的業界基準。提供的材料中沒有任何內容證實 Aikido Security 的最終排名適用於所有資安團隊、程式語言、威脅類別或部署環境。

為什麼 117 億個 token 對模型買家很重要

Token 使用量已成為 AI 產品經濟的重要部分。在網路防禦工作流程中,模型可能會處理原始碼、相依性檔案、漏洞描述、日誌、工單、修補建議與工具結果。一個會反覆回顧這些材料的代理,消耗的 token 可能遠高於一次單純的問答互動。

即使沒有公開勝出者,這個數字仍然值得注意。它顯示,當團隊以真實任務測試多個系統時,嚴謹的模型選擇可能需要相當可觀的評估預算。成本不只限於模型存取。工程團隊還需要測試架構、具代表性的資料、評分規則、沙箱化工具,以及能分辨合理答案與安全且正確答案的審查者。

對於 企業 AI 買家來說,關鍵問題不只是誰拿到最高分,而是模型能否在可接受的成本下提供可靠結果,同時維持資料控制。某個模型即使在狹窄的漏洞任務上表現優異,若必須將敏感原始碼傳送給外部供應商、產出難以稽核的建議,或在儲存庫超出可用上下文時失敗,仍可能不適合。

網路安全測試需要的不只是模型排名

有用的網路 AI 模型評估應該區分多項能力。程式碼理解與漏洞發現,和說明可利用性、提出修補、驗證修補、或為資安團隊排序發現結果,都是不同的事情。工具使用又增加了另一層:當代理可以搜尋檔案、執行測試、檢查相依性或查詢掃描器時,可能會找到更多問題,但這些權限也帶來安全與治理風險。

目前可得來源並未說明 Aikido Security 測量了哪些面向。這使得無法將報導結果與既有的 AI 基準進行有意義的比較,也無從得知這項實驗評估的是準確率、召回率、偽陽性率、修補品質、延遲、成本,還是人力生產力。

這個區分對於打造程式助理與 AI 安全工具的產品團隊非常重要。模型在示範中可能看起來很強,但卻可能因為過多警示、不安全的程式碼變更,或需要大量人工審查的建議而造成營運摩擦。資安工作流程通常更重視一致且可解釋的決策,而不只是流暢的回應。

對開發者與企業團隊的啟示

評估安全用途 AI 模型的開發者,應將 Aikido Security 報導的 token 支出視為提醒:在開始測試前,先定義決策標準。團隊需要明確哪些任務最重要、什麼算正確答案、人類審查者如何評分,以及重複代理活動的成本如何計算。

他們也應測試失敗行為。會拒絕不確定要求、指出缺少證據,並避免採取未授權動作的模型,可能比那些產生看似自信但脆弱修補的模型更有用。評估應納入接近生產環境的儲存庫與警示,同時保護機密程式碼與客戶資料。

對企業 AI 計畫而言,部署架構的重要性可能不亞於模型本身。團隊必須比較託管與自管選項、日誌與保留政策、存取控制、工具權限,以及能否重現某項建議。這些因素即使在原始技術分數很高時,也可能決定一個 AI 安全系統是否能真正部署。

這個故事也凸顯了市場上的挑戰。模型效能越來越具任務特定性,但供應商常透過專有測試來呈現結果。買家需要足夠的方法細節,才能重現或質疑這些說法。醒目的 token 總數雖然吸睛,卻無法單獨指出某個特定安全作業最好的模型。

接下來要觀察什麼

最重要的後續是來自 Aikido Security 的完整說明。讀者需要知道測試了哪些模型、任務類別、評估資料集、評分準則,以及 117 億個 token 是如何分配的。

同樣重要的是,看看 Aikido Security 是否會公布勝出的模型,以及比較結果、錯誤範例或每項任務成本的資料。相較於目前由供應商控制的來源紀錄,獨立重現會為判斷該主張提供更強的基礎。

資安團隊應關注超越標題排行的證據:偽陽性率、修補驗證、在陌生程式碼上的表現、工具使用安全性、延遲,以及人工審查的影響。這些指標更可能預測網路 AI 模型是否能支援正式生產工作。

Creati.ai 觀點

Aikido Security 報導的 117 億 token 實驗之所以值得關注,是因為它把模型選擇框定為工程與營運成本問題,而不只是排行榜競賽。然而,現有證據太有限,無法據此下結論指出哪個模型才是真正最佳。

對 AI 開發者而言,有價值的教訓是方法論上的:大規模測試可以揭示短示範看不出的差異,但規模本身無法讓基準測試變得可信。在底層流程與結果公開之前,這份報告最好被解讀為網路 AI 評估可能有多嚴苛的訊號,而不是某個明確市場贏家的證明。

廣告