AI News

Aikido Security 表示,為了找出最強的網路 AI 模型,它使用了 117 億個 token,讓模型評估的成本與複雜度成為一則網路安全研究故事的核心。

這份標題為「We burned 11.7bn tokens to find the best cyber AI model」的報告,是所提供來源群組中唯一具實質內容的項目。由於完整文章內容不可取得,因此無法根據現有證據獨立確認測試了哪些具體模型、使用了哪些任務、花費多少、評分方法為何,以及最後的建議是什麼。兩則索引來源條目也是重複項,並非分別的驗證。

對 AI 開發者與資安團隊來說,這個標題仍然指出了一個實際問題:為安全工作選擇模型,與從一般用途排行榜中挑選模型並不相同。結果可能取決於測試期間所使用的漏洞分析類型、程式碼庫、警示資料、工具存取、上下文視窗,以及人工審查。

報導中的實驗告訴我們什麼——以及沒有告訴我們什麼

已確認的事實相當有限。Aikido Security 發布了一份說明,描述一項以找出最佳網路 AI 模型為目標、耗用 117 億個 token 的評估。現有證據無法指出這個數字代表輸入 token、輸出 token,或兩者合計。也沒有揭露這項工作是否涉及託管的應用程式介面、在地部署模型、代理迴圈,或是多種方法的混合。

這個缺少的細節很重要,因為 token 消耗並不是研究品質的直接衡量標準。長時間的評估可能反映廣泛的測試覆蓋、重複提示、自動重試、大型程式碼儲存庫,或效率不佳的工作流程。反過來說,較小的測試可能漏掉重要的失敗模式。若沒有實驗流程,讀者無法判斷這項投入到底是受控基準測試、內部產品實驗,還是更廣泛的實務安全工作流程模型試驗。

因此,這則來源應被視為供應商提出的評估主張,而非獨立的業界基準。提供的材料中沒有任何內容證實 Aikido Security 的最終排名適用於所有資安團隊、程式語言、威脅類別或部署環境。

為什麼 117 億個 token 對模型買家很重要

Token 使用量已成為 AI 產品經濟的重要部分。在網路防禦工作流程中,模型可能會處理原始碼、相依性檔案、漏洞描述、日誌、工單、修補建議與工具結果。一個會反覆回顧這些材料的代理,消耗的 token 可能遠高於一次單純的問答互動。

即使沒有公開勝出者,這個數字仍然值得注意。它顯示,當團隊以真實任務測試多個系統時,嚴謹的模型選擇可能需要相當可觀的評估預算。成本不只限於模型存取。工程團隊還需要測試架構、具代表性的資料、評分規則、沙箱化工具,以及能分辨合理答案與安全且正確答案的審查者。

對於 企業 AI 買家來說,關鍵問題不只是誰拿到最高分,而是模型能否在可接受的成本下提供可靠結果,同時維持資料控制。某個模型即使在狹窄的漏洞任務上表現優異,若必須將敏感原始碼傳送給外部供應商、產出難以稽核的建議,或在儲存庫超出可用上下文時失敗,仍可能不適合。

網路安全測試需要的不只是模型排名

有用的網路 AI 模型評估應該區分多項能力。程式碼理解與漏洞發現,和說明可利用性、提出修補、驗證修補、或為資安團隊排序發現結果,都是不同的事情。工具使用又增加了另一層:當代理可以搜尋檔案、執行測試、檢查相依性或查詢掃描器時,可能會找到更多問題,但這些權限也帶來安全與治理風險。

目前可得來源並未說明 Aikido Security 測量了哪些面向。這使得無法將報導結果與既有的 AI 基準進行有意義的比較,也無從得知這項實驗評估的是準確率、召回率、偽陽性率、修補品質、延遲、成本,還是人力生產力。

這個區分對於打造程式助理與 AI 安全工具的產品團隊非常重要。模型在示範中可能看起來很強,但卻可能因為過多警示、不安全的程式碼變更,或需要大量人工審查的建議而造成營運摩擦。資安工作流程通常更重視一致且可解釋的決策,而不只是流暢的回應。

對開發者與企業團隊的啟示

評估安全用途 AI 模型的開發者,應將 Aikido Security 報導的 token 支出視為提醒:在開始測試前,先定義決策標準。團隊需要明確哪些任務最重要、什麼算正確答案、人類審查者如何評分,以及重複代理活動的成本如何計算。

他們也應測試失敗行為。會拒絕不確定要求、指出缺少證據,並避免採取未授權動作的模型,可能比那些產生看似自信但脆弱修補的模型更有用。評估應納入接近生產環境的儲存庫與警示,同時保護機密程式碼與客戶資料。

對企業 AI 計畫而言,部署架構的重要性可能不亞於模型本身。團隊必須比較託管與自管選項、日誌與保留政策、存取控制、工具權限,以及能否重現某項建議。這些因素即使在原始技術分數很高時,也可能決定一個 AI 安全系統是否能真正部署。

這個故事也凸顯了市場上的挑戰。模型效能越來越具任務特定性,但供應商常透過專有測試來呈現結果。買家需要足夠的方法細節,才能重現或質疑這些說法。醒目的 token 總數雖然吸睛,卻無法單獨指出某個特定安全作業最好的模型。

接下來要觀察什麼

最重要的後續是來自 Aikido Security 的完整說明。讀者需要知道測試了哪些模型、任務類別、評估資料集、評分準則,以及 117 億個 token 是如何分配的。

同樣重要的是,看看 Aikido Security 是否會公布勝出的模型,以及比較結果、錯誤範例或每項任務成本的資料。相較於目前由供應商控制的來源紀錄,獨立重現會為判斷該主張提供更強的基礎。

資安團隊應關注超越標題排行的證據:偽陽性率、修補驗證、在陌生程式碼上的表現、工具使用安全性、延遲,以及人工審查的影響。這些指標更可能預測網路 AI 模型是否能支援正式生產工作。

Creati.ai 觀點

Aikido Security 報導的 117 億 token 實驗之所以值得關注,是因為它把模型選擇框定為工程與營運成本問題,而不只是排行榜競賽。然而,現有證據太有限,無法據此下結論指出哪個模型才是真正最佳。

對 AI 開發者而言,有價值的教訓是方法論上的:大規模測試可以揭示短示範看不出的差異,但規模本身無法讓基準測試變得可信。在底層流程與結果公開之前,這份報告最好被解讀為網路 AI 評估可能有多嚴苛的訊號,而不是某個明確市場贏家的證明。

精選

Aikido Security 表示為尋找網路 AI 模型花費了 117 億個 token

Aikido Security 表示,為了比較網路 AI 模型已花費 117 億個 token,這引發了對基準設計、成本,以及對買家的證據的疑問。