在 Andreessen Horowitz 的支持下,Vals 募得 4,000 萬美元,為企業與聯邦機構打造保密、以任務為基礎的 AI 基準測試,而較舊的測試 s…

AI 基準測試新創公司 Vals 在由 Andreessen Horowitz 領投、募得 4,000 萬美元的 A 輪融資後,正試圖把模型評估變成 AI 市場中更實用、也更值得信賴的一層。該公司認為,許多既有測試已不足以評判日益強大的模型,尤其是在企業能事先看到測試材料的情況下。
Vals 不僅依賴一般知識的公開考試,而是以複雜、特定領域的任務來評估 AI 系統。這種方法旨在幫助模型開發者找出弱點,幫助買家比較可用於實際工作的系統,並讓監管機關或投資人取得更有意義的效能與風險證據。
Vals 成立於 2024 年,起因是共同創辦人暨執行長 Rayan Krishnan 觀察到,學術基準測試難以跟上新模型能力的發展。TechCrunch 報導指出,Krishnan 表示,業界推出具備能力的模型速度,已快過傳統評估系統能衡量的速度。
該公司的測試設計,意在模擬法律、金融與程式設計等領域的專業工作。Vals 表示,它不只是問模型是否能回答困難問題,而是檢驗系統是否能在特定領域中產出品質可與人類成果相當的工作。
一個顯著特點是,Vals 並不公開揭露其測試所使用的具體材料。公司的理由是,完全公開的基準測試可能成為優化或訓練的目標。模型可能看起來在某項測試中進步了,卻未必在更廣泛、未見過的工作中展現相應改善。
Vals 也表示,其評估不只考量成功完成任務,還會納入有害或不理想的結果。其被報導的關注領域包括 資安、生物安全、心理健康、遞迴式自我提升,以及武裝衝突法。現有資料並未詳述這些計畫各自的方法論、評分系統或獨立驗證方式。
這輪 A 輪之前,Vals 先前曾獲得由 8VC 與 Bloomberg Beta 領投的種子輪。TechCrunch 報導,Vals 最近一輪融資是在 2026 年 9 月文章發表前一個月完成,而公司團隊人數已從年初的 8 人增至 25 人。
這些成長數字,以及公司聲稱營收較去年增加 8 倍,都是透過 Krishnan 對外表述的,應視為公司自報的指標,而非經獨立審計的證據。現有來源材料並未指出 Vals 的客戶、總營收、測試量,或被評估的模型數量。
公司透過向 AI 開發者收取模型評估費用來賺錢。這形成一種既有潛力、又相當微妙的關係:付費接受測試的一方,同時也是被評判系統的一方。Vals 將這項服務定位為開發與品質控管工具,並將其比擬為支付一場標準化考試,以找出需要改進之處。
公司也推出了一項聚焦於為聯邦機構提供模型評估的計畫。來源材料並未說明有哪些機構參與,或該計畫是否已產出公開成果。
對 AI 建構者而言,評估的價值取決於它是否能預測測試環境之外的表現。公開基準測試雖然容易溝通,但若模型已針對其題目調校,或測試衡量的是抽象知識而非真實工作流程,它的實用性可能較低。
Vals 的任務導向模式,對於選擇用於法律審查、財務分析、軟體開發或其他營運任務的 企業 AI 買家,可能更具相關性。買家在意的,可能不是模型在總排行榜上的名次,而是它是否能準確、一致且以可接受的失敗模式完成既定工作流程。
這使得評估品質不只是行銷問題,而是部署問題。產品團隊需要知道模型在哪裡會失效、多常需要人類介入,以及看似優異的結果是否掩蓋了安全性或可靠性問題。保密測試或許能降低基準測試被操弄的機會,但也會讓外部審視更加困難。買家需要足夠的方法透明度,才能理解分數的意義,而不必拿到測試答案。
隨著 AI 系統愈來愈深入企業流程,商業利害關係也可能升高。如果模型評估開始影響採購、公開申報、投資決策或監管審查,產出這些評估的組織就會面臨證明獨立性、可重複性,以及對利益衝突的抵抗力的壓力。
Vals 的論點主要建立在它所指出的問題,以及公司所主張的方法上。TechCrunch 報導了 Krishnan 對市場的描述:舊有基準測試正逐漸落後於現代模型,但來源並未提供比較結果,證明 Vals 的測試比競爭系統更具預測力或更難被操弄。
目前可取得的報導中,也沒有獨立證據顯示 Vals 已成為業界首選的評估者。來自 Andreessen Horowitz 與早期支持者的融資,代表的是投資人信心,而非基準準確度或市場採用的證明。同樣地,報導中的營收成長與擴展至聯邦機構評估,顯示的是公司宣稱的動能,卻無法證明廣泛的客戶接受度。
Vals 還必須面對來自模型開發者、研究實驗室、開放基準社群、專業測試公司,以及內部評估團隊的競爭。有些組織可能偏好透明的公開測試;另一些則會為反映自身資料與工作流程的私有評估付費。公司的挑戰在於證明,其受控流程能產生顧客無法從內部測試或既有評估平台取得的洞見。
最明確的訊號,將是公開證據顯示 Vals 如何替模型打分,以及這些分數是否與實際生產環境表現相關。買家應關注已揭露的方法論、可重複性研究、在一致條件下進行的模型比較,以及評估如何改變部署或採購決策的案例。
其聯邦機構計畫也是一項重要測試。若有具名參與者、已發表的發現,或正式採購關係,將比單純宣布更能提供有力證據。公司預計的人員招募與辦公室擴張,或可顯示持續的商業活動,但相較於員工數,客戶留存率與持續性的評估量更為重要。
市場也應留意,Vals 能否在維持保密的同時,不變成一個黑盒子。如果其評估會影響關於安全性、能力或投資價值的主張,那麼獨立監督與清楚的評分說明將成為其可信度的核心。
Vals 在此時進入市場,相當合適:AI 公司愈來愈需要能反映人們實際工作的評估,而買家也愈來愈懷疑那些無法轉化為可靠部署的排行榜成績。它對隱藏測試與特定領域任務的聚焦,正好對準公開基準測試的真實弱點。
但要成為值得信賴的標準,光有創投資金與快速成長還不夠。Vals 必須證明,其私有評估是嚴謹、可重現,且具有足夠透明度,讓客戶與外部人士能理解其意義。公司下一階段的關鍵,與其說是基準目錄的雄心,不如說是其結果能否穩定改善關於應該打造、採購與部署哪些 AI 模型 的決策。