AIUC 籌得 4,000 萬美元,為企業安全認證 AI 智能代理,透過數千項測試評估越獄、幻覺與資料外洩。

Artificial Intelligence Underwriting Company(AIUC)是一家由 Anthropic 早期員工與 AI 安全組織 METR 前營運長共同創立的新創公司,已募得 4,000 萬美元,用於打造一個獨立的 AI 智能代理測試與認證層。
根據 TechCrunch,這輪 A 輪由 Ribbit Capital 領投,First Harmonic 參與。加上先前報導的 1,500 萬美元種子輪——該輪由 Nat Friedman 的 NFDG、Emergence、Terrain,以及 Anthropic 共同創辦人 Ben Mann 支持——AIUC 的總募資金額達到 5,500 萬美元。
AIUC 鎖定的是企業日益關注的問題:一個 AI 系統是否值得信任,能否在商業工作流程中運作,而不只是它能不能完成任務。該公司提出的 AIUC-1 標準,部分參考了廣泛用於評估安全與商業流程控管的 SOC 2 架構。
AIUC 由早期 Anthropic 員工 Rune Kvist 與 Rajiv Dattani 共同創立;據 TechCrunch 報導,Dattani 曾於 2024 年至 2025 年擔任 METR 的 COO,現仍是該組織董事會成員。兩位創辦人將公司定位為一個獨立評估者,服務於開發或部署 AI 智能代理 的公司。
這家新創表示,它已召集約 250 名安全與風險領袖組成聯盟,協助定義企業買家在購買智能代理前想知道什麼。Dattani 告訴 TechCrunch,這些討論會影響 AIUC 用來評估系統的測試內容。
AIUC 表示,其測試服務會讓智能代理經歷約 5,000 種情境,涵蓋越獄、幻覺與資料外洩等領域。該流程會產出一份約 100 頁的報告,指出系統在哪些地方表現可靠,以及買家應在哪些地方加上限制或額外控管。
這些測試本身是在 AI 智能代理的協助下進行,AI 也被用來分析產生的資料。Kvist 表示,最終稽核會由人員確認。這項人工審查很重要,因為自動化評估者可能會繼承同樣的盲點、誤解模型行為,或無法察覺微妙的安全問題。
這家公司的主張反映了企業評估 企業 AI 方式的轉變。即使一個智能代理在基準測試中表現良好,如果它可能洩露機密資訊、遵循惡意指令,或執行超出授權範圍的動作,那麼它仍可能不適合用於金融、醫療、政府或客服工作流程。
Kvist 告訴 TechCrunch,許多組織不再只是因為 AI 模型能力不足而按下部署煞車。相反地,他們需要的是保證:系統會在對客戶與監管機構的承諾範圍內行事。AIUC 的方法旨在於部署前提供可供檢視的證據,而不是只依賴供應商內部的測試。
公司列出的客戶包括 Cursor、Lovable、Harvey 與 ElevenLabs。不過,來源並未提供這些合作的範圍、哪些產品被評估,或這些公司是否已完成 AIUC-1 認證等細節。因此,這些採用訊號應視為公司自身說法,而非獨立驗證的客戶結果。
儘管名稱中有「underwriting」一詞,AIUC 的商業模式也不同於傳統保險。現有證據描述的是一項測試與認證服務,而非針對 AI 系統造成損失的保險保障。其近期產品是一個評估層,目的是支援採購與部署決策。
Dattani 在 METR 的背景,讓 AIUC 與既有的 AI 評估領域產生連結。METR 一直與前沿 AI 實驗室合作,衡量智能代理是否能可靠完成任務。其研究也曾用於模型行為相關調查,包括與 OpenAI 的 Hugging Face incident 相關的工作。
AIUC 表示其重點更廣,也更面向企業。與其主要關注任務表現,AIUC-1 流程更著重檢視當智能代理與真實商業資料、工具與使用者互動時,可能出現的安全與可靠性失誤。
這個區別對買家很重要。某個系統可能在受控評估中成功完成任務,但在正式環境中仍需要狹窄權限、監控、人員批准,或受限的運作環境。獨立測試可協助採購團隊比較不同系統,但認證無法保證智能代理在模型更新、工具變更或新的攻擊技術出現後仍然安全。
更廣泛的外部評估概念,也正在前沿模型公司間獲得關注。Anthropic 執行長 Dario Amodei 呼籲在前沿開發上更加謹慎,並建議獨立評估者可以觀察並驗證 AI 實驗室的安全工作。AIUC 並未提議把評估者派駐到客戶現場,但其創辦人正追求一個相關原則:在信任強大系統之前,組織應該能取得獨立證據。
這筆募資是 TechCrunch 報導過的確定商業事件,AIUC 的創辦人、AIUC-1 標準,以及公司所述的測試流程也同樣如此。報導中的客戶名稱、聯盟規模、測試數量與報告長度,都來自 AIUC 在訪談中的自我揭露,應視為公司主張。
目前還沒有足夠證據可判斷 AIUC-1 在預測正式環境事故方面的表現、不同評估者是否會一致地為同一個智能代理打分,或企業是否會把這項認證視為採購必要條件。來源也未提及公開稽核結果、失敗率、修補成果、定價,或智能代理通過測試的比例。
這些缺口很重要。安全認證在買家了解其範圍、且評估可隨時間重複時,才會真正有用。AI 智能代理在模型更新、工具整合、提示詞變更,或可存取資料改變後,行為都可能改變。因此,一份一次性的報告,可能不如與部署控管相連的持續評估有價值。
第一個訊號將是 AIUC 是否公布已完成的 AIUC-1 評估細節,包括方法、評分標準,以及測試期間發現的失敗案例。買家也會想知道,公司如何處理模型更新,以及當智能代理的工具或權限變動時,認證是否需要更新。
另一個重要訊號是獨立驗證。來自非 AIUC 關聯的企業客戶、安全研究員或稽核人員的證據,將有助於判斷這些測試是否能識別真實世界風險,而不只是合成式失敗。
市場也會揭示 AIUC 的方法是否會成為採購流程的一部分。若大型銀行、醫院、政府機關或主要軟體平台採用,將表示第三方智能代理評估正成為標準控管。相反地,如果公司只把認證當作行銷徽章,卻不公布有意義的結果,那麼它對開發者與買家的價值就仍然有限。
AIUC 正在處理企業 AI 的一個真實瓶頸:組織需要一種可 دفاع、可證成的方式,來決定智能代理在哪裡可以自主行動,以及在哪裡需要限制。結構化的外部評估,或許能讓這些決策比起對模型安全性或一般能力的空泛宣稱更加具體。
但認證應被視為證據,而不是移除保護措施的許可。這個市場最強的版本,將把獨立測試、即時監控、最小權限存取、人員升級處理,以及重大系統變更後的 повтор評估結合起來。AIUC 的募資為這個模式提供了發展空間;其可信度則取決於它是否能證明這些報告在實務上改善了部署決策。