AIUC、企業向けAIエージェントのテストと認証のために4,000万ドルを調達

AIUCは、エンタープライズ向けの安全性を確認するAIエージェントの認証のために4,000万ドルを調達し、数千件のテストで脱獄、幻覚、データ漏えいを評価します。

AI News

Artificial Intelligence Underwriting Company(AIUC)は、Anthropicの初期社員とAI安全組織METRの元COOによって設立されたスタートアップで、AIエージェント向けの独立したテストおよび認証レイヤーを構築するために4,000万ドルを調達した。

TechCrunchによると、シリーズAはRibbit Capitalが主導し、First Harmonicが参加した。このラウンドにより、AIUCの累計調達額は5,500万ドルとなった。これには、Nat FriedmanのNFDG、Emergence、Terrain、そしてAnthropic共同創業者のBen Mannが支援した、以前報じられた1,500万ドルのシードラウンドが含まれる。

AIUCが狙うのは、企業の間で高まっている懸念だ。つまり、AIシステムがタスクを完了できるかどうかだけでなく、業務フローの中で信頼して運用できるかどうかである。同社が提案するAIUC-1標準は、セキュリティや業務プロセスに関する統制を評価するために広く使われているSOC 2を部分的にモデルとしている。

AIエージェント向けの認証レイヤー

AIUCは、早期のAnthropic社員であるRune Kvistと、2024年から2025年までMETRのCOOを務め、現在も同組織の理事を務めるRajiv Dattaniによって設立されたとTechCrunchは報じている。創業者らは、AIエージェントを構築または展開する企業向けの独立した評価者として同社を位置づけている。

このスタートアップは、企業の購入担当者がエージェントを買う前に何を知りたいのかを定義するために、約250人のセキュリティおよびリスク担当リーダーからなるコンソーシアムを組織したという。こうした議論が、AIUCがシステム評価に使うテストの基盤になっているとDattani氏はTechCrunchに語った。

AIUCによると、そのテストサービスは、脱獄、幻覚、データ漏えいなどの分野を含む約5,000のシナリオでエージェントを実行する。その結果として、システムが信頼できる動作をする箇所と、購入者が制限や追加の統制を適用すべき箇所を示す、およそ100ページのレポートが作成される。

テスト自体はAIエージェントの助けを借りて実施され、生成されたデータの分析にもAIが使われる。Kvist氏によれば、最終監査は人が確認する。この人手によるレビューは重要だ。なぜなら、自動評価者は同じ盲点を引き継いだり、モデルの振る舞いを誤解したり、微妙なセキュリティ問題を見逃したりする可能性があるからだ。

モデル能力から運用リスクへ

同社の提案は、企業がエンタープライズAIをどう評価しているかの変化を反映している。ベンチマークで良い結果を出すエージェントでも、機密情報を漏らしたり、悪意ある指示に従ったり、権限外の行動を取ったりできるなら、金融、医療、政府、カスタマーサービスの業務フローには適さないかもしれない。

Kvist氏はTechCrunchに対し、多くの組織はもはやAIモデルの能力不足だけを理由に導入をためらっているわけではないと語った。むしろ、システムが顧客や規制当局に対して約束した範囲内で振る舞うことの保証が必要なのだという。AIUCのアプローチは、ベンダー内部のテストだけに頼るのではなく、導入前にレビューできる証拠を提供することを意図している。

同社は顧客としてCursor、Lovable、Harvey、ElevenLabsを挙げている。ただし、出典には、これらの関係の範囲、どの製品が評価されたのか、あるいは各社がAIUC-1認証を完了したかどうかの詳細はない。したがって、これらの採用シグナルは、独立に検証された顧客結果ではなく、会社による申告として扱うべきだ。

また、社名に「underwriting」が入っているにもかかわらず、AIUCのビジネスモデルは従来の保険とは異なる。示されている内容は、AIシステムによる損失を補償するものではなく、テストと認証のサービスである。当面の製品は、調達と導入の意思決定を支える評価レイヤーだ。

METR型評価との比較

Dattani氏のMETRでの経歴は、AIUCをAI評価の確立した分野と結びつけている。METRはフロンティアAIラボと協力し、エージェントがタスクを確実に完了できるかを測定してきた。その研究は、OpenAIのHugging Face incidentに関連する作業を含め、モデル挙動の調査にも使われてきた。

AIUCは、自社の焦点はより広く、より企業向けだと述べている。タスク性能に主眼を置くのではなく、AIUC-1のプロセスは、エージェントが実際の業務データ、ツール、ユーザーとやり取りする際に発生しうるセキュリティおよび信頼性の失敗を調べるよう設計されている。

この違いは購入者にとって重要だ。制御された評価ではタスクを成功させても、本番環境では厳格な権限、監視、人間の承認、あるいは制限された運用環境が必要になるシステムはあり得る。独立テストは調達担当者がシステムを比較する助けになるかもしれないが、認証によって、モデル更新、ツール変更、新しい攻撃手法の後でもエージェントの安全性が保証されるわけではない。

外部評価というより広い考え方も、フロンティアモデル企業の間で注目を集めている。AnthropicのCEOであるDario Amodei氏は、フロンティア開発ではより慎重であるべきだと述べ、独立評価者がAIラボでの安全性作業を観察・検証できる可能性を示唆した。AIUCは顧客拠点に評価者を常駐させることを提案しているわけではないが、創業者らは関連する原則を追求している。つまり、強力なシステムを信頼する前に、組織は独立した証拠にアクセスできるべきだということだ。

主張が示していること、そしてまだ証明されていないこと

調達資金はTechCrunchが報じた確定したビジネスイベントであり、AIUCの創業者、AIUC-1標準、同社が説明するテストプロセスも同様だ。報じられた顧客名、コンソーシアムの規模、テスト数、レポートの長さは、インタビューを通じたAIUC自身の開示に基づくものであり、会社の主張として理解されるべきだ。

AIUC-1が本番インシデントをどの程度予測できるのか、異なる評価者が同じエージェントをどれほど一貫して採点するのか、企業がこの認証を調達要件として扱うのかについては、まだ十分な証拠がない。出典はまた、公開監査結果、失敗率、修復結果、価格、あるいはエージェントが合格するテストの割合も示していない。

これらの欠落は重要だ。セキュリティ認証が有用になるのは、購入者がその範囲を理解し、評価が時間をかけて再現可能である場合だ。AIエージェントは、モデル更新、ツール統合、プロンプト変更、あるいはアクセス可能なデータの変化によって挙動が変わることがある。そのため、一度きりのレポートよりも、導入統制に結びついた継続的な評価の方が価値が高い場合がある。

今後注目すべき点

まず注目すべきは、AIUCが完了したAIUC-1評価の詳細を公開するかどうかだ。方法論、採点基準、テスト中に発見された失敗例などが含まれる。購入者はまた、同社がモデル更新をどう扱うのか、エージェントのツールや権限が変わった場合に認証の更新が必要かどうかも知りたいはずだ。

もう一つの重要なシグナルは、独立した検証だ。AIUCに関係のない企業顧客、セキュリティ研究者、監査人からの証拠があれば、テストが合成的な失敗だけでなく現実世界のリスクを識別しているかどうかを示す助けになる。

市場はまた、AIUCのアプローチが調達の一部になるかどうかも明らかにするだろう。大手銀行、病院、政府機関、主要ソフトウェアプラットフォームで採用されれば、第三者によるエージェント評価が標準的な統制になりつつあることを示す。一方で、企業が有意義な結果を公開せずに認証をマーケティング用のバッジとして使うだけなら、その価値は構築側・購入側双方にとって限定的なままだ。

Creati.aiの視点

AIUCは、エンタープライズAIにおける現実的なボトルネックに取り組んでいる。つまり、組織はエージェントがどこで自律的に行動でき、どこで制限が必要かを、防御可能な形で判断する方法を必要としている。構造化された外部評価は、モデルの安全性や一般的な能力に関する大まかな主張よりも、その判断を具体的にできるかもしれない。

しかし、認証は証拠として扱うべきであり、保護策を外してよいという許可ではない。この市場の最も強い形は、独立テストに加えて、ライブ監視、最小権限アクセス、人間へのエスカレーション、そして重大なシステム変更後の再評価を組み合わせるものになるだろう。AIUCの資金調達は、そのモデルが発展する余地を与える。その信頼性は、レポートが実際に導入判断を改善することを示せるかどうかにかかっている。

広告