Andreessen Horowitzが支援するValsは、企業や連邦機関向けに機密性の高いタスクベースのAIベンチマークを構築するため、4,000万ドルを調達した。古いテストはすでに…

AIベンチマークのスタートアップValsは、Andreessen Horowitz主導の4,000万ドルのシリーズAを調達した後、モデル評価をAI市場のより実用的で信頼できる層へと変えようとしている。同社は、特に企業が事前にテスト素材を見ることができる場合、既存の多くのテストでは、ますます高性能になるモデルを判断するにはもはや不十分だと主張している。
Valsは、一般知識を問う公開試験だけに頼るのではなく、複雑で分野特化型のタスクでAIシステムを評価する。そのアプローチは、モデル開発者が弱点を特定するのを助け、購入者が実際の業務に使うシステムを比較するのを助け、規制当局や投資家に性能とリスクについてより有意義な証拠を提供することを目的としている。
2024年に設立されたValsは、共同創業者兼CEOのRayan Krishnanが、学術ベンチマークが新しいモデル能力に追いつくのに苦労していると気づいたことをきっかけに生まれた。TechCrunchが報じたコメントで、Krishnanは、業界が従来の評価システムが測定できるより速いペースで高性能モデルをリリースしていると述べた。
同社のテストは、法律、金融、コーディングなどの分野における専門的な作業に似せることを意図している。モデルが難しい質問に答えられるかどうかだけでなく、Valsは、そのシステムが特定分野において人間の出力と同等の品質の仕事を生み出せるかどうかを検証すると説明している。
注目すべき特徴として、Valsはテストで使用する具体的な素材を公開していない。同社の考え方は、完全に公開されたベンチマークは最適化や学習の標的になり得るというものだ。モデルはテストでは良くなったように見えても、より広範で未見の作業では同等の改善を示さないかもしれない。
Valsはまた、評価では成功したタスク完了だけでなく、有害または望ましくない結果も考慮すると述べている。報告されている関心領域には、サイバーセキュリティ、バイオセキュリティ、メンタルヘルス、再帰的自己改善、そして武力紛争法が含まれる。提供された証拠には、これら各プログラムの方法論、採点システム、独立した検証は詳述されていない。
シリーズAに先立ち、8VCとBloomberg Betaが主導したシードラウンドがあった。TechCrunchによると、Valsの最新資金調達は2026年9月の記事の前月に完了し、同社のチームは年初の8人から25人に増えたという。
これらの成長数字や、売上が前年の8倍になったという同社の主張はKrishnanを通じて報告されたものであり、独立監査済みの証拠ではなく、会社が報告した指標として扱うべきである。利用可能なソース資料には、Valsの顧客、総売上、テスト件数、評価したモデルの数は示されていない。
同社は、AI開発者にモデル評価の料金を請求することで収益を上げている。それは、試験の費用を支払う当事者が、そのシステムを評価される当事者でもあるという、潜在的には有用だが慎重さを要する関係を生む。Valsはこのサービスを開発・品質管理ツールとして位置づけ、改善が必要な箇所を明らかにする標準化試験に対価を払うのに似ていると説明している。
同社はまた、連邦機関向けにモデル評価を提供するプログラムも開始した。ソース資料には、どの機関が参加しているのか、あるいはそのプログラムが公開結果を生み出したのかは記されていない。
AI開発者にとって、評価の価値はそれがテスト環境外での性能を予測できるかどうかにかかっている。公開ベンチマークは説明しやすいが、モデルがその質問に合わせて調整されていたり、テストが実際の業務フローではなく抽象的な知識を測っていたりすると、実用性は低くなるかもしれない。
Valsのタスクベースのモデルは、法務レビュー、財務分析、ソフトウェア開発、その他の業務タスク向けにシステムを選ぶエンタープライズAIの購入者にとって、より関連性が高い可能性がある。購入者が気にするのは、一般的なランキングでの順位よりも、定義されたワークフローを正確かつ一貫して、許容可能な失敗モードで完了できるかどうかかもしれない。
それは評価の品質を、単なるマーケティングではなく導入の問題にする。製品チームは、モデルがどこで壊れるのか、どれくらいの頻度で人手介入を必要とするのか、見かけ上優れた結果の裏に安全性や信頼性の問題が隠れていないかを知る必要がある。機密テストはベンチマークのゲーム化を減らせるかもしれないが、外部からの検証は難しくなる。購入者は、テストの答え自体を受け取らずに、スコアの意味を理解できるだけの方法論的透明性を必要とする。
AIシステムが業務プロセスに組み込まれるにつれて、商業的な利害はさらに大きくなる可能性がある。モデル評価が調達、公開提出、投資判断、規制審査に影響を与え始めると、それらを作成する組織は、独立性、再現性、利益相反への耐性を示す圧力にさらされる。
Valsの主張は、主に同社が特定した問題と、同社が示すアプローチに基づいている。TechCrunchは、古いベンチマークが現代のモデルに追いついていない市場についてのKrishnanの説明を報じたが、ソースは、Valsのテストが競合システムよりも予測性が高い、あるいはゲーム化しにくいことを示す比較結果は提供していない。
また、入手可能な報道には、Valsが業界で好まれる評価者になったという独立した証拠もない。Andreessen Horowitzや以前の支援者からの資金調達は投資家の信頼の表れであり、ベンチマークの正確性や市場採用の証明ではない。同様に、報告された売上成長や連邦機関向け評価への拡大は、同社が主張する勢いを示しているが、幅広い顧客受容を証明するものではない。
Valsはまた、モデル開発者、研究所、公開ベンチマークコミュニティ、専門テスト企業、社内評価チームとの競争にも直面する。一部の組織は透明な公開テストを好むかもしれず、他方では自社のデータやワークフローを反映したプライベート評価に対価を払うかもしれない。同社の課題は、管理されたプロセスが、社内テストや既存の評価プラットフォームでは得られない洞察を顧客に提供できることを示すことだ。
最も明確なシグナルは、Valsがどのようにモデルを採点するのか、そしてそのスコアが本番環境の性能と相関するのかを示す公開証拠だろう。購入者は、方法論の開示、再現性研究、一貫した条件下で行われたモデル比較、そして評価が導入や調達の意思決定を変えた例に注目すべきだ。
連邦機関向けプログラムも重要な試金石だ。参加機関の名指し、公開された知見、正式な調達関係があれば、単なる発表よりも強い証拠になる。同社の採用計画やオフィス拡張は継続的な商業活動を示すかもしれないが、従業員数よりも顧客維持率と継続的な評価件数のほうが重要になるだろう。
市場はまた、Valsがブラックボックス化せずに機密性を保てるかどうかも注視すべきだ。安全性、能力、投資価値に関する主張にその評価が影響するなら、独立した監督と明確な採点説明が信頼性の中心になる。
Valsは、まさに有用なタイミングで市場に参入している。AI企業は人々が実際に行う仕事を反映した評価をますます必要としており、購入者は信頼できる導入につながらないランキング上の上昇にますます懐疑的になっている。隠されたテストと分野特化型タスクへの焦点は、公開ベンチマークの実際の弱点に対処している。
しかし、信頼される標準になるには、ベンチャー資金と急成長だけでは足りない。Valsは、プライベート評価が厳格で、再現可能で、顧客や外部の人がその意味を判断できる程度に透明であることを示す必要がある。同社の次の段階は、ベンチマークのカタログの野心よりも、その結果がどのAIモデルを構築し、購入し、展開するかという意思決定を確実に改善できるかどうかで決まるだろう。