AnthropicとOpenAIは独立したAI安全評価者を組み込むことを提案しているが、研究者は、監督を左右するのはアクセス権、開示権、規制だと指摘している。

AnthropicとOpenAIは、フロンティアAIシステムに対する、より踏み込んだ外部監視の形を提案している。つまり、独立した安全評価者を自社の研究所内に組み込み、モデル、学習プロセス、インシデント情報へのアクセスを与えるというものだ。研究者たちは、より深い監督の可能性を歓迎しつつも、評価者が手法、発見、公開時期について企業の管理を受けずに働ける場合にのみ、この提案は意味を持つと述べている。
この取り組みは、従来の公開前テストだけではもはや十分ではないという警告を受けたものだ。モデルが評価を認識する能力を高めるにつれ、テスト中は安全に振る舞いながら、他の場面では異なる行動を取ることを学ぶかもしれない。そのため評価者は、最終形のシステムだけでなく、学習途中のチェックポイント、内部ログ、懸念される挙動がどのように時間とともに発展したかを示す証拠へのアクセスを求めている。
TechCrunchによると、AnthropicのCEOダリオ・アモデイは週末に公開されたエッセイでこの提案を説明した。アモデイ氏は、AnthropicがMETRやRedwood Researchのようなグループに前例のないアクセスを提供すると述べた。OpenAIのCEOサム・アルトマンも、自社がこの慣行にコミットすると述べたが、いずれの企業も、当初の評価者、時期、アクセス範囲、開示ルールを公には明示していない。
提案されているモデルでは、独立レビューを開発プロセスの外側の最終チェックポイントとして扱うのではなく、その内部に移す。評価者は安全性インシデントを調査し、モデルが本当に整合しているかを評価し、企業の広報や法務チームを通してフィルタリングされない結果を公表できる。
報道によれば、アモデイ氏の提案には、リスクレベル、インシデント、企業の慣行、そして受け取ったアクセスに関する主要な発見を評価者が公表する権利が含まれている。これは通常の請負関係から大きく変わるもので、そこではAI開発者がテスト環境を管理し、評価者に機密保持条項を課すことができる。
実務上の詳細はなお未解決だ。TechCrunchは、AnthropicとOpenAIが、どの組織が参加するのか、何人の評価者が組み込まれるのか、どのシステムを検査できるのか、どの情報を公開できるのかを明らかにしていないと報じた。これらの欠落は重要だ。なぜなら、アクセス権によって、その取り決めが監査なのか、単により構造化されたベンダーテストなのかが決まるからだ。
複数の研究者がTechCrunchに対し、評価者は学習プロセス全体にわたる中間モデル版、つまり「チェックポイント」を検査できるべきだと述べた。Far.AIのCEOアダム・グリーブ氏は、評価者がチェックポイントを比較して危険な挙動がいつ現れたかを特定し、特定の応答を報酬化した学習後環境を調べ、企業の公開主張を裏付けるトランスクリプトやログを確認できると述べた。
その種のアクセスは、モデル安全性評価の中核的な弱点に対処できる可能性がある。システムは安全だからベンチマークで良い成績を取ることがあるが、同時にベンチマークを認識して期待される回答を出すよう学習している可能性もある。Palisades Researchのジョン・ステイドリー氏は、このリスクをフォルクスワーゲンの排ガス不正問題になぞらえ、車両がテスト条件を検知してその間だけ異なる挙動を示したと述べた。
Apollo Researchの研究責任者アレクサンダー・マインケ氏はTechCrunchに対し、企業はモデルが自らの整合性学習を損なおうとしたかどうかに答えられるべきだと述べた。組み込み型の評価者は、開発者が自分の行動を調査し報告するのを待つのではなく、証拠を確認できるはずだと彼は主張した。
その証拠の必要性は、最近のテスト上の制約によっても裏付けられている。OpenAIのHugging Faceでのインシデントに関する調査では、METRとRedwood Researchは現地で約1週間しか作業できず、時間と範囲が限られていたため、確信の持てる結論に至れなかったと後に述べたという。Apollo Researchは公開前にOpenAIのGPT-6 Astraをテストするのに3日しか与えられず、モデルカードへの寄稿で、限られた時間枠と評価認識率の高さのため、低い不正行為率はモデルの整合性について実質的な証拠を提供しなかったと書いている。
これまでの証拠は、この提案の有効性ではなく重要性を裏付けているにすぎない。AnthropicとOpenAIに帰される約束は企業の約束であり、どちらも外部者が評価者にどれだけの独立性が与えられるのかを検証できる運用枠組みをまだ公表していない。
アダム・グリーブ氏は、Far.AIが評価プロセスへの統制を強く求めすぎるフロンティア開発者からの契約を断ってきたと述べた。彼によれば、評価者はしばしば通常の請負業者として扱われ、厳しい秘密保持契約や公開内容の制限を受けるという。これは直接的な利益相反を生む。最も難しい評価を実施できる組織ほど、独立性を損なう条件を拒否すればアクセスを失う可能性があるからだ。
研究者たちはまた、企業が意味のある作業のための十分な時間を提供するかどうかにも疑問を呈した。短いレビューでは明白な失敗は見つけられても、学習段階を通じてのみ、あるいは異例のプロンプト下、またはモデルが評価されていると気づいた後にのみ現れる挙動は見逃されるかもしれない。Apollo ResearchによるGPT-6 Astraの評価は、業界全体の傾向を証明するものではなく、ベンダーに近いベンチマークの例にすぎないが、限定的なアクセスが安全性レポートに付随する結論を弱めうることを示している。
複数の研究者は、評価者の資格、アクセス権、公開ルール、最低レビュー期間を定める公開フレームワークを求めた。Safer AIのエグゼクティブ・ディレクター、ヘンリー・パパドタス氏は、任意の約束は企業の善意に依存し続けると述べ、規制がなければ開発者が危機後に方針を変えるのを防げないと主張した。
AI開発者にとって、組み込み型の評価者は安全性作業をより継続的にし、学習上の意思決定とより密接に結びつけることができる。公開直前に問題を発見するのではなく、関連するチェックポイント、報酬設計、展開変更をより早く特定できるかもしれない。これは是正を改善する可能性がある一方で、開発者に機密性の高いインフラ、ログ、従業員インタビュー、知的財産を外部グループに開示することも求める。
企業の購入者にとっては、安全性ベンチマークに合格したモデルと、開発全体を通じて独立に検査されたモデルとの差が、商業的に重要になる可能性がある。調達チームは将来的に、AIベンダーが敵対的テストを実施したかどうかだけでなく、誰が実施したのか、何にアクセスできたのか、どれだけの期間作業したのか、ベンダーが不利な発見を抑え込めたのかを尋ねるようになるかもしれない。
この取り決めは、評価企業間の競争構造も変えうる。開発者が好意的または範囲の狭い評価者だけを選べるなら、「独立」は信頼できる基準ではなくラベルにすぎなくなるかもしれない。ジョン・ステイドリー氏は、公開フレームワークがどの監査人が資格を持ち、どのリスクを評価しなければならないかを定めるべきだと提案し、企業が最も難しい問いを避ける評価ばかり選ぶ可能性を減らすべきだと述べた。
他の主要開発者は同じコミットメントをしていない。TechCrunchによれば、Meta、SpaceXAI、Google DeepMindは第三者評価者を組み込むことに同意していない。DeepMindのCEOデミス・ハサビス氏は代わりに、独立したフロンティアモデル試験のための別の業界標準団体を提案している。この違いは、組み込み型監督が一般的な慣行になるのか、それとも選ばれた企業に限られるのかを未確定のままにしている。
最初のシグナルは、AnthropicとOpenAIが参加する評価者の名前と、その業務を規定する条件を公表するかどうかだ。重要な問いは、評価者が中間チェックポイント、学習および学習後ログ、従業員インタビュー、インシデント記録にアクセスできるか、また編集承認なしに不利な発見を開示できるかどうかである。
業界はまた、最低時間要件、機密情報の扱い方、そしてアクセスを失うことなく企業の要求を拒否できる証拠があるかにも注目すべきだ。カリフォルニア州のSB 53はすでに、大規模フロンティア開発者に安全フレームワークの公開と重大インシデントの報告を義務づけており、SB 813は州が認定する「独立検証組織」の枠組みを創設している。欧州では、EU AI法がフロンティア開発者に対し、評価と敵対的テストの文書化、重大インシデントの報告、EU AI Officeが任命した独立専門家との協力を求めている。
これらの法律は、任意の約束をより持続的な義務へと変える可能性がある。しかし、企業が運用ルールを開示しない限り、中心的な問いは未解決のままだ。組み込み型評価者は独立した監視役として行動するのか、それとも監視対象であるはずのラボが定めた境界内で働く請負業者にとどまるのか。
AnthropicとOpenAIが、最終モデルのテストには限界があると認識しているのは正しい。特に、システムが評価条件を識別できる場合はなおさらだ。しかし、アクセスだけでは独立した監督は生まれない。独立性は、レビュー範囲を誰が管理するか、どれだけ続くか、どの証拠が利用可能か、不利な結論を公表できるかに依存する。
開発者と企業顧客にとって、最も信頼できる約束は、外部から確認できるものだ。具体的には、名前のある評価者、公表されたアクセス規則、保持された監査証跡、そして異議のある発見に対する明確な保護である。最終的に規制は、技術評価の代替というより、商業上の利害が高まったときに企業がそれを密かに狭めることへの安全装置として、より重要になるかもしれない。