
AnthropicはAIエージェントについて重要なセキュリティ上の主張を行っている。The DecoderがAnthropicのsystem cardを引用して報じたところによると、同社のAuto Modeと組み合わせたClaude Opus 5は、129のテストシナリオにおけるブラウザベースのプロンプトインジェクション攻撃の成功率を0%にまで下げたという。この結果がAnthropic自身の評価環境を超えて再現されるなら、エージェントセキュリティにおける最も難しい問題の一つに対する注目すべき進展となる。
このニュースが重要なのは、プロンプトインジェクションが、Webを閲覧し、文書を読み、ユーザーの代わりに行動するAIエージェントの展開における中核的な障害になっているからだ。こうした攻撃では、悪意ある指示がウェブページやその他の外部コンテンツに埋め込まれ、モデルは開発者やユーザーの意図ではなく攻撃者の指示に従ってしまう。The Decoderが引用した12月の発言で、OpenAIは、プロンプトインジェクションは完全には解決できないかもしれないと述べた。そうした背景の中で、Anthropicの報告結果は、単なるモデル更新というよりも、多層防御によってブラウザ自動化を実用的に安全化できるかどうかの試金石として際立っている。
The DecoderによるAnthropicのsystem cardの報告によれば、ブラウザ攻撃の成功率0%は、Claude Opus 5 を Auto Mode とともに Claude Cowork のような Anthropic 製品で使用した際に記録された。報告された評価は129のブラウザエージェントのテストシナリオを対象としていた。
モデル単体と製品全体の構成を区別することが、この話の核心だ。The Decoder は、Claude Opus 5 単体ではゼロには達していなかったと報じている。Auto Mode の追加保護層がなければ、ブラウザのプロンプトインジェクションは3.7%の確率で成功していたという。同じ報告では、より限定的な指標では Sonnet 5 が Opus 5 を上回り、成功率は0.93%だったとされる。つまり Anthropic は、ベースモデル単体で問題を解決したとは主張していない。より強い主張は、モデルと実行時の सुरक्षा対策の組み合わせがそれを実現したというものだ。
これは、購入者や開発者がこの発表をどう読むべきかに関わる。AIエージェントのセキュリティは、ますますモデルの問題ではなくシステムの問題になっている。ブラウザエージェントは、信頼できないコンテンツ、複数段階のタスク、そして行動権限に直面する。モデルが悪意あるテキストを無視する能力に優れていても、周囲の製品が危険なコマンドを簡単に実行してしまえば、システムは依然として脆弱なままだ。
プロンプトインジェクションはしばしば、LLM版の信頼できない入力攻撃に例えられるが、ブラウザエージェントはこの問題をさらに悪化させる。なぜなら、ライブのWebページ上で動作し、任意のテキスト、隠し要素、あるいはモデルを操作するために作られた指示を含み得るからだ。エージェントがクリック、コピー、フォーム送信、コネクタへのアクセス、機密データの取り扱いを行えるなら、成功したプロンプトインジェクションは単なる誤答以上のものになる。データ漏えいや望ましくない操作につながり得る。
だからこそ、この結果が再現可能であれば、エンタープライズAIやAIエージェント全般にとって広い意味を持つ。魅力的な自動化の多くは、SaaSツール、社内ポータル、サポートコンソール、公開Webサイトをナビゲートすることを含む。そうした環境こそ、隠された、あるいは敵対的な指示が現れうる場所だ。
The Decoderは、ブラウザベースのプロンプトインジェクションをAIエージェントにのしかかる最大のセキュリティ欠陥と位置づけており、その評価は現在の市場の懸念を反映している。エージェント製品を構築する創業者や、それを評価する企業セキュリティチームは、自律的なブラウザ動作を慎重に扱わざるを得なかった。問題は、モデルが役に立つかどうかではなく、敵対的コンテンツの周囲で信頼できるかどうかだった。
報告された成功率0%の結果はAuto Modeに依存していた。The Decoderによれば、Auto Mode は Claude Opus 5 の上に2つの独立した防御を追加する。1つ目の層は、モデルが処理する前に入力コンテンツをスキャンして隠れた指示を探す。2つ目の層は、実行前に危険な行動をブロックする。説明されている通り、攻撃者はそれぞれの防御を別々に突破しなければならない。
このアーキテクチャが重要なのは、セキュリティチームが高影響の脅威を軽減する一般的な方法と一致しているからだ。すなわち、リスクのある入力を隔離し、疑わしいコンテンツを分類し、実行を制御する。実際には、Anthropicはプロンプトインジェクションを純粋な推論失敗というより、エンドツーエンドの製品セキュリティ問題として扱っているように見える。
開発者にとって、そこには即時の含意がある。ブラウザ自動化を提供するチームは、より強力なフロンティアモデルだけで十分だとは考えるべきではない。前処理フィルタ、ポリシーエンジン、アクション承認レイヤー、ワークフロー周辺のより厳格なサンドボックス化が必要になるかもしれない。Anthropicの報告結果は、防御スタックが単体のモデルを大きく上回り得ることを示唆している。
Claude Cowork への言及は、Anthropic がこれを商業的にどこで重要視しているかも示唆している。特にブラウザ内でナレッジワーカーの代わりに動く製品には、ベンチマーク上の知能以上のものが必要だ。ランダムなWebページの隠しテキストにシステムが従わないと企業が信じられるような制御が必要なのだ。
ここで最も強い主張はベンダーに紐づいたものであり、そのように読むべきだ。The Decoderは主要な数値をAnthropic自身のsystem cardに帰属させている。129のブラウザエージェントシナリオでの成功率0%は、したがって第三者による独立認証ではなく、ベンダー報告の評価結果だ。
The Decoderはまた、セキュリティ企業Gray Swanによる別の一般的なプロンプトインジェクションテストにも言及している。そのテストでは、15回の攻撃試行の後、報告された成功率は Opus 4.8 の5.5%から Claude Opus 5 の2.0%へ低下した。この Gray Swan の数値は、ブラウザエージェント固有の設定を超えた改善の兆候を示すため有用だが、依然として単一のベンチマークにすぎず、堅牢性の包括的な証明ではない。
同様に重要なのは、記事の細部がより広い結論を制限していることだ。報告されたゼロの成功率は、Auto Mode が有効なブラウザエージェントに適用されるもので、Claude Opus 5 のすべての利用に当てはまるわけではない。これらの保護がなければ、The Decoderによると攻撃成功率は3.7%だった。これは多くの観察者が予想するよりはるかに良いが、ゼロではない。また、モデル間の比較は見出しが示すより複雑だということでもある。見出しは Opus 5 に焦点を当てているが、Auto Mode なしのブラウザ指標では Sonnet 5 が Opus 5 より良かったと報じられている。
欠けているのは外部検証だ。ソース資料には、オープンなレッドチーム環境、顧客導入環境、長時間の実地ブラウジングセッションでの独立した再現結果は示されていない。また、129シナリオの具体的な構成、攻撃の多様性、成功の定義が狭いのか広いのかも明記されていない。これらのギャップは結果を無効にするものではないが、購入者はそれを確定した事実ではなく有望な証拠として扱うべきだということを意味する。
コード支援ツール、業務自動化ツール、社内AIエージェントを構築するチームにとっての実践的な教訓は、導入アーキテクチャがモデル選択と同じくらい重要になり得るということだ。Anthropicの報告数値は、モデルをコンテンツ検査とアクションのゲーティングで包むことで、ブラウザタスクでの悪用成功率を大幅に下げられることを示唆している。
これはエンタープライズAIの購入者にとっても調達上の意味を持つ。ブラウザベースのエージェントを販売するベンダーは、どのLLMを使っているかだけでなく、Webページをどう検査し、system prompt をどう隔離し、ツールをどう制限し、危険な操作をどうブロックするのかを説明する必要がますます高まる。Claude Opus 5、Sonnet 5、あるいはOpenAIの競合モデルを比較する購入者には、ベンチマークの図表だけでなく、製品レベルのセキュリティ回答が必要になる。
競争の軸も変わる。Anthropic が Claude Opus 5 と Auto Mode の耐性を、より広範な独立テストで示せれば、それは信頼性と封じ込めが派手なデモより重要な、機密性の高いエンタープライズAI導入での訴求を強める可能性がある。AIエージェント市場は「タスクを完了できるか?」から、「雑多で敵対的な入力でも安全にタスクを完了できるか?」へ移行しつつある。
次に注目すべきシグナルは独立テストだ。Gray Swan 以外のセキュリティ企業が、実際のブラウザ条件下で Claude Opus 5、Auto Mode、Claude Cowork を再現可能な形で評価すれば、単一のベンダー system card より多くを語るだろう。
2つ目のシグナルは製品範囲だ。Anthropicの報告結果はブラウザエージェントのシナリオに関するものだ。購入者は、同様の防御が文書取り込み、メール、API接続ツール、マルチエージェントワークフローへ拡張されるかを注視すべきだ。そこではプロンプトインジェクションが別の経路で入り込む可能性がある。
3つ目に、競合が直接反応するかを追う価値がある。OpenAI はプロンプトインジェクション問題の深刻さを公に認めており、他のエージェントプラットフォームも同じ圧力にさらされている。Anthropicのアプローチが持続可能だと証明されれば、多層防御はAIエージェントの差別化要素ではなく、基本要件になるかもしれない。
最後に最も重要なのは、Anthropic がテスト設計についてより詳しく共有するかどうかだ。攻撃分類、失敗の定義、フィルタの誤検知、Auto Mode の使い勝手上のトレードオフなどだ。攻撃をブロックできても、自動化を遅くしたり過度に制限したりする安全対策は、商業的には導入が難しいままである。
この話で最も興味深いのは、見出しの数字ではなく、その背後にあるアーキテクチャだ。Anthropic は、AIエージェント向けのプロンプトインジェクション防御が、純粋なモデル層では未解決であっても、製品層の дисциплина として実現可能だと示しているように見える。これは市場にとってより現実的な道だ。企業はブラウザ自動化のために裸のモデルを買うのではなく、システムを買う。
それでも、これはまだ解決済みの問題ではない。ここで利用できる証拠は限られており、最も強い結果はAnthropic自身のものだ。しかし、AIエージェントやエンタープライズAIプラットフォームを構築する開発者にとって、結論は明確だ。プロンプトインジェクションを抽象的な研究課題として扱うのはやめ、重層的な制御、監視されたアクション、明示的な信頼境界を前提に設計し始めるべきだ。Claude Opus 5 と Auto Mode が外部の精査に耐えれば、それは安全なブラウザ自動化が実験的に危険なものではなく、運用上もっともらしいものへと変わる転換点になるかもしれない。
Anthropicは、Claude Opus 5 と Auto Mode が社内テストでブラウザのプロンプトインジェクション成功率をゼロにしたと述べており、AIエージェントにとって注目すべき主張です。