MIT Technology Review Insightsの調査によると、企業向けAIエージェントはコンテキスト不足で停滞しており、企業はナレッジレイヤー、検索、グラフへと向かっている。

MIT Technology Review Insightsによると、多くの企業向けAIエージェントは、データを解釈し信頼性のある行動を取るために必要な組織的コンテキストが不足しているため、パイロット段階を越えられずにいる。データ、AI、テクノロジー分野の幹部300人を対象とした調査に基づく新たなレポートでは、エージェント型AIプロジェクトが本番環境に到達する割合は、平均で約34%にすぎないことが分かった。
この結果が示すのは、より多くの文書や、より大規模な言語モデルへのアクセス以上に深い問題である。エージェントは、特定の企業内で情報が何を意味するのか、出来事同士がどのように関係しているのか、そして意思決定を規定する手順は何かを理解する必要がある。そのコンテキストがなければ、組織は動作するデモを持てても、本番業務を任せられると判断できるシステムを持てない可能性がある。
レポートは企業知識を、3つの大きな能力に分けている。データの意味と関係を示す意味知識、関連する過去の出来事を記録するエピソード記憶、そして業務をどのように実行すべきかを捉える手続き知識である。
MIT Technology Review Insightsは、これらの領域でより強い能力を持つ組織ほど、エージェントプロジェクトを前進させる可能性が高いと報告している。同社が本番化のリーダーと位置付けるグループでは、エージェント型AIプロジェクトの平均61%がパイロット段階を超えた。調査対象組織全体の平均はおよそ3分の1だった。
このレポートは、より優れた知識能力が高い本番化率を直接引き起こすとは立証していない。両者の間に密接な関係があることを示しているにとどまる。この区別は重要だ。調査は、導入済みシステムの独立監査ではなく、経営幹部の回答に基づいているからである。
また、調査では、エージェントが組織知識へアクセスする範囲を拡大する際の障害として、データの分断が最も頻繁に挙げられた。回答者の55%がこれを指摘した。接続されていないアプリケーションや一貫性のないデータ構造によって、エージェントが顧客、プロセス、リスク、またはビジネス上の出来事を完全に把握することが難しくなる。
本番化のリーダーでは、セキュリティとプライバシーへの懸念がより目立ち、72%がこれを挙げた。これは、導入をより大きく進めている組織ほど、エージェントが機密情報へ広範にアクセスすることで生じるガバナンス上の問題に直面している可能性を示している。
従来型の検索システムは、文書が企業の運用ルールにどう適合するかを理解しなくても、関連文書を返すことができる。行動方針の提案やワークフローの実行を期待されるエージェントには、それ以上の能力が必要だ。信頼できる情報源を特定し、矛盾する記録を突き合わせ、何がすでに起きたかを記憶し、承認済みの手順に従わなければならない。
これが、レポートがデータと知識を区別する理由である。データは、口座が支払いを滞納していることや、部品の在庫がないことを示せる。知識があれば、その口座に特別契約が適用されるか、在庫記録が最新か、その状況で組織が許可している対応は何かをエージェントが判断できる。
このコンテキストの問題は、実務ワークフローにおけるAIエージェントの信頼性に影響する。分断されたシステムに接続されたエージェントは、別のアプリケーションに保存された例外を見落としながら、もっともらしい回答を生成する可能性がある。カスタマーサポート、財務、調達、オペレーションの現場では、その失敗は単に回答できない場合よりも大きな損害になり得る。
レポートの調査結果は、検索拡張生成だけでは、すべての導入問題を解決できない可能性がある理由も説明している。検索によってモデルに提供される情報は改善できるが、組織には依然として、情報源の品質、アクセス権限、データ間の関係、そしてエージェントが実行を許可されるアクションの順序に関するルールが必要である。
調査対象の幹部は、エージェントの意思決定品質を最も大きく改善するには、企業データとAIシステムの構造的な接続を強化することが重要だと考えている。レポートはこれをナレッジレイヤーと表現する。これは、孤立したデータストアではなく、利用可能でコンテキスト化された情報へのアクセスをエージェントに提供する組織基盤である。
レポートが挙げる投資優先事項には、取り込みパイプライン、AI対応API、検索拡張生成、評価エージェント、ナレッジグラフが含まれる。これらの技術は問題の異なる部分に対応する。パイプラインは情報を利用可能な形に整え、APIはデータや業務機能を一貫した方法で公開し、ナレッジグラフは非構造化テキストだけでは推測しにくい関係を表現できる。
レポートはこれらを組織上の優先事項と専門家の推奨として示しており、どの企業にも単一のアーキテクチャが有効だと証明しているわけではない。例えばナレッジグラフは、エンティティや依存関係のマッピングに役立つ一方、定義や関係を継続的に管理する責任も必要とする。同様に、AI対応APIはアクセスを改善できるが、不完全または不十分に管理されたソースデータにエージェントをさらす可能性は残る。
開発者にとっての意味は、エージェント開発にデータエンジニアリング、メタデータ管理、アクセス制御、ワークフロー設計がますます含まれるということだ。モデルは依然として重要だが、本番システムの構成要素の1つにすぎない。
AIエージェントを評価するプロダクトチームは、エージェントが台本化されたデモを完了できるかどうかだけでなく、より多くの点を測定すべきである。正しい情報源を選ぶか、矛盾する記録を処理できるか、権限を尊重するか、関連する出来事を記憶するか、なぜ特定の行動を取ったのかを説明できるかをテストする必要がある。
評価エージェントは、このプロセスで有用になる可能性がある。特に、企業ポリシーや期待される結果に照らして大量の意思決定をテストする場合に役立つだろう。ただし、自動評価は影響の大きいワークフローに対する人間のレビューを補完するものであり、置き換えるものではない。原資料は、こうした評価システムの精度や成熟度について詳細な証拠を示していない。
企業の購入者は、データの分断をバックオフィスの不便さではなく、導入上の制約として扱うべきでもある。エージェントをより多くのシステムに接続すれば到達範囲は広がるが、同時に障害点の数や、プライバシーインシデントが起きた場合の影響範囲も拡大する。生産化リーダーがセキュリティを重視していることは、導入を成功させるには、能力の向上とともにアクセス方針と監査可能性も成熟させる必要があることを示唆している。
創業者やプラットフォームベンダーにとって、市場からのシグナルは、需要が単独のエージェントインターフェースから、企業知識を利用可能にするインフラへ移る可能性があるということだ。検索、権限、記憶、評価、ワークフロー実行を統合する製品は、信頼できる組織コンテキストなしに自律性を約束するシステムよりも、購入者が直面する差し迫った問題に対応できる可能性がある。
次に重要なシグナルは、ナレッジレイヤーへの投資後に企業が本番化率の向上を報告するかどうか、そしてその改善が規制産業やデータ集約型産業全体で維持されるかどうかである。購入者は、パイロット数や導入に関する幅広い主張ではなく、独立して検証可能な導入実績を探すべきだ。
また、ベンダーがAI対応APIをどのように定義するか、ナレッジグラフをどのように最新状態に保つか、検索システムが複数の企業アプリケーション間で権限を維持できるかを追うことも重要になる。セキュリティインシデント、評価の失敗、手動レビューの測定可能な削減は、デモだけよりも本番対応力について多くを明らかにするだろう。
このレポート自体は、MIT Technology Reviewのカスタムコンテンツ部門であるInsightsが作成したものであり、編集部が作成したものではない。したがって、その調査結果は幹部の優先事項を方向づける見方としては有用だが、決定的な市場測定ではなく、調査に基づく主張として読むべきである。
中心的な教訓は実務的だ。企業エージェントは、より多くのデータを受け取るだけでは信頼性を獲得できない。ビジネス上の意味、履歴、権限、手順について、維持管理された理解が必要である。つまり、ナレッジインフラはモデル選定後に追加する任意の強化機能ではなく、AIプロダクトスタックの中核となる。
最も強力な導入は、コンテキストを測定可能なインフラとして扱うものになる可能性が高い。エージェントがどの情報源を利用し、どのルールによって制約され、意思決定がどのように評価されたかを示せるチームは、流暢な出力だけに依存するチームよりも、パイロットから本番へ進む道筋を明確にできるだろう。