
英国のAI Security Institute(AISI)は、主要なオープンウェイト・モデルが、最上位のプロプライエタリなAIシステムとのサイバー能力の差をおよそ4〜7か月まで縮めたと述べています。これは2025年初めより短い遅れであり、適応する時間があると考えているセキュリティチームにとっては重要な警鐘です。AISIの評価によれば、GLM-5.2やDeepSeek V4-Proのようなモデルは、わずか数か月前に一部のクローズド・システムが到達した性能水準に匹敵しうる一方、運用コストははるかに低くなっています。
この組み合わせはベンチマークの話にとどまりません。AISIの分析によれば、ダウンロード可能な重みを持つ低コストのオープン・モデルは、攻撃的なサイバー・ワークフローを大規模化する実務上の障壁を下げると同時に、ベンダー側の安全対策を強制しにくくします。開発者や企業の購買担当にとって、このレポートはオープン・モデル論争を特徴づけてきた緊張関係をより鮮明にします。つまり、プライベート展開やカスタマイズに魅力的なオープンウェイト・システムの特性は、悪用の抑制を難しくすることにもつながるのです。
AISIは、サイバー関連タスクにおいて、主要なオープンウェイト・モデルが先行するクローズド・モデルにどれだけ遅れているかを公に評価したのは今回が初めてだと述べました。同研究所は2つの評価手法を用いました。
1つ目は「Narrow Cyber Tasks」と呼ばれ、4つの難易度レベルにまたがる70のタスクを対象としています。The Decoderによる結果報告によれば、これらのタスクには脆弱性調査、リバースエンジニアリング、Webエクスプロイト、暗号技術が含まれます。このベンチマークでは、2026年6月に公開されたGLM-5.2が、2026年2月のOpus 4.6とほぼ同等の性能を示し、約4か月の差があるとAISIは判断しました。一方、DeepSeek V4-Proは、AISIが2025年11月と位置づけるOpus 4.5相当の性能を示したとされています。
2つ目の手法「Cyber Ranges」は、個別タスクではなく、シミュレーション環境でより自律的な行動をテストします。シナリオの1つ「The Last Ones」は、4つのサブネットと約20台のホストを持つ企業ネットワークへの多段階攻撃をモデル化しています。AISIは、この演習を人間の専門家が完了するには約20時間かかると見積もりました。
その結果はオープン・モデルにとってやや不利でしたが、それでも急速な追い上げを示していました。AISIによれば、シミュレーション環境においてGLM-5.2はOpus 4.5とほぼ同等の成績を収め、DeepSeek V4-ProはSonnet 4.5を下回りました。同研究所は、Cyber Rangesの証拠はNarrow Cyber Tasksの結果より弱いと説明しています。なぜなら、シナリオ数が少なく、純粋なサイバー知識というより長期的な計画能力の限界を反映している可能性があるからです。
この区別は重要です。セキュリティの購入者にとっての実際のリスクは、モデルがリバースエンジニアリングのプロンプトを解けるかどうかだけではなく、騒がしい環境の中で複雑な一連の操作を持続できるかどうかです。AISIは、両方の能力が重要であり、オープン・モデルとクローズド・モデルの差は、何を測定するかによって変わる可能性があると言っているようです。
AISIが報告したコストの数字は、この発表の中でおそらく最も運用上重要な部分です。同研究所によれば、1億トークンのCyber Rangesテストは、Opus 4.5またはOpus 4.6を使うと約85ドル、GLM-5.2を使うと約46ドル、DeepSeek V4-Proではわずか1.19ドルでした。
また、確実に解決されたタスクについては、1タスクあたりのコスト見積もりも示しています。Opus 4.6は約15ドル、GLM-5.2は約6ドル、Opus 4.5は約12.50ドル、DeepSeek V4-Proは約0.28ドルでした。
これらの数値は実際の攻撃コストと同じではなく、AISIもそう主張していません。ですが、「十分に良い」サイバー性能が、特にオープンな展開オプションと組み合わさることで、はるかに安く利用可能になっていくことを示唆しています。防御側にとって重要なのは、脅威がオープン・モデルが現在の最先端と完全に一致するかどうかに限られないという点です。もし古い、あるいは少し劣る能力でも非常に低コストかつ大量に実行できるなら、それだけで攻撃者の経済性を変えうるのです。
この報告がエンタープライズAIにとっても重要で、セキュリティ研究だけの話ではない理由の1つがここにあります。オープンウェイト・モデルを評価する多くの組織は、プライバシー、主権、推論コストの低さに注目します。AISIの結果は、それに加えてデュアルユースの露出も考える必要があることを示唆しています。社内コーディング、自動化、レッドチーム支援に魅力的なモデルは、APIベースのクローズドな代替手段とは大きく異なる安全特性を持つ可能性があります。
AISIの最も厳しい結論は、素の性能ではなく制御に関するものです。同研究所は、テストしたオープン・モデルの安全対策はほぼ効果がなかったと述べました。The Decoderが引用した例では、DeepSeek V4-Proはリバースエンジニアリング要求を時々拒否しましたが、再試行するだけで制限を回避できたとされています。
この弱点は、単一モデル固有の欠陥として示されているわけではありません。AISIのより大きな主張は構造的なものです。監視、分類器、スロットリング、ユーザー制限といった保護策は、システムへのアクセスを管理できることを前提にしています。重みが公開されると、その制御は弱まり、あるいは消失します。コピーは非公開で実行され、改変され、元の開発者の手の届かない場所で共有されうるのです。
AISIはこれを「持続的かつ不可逆的な悪用リスク」と表現していると報じられています。これは通常のモデルカードの注意書きよりも強い言い回しであり、同研究所がこの差の縮小を単なるランキング更新ではなく、政策と防衛準備のタイミングの問題として捉えている理由を説明しています。
同時に、このレポートはオープン・モデルを全面的に否定しているわけではありません。AISIは、オープンウェイト展開の実用的な利点――プライベートホスティング、ベンダー依存の低減、カスタマイズ、提供条件の変更やサービス停止リスクの低下――も認めています。多くの企業にとって、これらは現実の利点です。政策上の課題は、購入者にとって魅力的なオープン・モデルの分散性が、悪用に対する中央集権的な統制も弱めてしまうことです。
この話の核心となる発見は、The Decoderが報じたAISIの評価に基づいています。2つ目の情報源であるTech Timesは、同じ評価を下敷きにしているようですが、実質的な追加情報は加えていません。つまり、ここでの主な証拠基盤は、機関分析についての専門メディアの報道であり、ソース群の中に完全な公開論文が再現されているわけではありません。
いくつかの留意点があります。第一に、AISIはCyber Rangesの結果はテストケース数が少ないため、より弱い証拠だと述べました。第二に、同研究所は、これらのシステムはテスト用に特別に調整されていないため、評価がオープン・モデルのベスト性能をやや過小評価している可能性もあるとしました。第三に、シミュレーションされたネットワーク環境には、実際の防御側や現実の組織にある混沌の全体像は含まれていません。
これらの制約は、異なる方向に作用します。オープン・モデル推進派は、より良いプロンプト設計やチューニングで結果が改善するなら、報告された差はクローズド・システムの優位を過大評価していると主張するかもしれません。一方でセキュリティ実務者は、本番ネットワークには防御、監視、不整合があるため、シミュレーションは攻撃者にとっての現実の摩擦を過小評価していると論じるでしょう。
見出しの背後には、ベンチマーク設計の問題もあります。Narrow Cyber Tasksで良いスコアを出すモデルでも、実際の多段階侵入では、計画を見失ったり、ツールを誤用したり、誤差が積み重なったりして失敗することがあります。逆に、長い自律的なレンジで苦戦するモデルでも、人間のオペレーターが作業を小さなステップに分ければ非常に役立つ場合があります。AISI自身の説明は、その区別を認めているように見えます。
AI開発者にとって、このレポートは変化する基準線を示しています。GLM-5.2やDeepSeek V4-Proのようなオープンウェイト・システムが、はるかに低コストで最近のクローズド・モデルのサイバー性能に近づけるなら、コーディングアシスタント、セキュリティ自動化、AIエージェントのワークフローを構築するプロダクトチームは、より多くの展開オプションを持つことになります――しかし、その一方で、これらのシステムをどう制限し、観測し、分離するかについて、より大きな責任も負うことになります。
企業にとっての実務的な教訓は、「オープン・モデルを避けること」ではなく、「コスト判断とリスク判断を分けること」です。管理された内部環境でオープン・モデルを運用することは、データ所在地やプライベート推論が重要な場面では依然として理にかなっています。ただし、セキュリティチームは、ホスト型APIに頼る場合よりも、より強力なローカル制御、より狭いツールアクセス、より詳細な監査ログ、より明確な社内利用ポリシーを必要とするかもしれません。
サイバー市場にとって、AISIの時間軸の捉え方はおそらく最も重要な戦略シグナルです。同研究所は、クローズド・モデルとオープン・モデルの差を、より強力なシステムを使う防御側が、同等の能力が広くダウンロード可能になる前に適応するための一時的な準備期間と見ています。この期間が6〜10か月ではなく4〜7か月になったのであれば、検知エンジニアリング、レッドチーミング、悪用監視のロードマップは、より速く進める必要があるかもしれません。
このレポートはまた、モデル市場の上位層で急速な動きが続く中で出てきました。AISIは、Mythos PreviewやGPT-5.5を含むクローズド・モデルが、テスト開始以来、AIサイバー能力で最大級の向上を示したと述べています。英国のNational Cyber Security Centreも別途、サイバー脅威環境が急速に変化していると警告しています。オープン・モデルがすぐにあらゆるフロンティアの飛躍を再現しなくても、拡散のスピードは加速しているようです。
当面のシグナルは、AISIが予定しているKimi-K3のテストです。The Decoderによれば、これは7月下旬にオープンウェイトとして公開される見込みです。AISIは、現在のコーディング・ベンチマークから、Kimi-K3が今日のフロンティア・モデルにさらに近づく可能性がある一方、他のオープン・モデルよりコストが高くなる可能性もあると見ているようです。
この1件のリリースを超えて、重要なのは3点です。第一に、今後のCyber Ranges評価が、オープン・モデルが狭いタスク能力だけでなく長期的な自律性でも改善していることを示すかどうか。第二に、企業がオープンウェイト展開のために、ベンダー時代の安全習慣がそのまま適用できると考えるのではなく、より強いローカル・ガバナンスを採用するかどうか。第三に、クローズド・モデルの提供企業がサイバー性能で意味のある優位を維持できるのか、それともフロンティアの進歩が数か月以内にダウンロード可能なシステムへと広がり続けるのか、です。
このAISIの発見で重要なのは、単にオープン・モデルが進化しているということではありません。遅れが縮まっている一方で、推論経済はそれ以上の速さで改善しているように見える点です。実務的には、オープン・モデルがサイバー・ワークフローで戦略的に重要になるために、正確にフロンティアと同等である必要はないのかもしれません。「十分近く、十分安く、十分に制御しにくい」は、すでに重大な閾値です。
プロダクトチームや購入者にとっての教訓は、オープンウェイト採用をモデル品質の判断だけでなく、インフラとガバナンスの判断として扱うことです。プライベートホスティング、低コスト、ベンダーロックインからの自由といった、エンタープライズAIの自律性への関心を高める要因は、既存の安全前提も弱めます。GLM-5.2、DeepSeek V4-Pro、そしておそらくKimi-K3のようなモデルが差を縮めるにつれ、真の差別化要因は生の能力から、ツール、データ、悪用に対する信頼できる制御のもとで誰が展開できるかへと移っていくかもしれません。
AISIは、オープンウェイト・モデルがトップのクローズドAIサイバー・システムに対して今や4〜7か月差まで迫っており、コストが大幅に下がる中で防御側の優位が縮小していると述べています。