
Anthropicは、Claude Mythos Previewと呼ばれる社内モデルが、ポスト量子署名候補であるHAWKへの改良された攻撃と、AES-128の縮小版に対する新しい攻撃を含む、2つの暗号学的対象の弱点を特定したと述べている。同社は、どちらの結果も今日インターネットで使われているシステムを破るものではないとしているが、この取り組みは、フロンティアAIシステムがコーディング、検索、文書作業の補助だけでなく、高度な暗号解読に寄与し始める可能性を示している点で注目に値する。
The Decoder が Anthropic の開示をもとに説明したこのレポートは、半自律的なマルチエージェント構成を中心にしており、報道によればモデルが技術的探索の大半を担い、人間はプロジェクト管理、プロンプト作成、検証を担当した。Anthropicは、HAWK の成果は専門家による長年の人間レビューの後、約60時間で生まれ、各プロジェクト実行には API 利用でおよそ10万ドルかかったとしている。これらの詳細がより広い検証に耐えるなら、この進展は1つのモデルリリースを超えて重要になる。つまり、AI システムが難しい数学的セキュリティ問題に対して意味のある独創的な作業を行えるようになりつつあることを示唆するからだ。
The Decoder による Anthropic の発見の説明によれば、Claude Mythos Preview は2つの別々の結果を出した。1つ目は、National Institute of Standards and Technology による追加のポスト量子署名の選定プロセスで残っている候補の1つ、HAWK に対する改良された攻撃だった。ポスト量子暗号は、将来大規模量子コンピュータが実用的になっても安全であり続けることを目的としているため、候補方式に新たな弱点が見つかることは、実際に導入済みの製品に影響しなくても、標準化作業にとって重要である。
Anthropic は、モデルが HAWK の安全性の基盤となる格子構造の中に、これまで見過ごされていた対称性を発見したと述べている。同社の説明では、システム内のあるエージェントは当初その方法を実行不可能と見なした一方、別のエージェントがそれを利用する方法を見つけたという。この詳細は、結果をチャットボットの単発回答というより、複数のモデル役割を用いた統制された研究ワークフローとして位置づけるため重要だ。
2つ目の結果は AES-128 に関するものだが、重要な制限がある。Anthropic によると、この攻撃はフルの AES-128 の10ラウンドではなく、7ラウンドを使う縮小版にのみ適用される。AES は実務上、最も広く使われている共通鍵暗号の標準であるため、「新しい AES 攻撃」という表現は、証拠以上に警戒感を煽ってしまう可能性がある。入手可能な報道に基づけば、これは一般的なインターネットや企業システムで使われているフル AES を破るものではない。
この縮小版の対象について Anthropic は、Claude Mythos が「Möbius Bridge」と呼ぶ新しいフィンガープリンティング手法を開発したと述べている。同社は、この方法が攻撃者の推測の1つを排除することで、従来の攻撃を200倍から800倍改善すると主張している。これはベンダー側の技術的性能主張であり、ここで示されている証拠の中で独立に検証された業界ベンチマークではない。
HAWK の発見は、この話の中でより重要な部分に見える。なぜなら、それは意図的に弱められた既存暗号ではなく、進行中の標準化パイプラインに関わるからだ。The Decoder は、Claude Mythos Preview が約60時間でより強力な攻撃を見つける前に、人間の専門家が HAWK を2年以上レビューしていたと報じている。モデルが構造化されたワークフローに組み込まれ、その後人間によって確認されたという留保はあるものの、この比較こそがニュースが注目される核心だ。
HAWK は現在、実際に展開されているインターネット標準ではない。これは National Institute of Standards and Technology の審査下にある候補であり、この違いによって、当面の運用上のリスクは大きく制限される。しかし、暗号ツール、安全なハードウェア、長寿命の規制対象システムを構築するチームにとって、この出来事は、AI システムが進歩するにつれて、ポスト量子暗号の評価プロセスがより速く、予測しにくくなる可能性があることを思い出させる。
また、研究者や標準化団体により実践的な問いを投げかける。もしモデルが、非自明だが管理可能なコストで候補方式の実際の弱点を見つけられるなら、公開暗号解読のハードルは変わるかもしれない。それは、広く展開されているアルゴリズムへのより良い攻撃がすぐに登場することを自動的に意味するわけではない。しかし、今後のポスト量子暗号のレビューでは、従来の査読だけよりも、より自動化された敵対的テストが増える可能性があることを意味する。
この発表を評価するうえでの重要な論点は、Claude Mythos にどれだけの作業を帰せるか、そして周囲のシステムや人間オペレーターにどれだけを帰すべきかだ。The Decoder が伝えた Anthropic の説明によると、人間は主にプロジェクト管理、軽いプロンプト作成、検証を担当していた。HAWK プロジェクトでは、主担当の人間研究者は理論計算機科学の背景はあったが、格子ベース暗号の専門家ではなかったという。
縮小版 AES の作業について Anthropic は、ある研究者がモデルに仮説を立てさせ、実験を実行させるための足場を作ったと述べている。同社はまた、モデルが当初はこれ以上の改善は難しいと主張して課題に抵抗したものの、より独創的な方向を追求するよう促されたと説明している。約3日間で、その実行はおよそ10億トークンを消費し、実質的な追加プロンプトは数回しか必要なかったと報じられている。
これらの詳細は二通りに解釈できる。1つには、システムが既知のアイデアを単に補完しただけではないという Anthropic の主張を裏付ける。もう1つには、これは単純な既製チャットセッションではなかったことを示す。目的に合わせて構築された研究環境、大量のトークン使用、そして実行後の徹底した確認が含まれていたのだ。AI エージェントを構築する人にとっての教訓は、「モデルが暗号を単独で解いた」というよりも、「慎重に構造化された多段階システムは、狭い領域でモデルからフロンティア級の成果を引き出せることがある」ということかもしれない。
この話で最も強い主張は Anthropic による報告で、The Decoder を通じて伝えられている。記事によれば、人間の研究者は数百時間をかけて結果を検証し、Anthropic は事前に米国政府、業界パートナー、そして HAWK の著者たちと結果を共有したという。その開示プロセスは良い兆候だが、広範な公開検証と同じではない。
ここで示されている証拠には、査読済み論文、独立再現、あるいは National Institute of Standards and Technology、HAWK の著者、外部の暗号学者からの反応は含まれていない。また、改良された HAWK 攻撃が標準化プロセスにおける候補の立場を実質的に変えるかどうかも示されていない。これらは重要な未解決点だ。
Anthropic はまた、Claude Mythos Preview が一般公開されていないとも述べている。そのため、同社の主張を外部から検証することは今のところ限られる。モデルの作業に加え、Anthropic は ETH Zurich、Tel Aviv University、University of Haifa と共同で、暗号解読タスクにおける言語モデルを評価するための CryptanalysisBench というベンチマークにも取り組んだという。ベンチマークは、システムをより体系的に比較する助けにはなるが、主張された突破や攻撃の独立検証の代わりにはならない。
AI ビルダーにとって、この話はエンタープライズ向けコパイロットや消費者向けチャットボットとは大きく異なるユースケースの一群を示している。暗号解読はコストが高く、対象が狭く、検証重視だ。しかし、それは広大な仮説空間を粘り強く探索することに報いる。まさにその点で、エージェント的システムは急速に改善する可能性がある。研究ワークフロー向けの AI エージェントを開発する企業は、この事例を注意深く研究するだろう。特に、オーケストレーション、実験ループ、軽い人間の舵取りの組み合わせに注目が集まるはずだ。
企業の AI 購入者にとって、直近の結論は「インターネットの暗号化が危険になった」ということではない。Anthropic は明確に、今回の結果が今日使われているシステムには影響しないと述べており、入手可能な証拠もその慎重姿勢を支持している。より重要なのは組織面の含意だ。防御側と攻撃側の双方が、時間とともにより強力な自動分析へアクセスできるようになると想定する必要があるかもしれない。それは脆弱性調査、プロトコルレビュー、レッドチーム予算、そして「実戦で鍛えられた」暗号部品に関する調達判断に影響する可能性がある。
ここには、より広い意味での企業向け AI に対する市場シグナルもある。Anthropic が、フロンティアモデルが難しい科学的・数学的領域で実際の価値を生み出せることを示せれば、モデルベンダー同士の競争はチャット品質だけでなく、専門的推論能力でも行われているという見方が強まる。そうなれば、形式的検証、安全なコード解析、研究自動化といった分野で、競合他社にも同等の深さを示す圧力がかかるだろう。
最初に注目すべき次のシグナルは、外部検証だ。暗号学者、HAWK の著者、National Institute of Standards and Technology から、報じられた HAWK の弱点が候補の見通しを実質的に変えるかどうかについてのコメントに注目したい。
次に、技術的な公開を探すべきだ。HAWK と AES-128 の結果に関する公開論文や詳細な解説があれば、より広い研究コミュニティが主張を検証し、どれほどモデルに依存し、どれほど周囲の足場に依存したのかを理解できる。
第三に、CryptanalysisBench は複数の研究室が採用すれば有用な基準点になる可能性がある。他のフロンティアモデルが CryptanalysisBench で同様の成績を示せば、この話は Anthropic の単発の主張から、より広い能力トレンドへと変わる。
最後に、利用可能性も重要だ。報道によれば、Claude Mythos Preview はまだ未公開のままだ。より広いアクセスがなければ、市場は再現性、コスト効率、あるいはこの能力が慎重に選ばれた少数の問題を超えて一般化するかどうかを簡単には判断できない。
Anthropic の発表は、モデルの知能だけでなくワークフロー設計のシグナルとして最も重要だ。注目すべきは、Claude Mythos を管理されたマルチエージェントプロセス、実験用の足場、長い検証サイクルと組み合わせた点である。これは、典型的なチャットボットのデモよりも、高価値な企業向け AI システムが実運用でどう動くかにずっと近い。
同時に、この話がセキュリティ計画を変える前には、さらに独立した確認が必要だ。現時点では、フロンティア AI がポスト量子暗号のような専門研究領域で重要になり始める可能性を示す証拠として読むべきであり、導入済みの暗号標準が危険にさらされている証明としてではなく、自動化されたセキュリティ分析の速度に関する初期警告として受け止めるべきだろう.
Anthropicは、Claude MythosがHAWKと縮小版AESの欠陥を見つけたとし、AIが現在のシステムを脅かすことなく暗号解読を加速させる可能性を示唆しているという。