GoogleのGemini 4 Argonは1つの指標でOpenAIのGPT-6 Astraと並び、Anthropicの最上位モデルには後れを取り、まずは選ばれたテスター向けに提供される。

Googleは新たなフラッグシップモデルGemini 4 Argonを発表した。これにより同社は、新しいフロンティアモデルのリリースが7カ月以上なかった期間を経て、OpenAIやAnthropicとの直接競争に復帰する。初期テストでは、ArgonはGoogleの従来モデルを大幅に上回り、OpenAIのGPT-6 Astraとも競争できることが示唆されている。ただし、総合的にはAnthropicの先行システムが依然として優位にあるようだ。
今回の発表が注目される理由は、単一のベンチマークで勝利したことよりも、明らかになったトレードオフにある。Argonは100万トークンの出力上限と、導入時としては異例に低いトークン価格を提供する一方、独立テストによれば、同じタスクを完了するために一部の競合モデルよりはるかに多くのトークンを消費する。Googleは安全性に関するフィードバックを集める間、アクセスも制限しているため、開発者はまだ広く利用可能なAPIを通じてモデルを評価できない。
The Decoderによると、GoogleはまずFairwindプログラムを通じて選ばれた「信頼できるサイバー防衛担当者」と社内チームにArgonを提供している。報道では、初期版はこのテスト環境ではサイバー向けのガードレールなしで動作するという。Googleは、新モデルへの早期アクセスを政府機関に提供する米国政府の任意プログラムにも参加している。
同社はテスターからのフィードバックを利用してArgonの安全機構を改善したうえで、開発者、企業、消費者へアクセスを拡大する計画だ。有料API顧客とGoogle AI Ultraの加入者には次に提供される見込みだが、Googleは正式な公開日を示していない。
このモデルの最大の特徴は、前世代の6万4,000トークンから増えた100万トークンの出力上限だ。Argonは100万トークンのコンテキストウィンドウを維持し、テキスト、画像、動画、音声を受け付けるが、出力はテキストのみとなる。GoogleはGemini APIにLong Decode Continuationという機能を追加する。これにより、長い応答を一時停止し、長時間の推論プロセスがタイムアウトするのを待つのではなく、後続リクエストで再開できる。
この設計は、モデルが長い推論の連鎖を維持する必要がある複雑な調査、コーディング、エージェント型ワークフローを対象としている。同時に購入者には、出力上限の拡大が許容できるコストでより良い結果を生むのか、それとも単により多くの文章を生成するだけなのかという実務的な問題を突きつける。
利用可能な中で最も強い性能データは、The Decoderが報じたArtificial Analysisによるものだ。最高の推論設定で、ArgonはArtificial Analysis Intelligence Indexで53点を獲得した。OpenAIのGPT-6 AstraおよびAnthropicのClaude Fable 5.1と同点で、GPT-6.1 Solを1点上回った。AnthropicのClaude Opus 5.5は58点、Claude Sonnet 5.5は56点だった。
これは、ArgonがGoogleのGemini 3.1 Pro Previewを23点上回ったとされることを考えると、大幅な改善だ。しかし、OpenAIの1モデルと並んだことは、フロンティア全体で明確な首位に立ったことと同じではない。The Decoderの評価では、この指標ではAnthropicが先行しており、ベンチマーク結果はタスクによって大きく異なる。
Argonは一部のエージェント型評価で特に良好な結果を示した。Artificial Analysisによると、AutomationBench-AAでは77.5%で、Claude Sonnet 5.5を6ポイント上回った。Terminal Bench 4では57%に達し、Gemini 3.1 Pro Previewから大幅に改善したが、Claude Sonnet 5.5の64%、Claude Opus 5.5の60%、GPT-6 Astraの59%には及ばなかった。
AA-Omniscienceでは、比較対象システムより低い15%のハルシネーション率も記録した。GPT-6 Astraは51%、GPT-6.1 Solは54%だった。一方、このテストでの正確性は50%で、Gemini 3.1 Pro PreviewとGPT-6 Astraを下回った。この違いは企業向けアプリケーションでは重要だ。推測を避けることは信頼性を高める可能性があるが、システムがより多くを知っていることを自動的に意味するわけではない。
Google独自のベンチマーク結果では、Argonが多くのカテゴリーで首位に立ったとされ、Vals AIも68.9%で1位に置いた。これらはベンダーに関連した主張、または選ばれた外部評価に基づくものであり、普遍的なランキングとみなすべきではない。The Decoderはさらに、Valsの結果ではAnthropicの中位モデルSonnet 5.5がフラッグシップのOpus 5.5を上回ったと指摘しており、ランキングは慎重に解釈する必要がある。
GoogleはArgonを入力100万トークン当たり2ドル、出力100万トークン当たり10ドルで導入する。通常価格はそれぞれ4ドルと20ドルに上がる見込みだ。キャッシュされた入力には95%の割引が適用され、The Decoderが報じた数値に基づけば、導入時のキャッシュ入力価格は100万トークン当たり約10セントになる。
これらの料金はフロンティアモデルとしては低く見えるが、トークン価格だけでアプリケーションのコストは決まらない。Artificial Analysisによると、ArgonはIntelligence Indexの各タスクで平均6万2,000出力トークンを使用したのに対し、GPT-6 Astraは2万7,000トークンだった。その結果、Argonのタスク推定コストはプロモーション価格で1.99ドル、Astraは3.26ドルとなった。Argonの通常価格が適用されると、同じ計算は約3.98ドルに上昇する。
開発者にとって意味するところは明確だ。Argonは、長い推論の恩恵を受け、追加の出力を許容できるワークロードでは経済的かもしれないが、レイテンシー、トークン量、予測可能な支出が重要な場合にはそうとは限らない。チームは公表されたトークン単価ではなく、ワークフロー全体のコストを測定する必要がある。
生の推論能力以外でのモデル性能も一様ではない。Arena.aiは、コーディング、指示追従、難しいプロンプト、創作を含むText ArenaでGemini 4 Argonを1位にしたとされる。しかしCode ArenaのWebDevテストでは8位だった。この差は、モデルが実際に動作するソフトウェアスタック、ツール、検索システム、ユーザーインターフェースの中で評価することの重要性を示している。
直近のシグナルは、Googleの公開APIリリースと、開発者が本番ワークロードをテストできるだけの期間、導入価格を維持するかどうかになる。有料API顧客とGoogle AI Ultra加入者へのアクセスは予定されているが、日付は発表されていない。
企業の購入者は、レイテンシー、出力トークンの使用量、拒否動作、ツール利用の信頼性について独立した測定結果を注視すべきだ。100万トークンの出力上限が意味を持つのは、長い応答によってタスク完了が改善し、コストの暴走や監査しにくいエージェント動作を招かない場合だけだ。
より広い競争上のシグナルは、製品への統合から生まれる。The Decoderは、Argonのベンチマーク結果が強いにもかかわらず、GoogleのGeminiアプリは依然としてClaude CoworkやChatGPT Workなどの製品に遅れを取っていると報じた。Googleがモデルをより優れたエージェント・インターフェース、ツール、ワークフロー制御と組み合わせられなければ、ベンチマーク上の進歩が採用に与える影響は限定的かもしれない。
Gemini 4 Argonは、決定的な首位奪取というより、フロンティアへの信頼できる復帰に見える。進歩は意味のあるものだ。報道によれば、OpenAIとの差の多くを縮め、複数のエージェント型テストでGoogleの弱い結果を改善し、魅力的な導入価格も提示している。しかし、Intelligence IndexでAnthropicがより高いスコアを獲得していることと、Argonのトークン消費が大きいことが、コストと性能の評価を複雑にしている。
AI開発者にとって、このリリースはワークロード固有のテストを必要とする、もう一つの強力な選択肢と理解するのが最適だ。今回の勝者は単一のランキングでは決まらない。実際のユーザーが、選ばれたテスターだけでなく利用できるようになったとき、信頼できる結果、管理可能な推論コスト、有用なツール実行、安全な導入を提供するモデルが勝者となる。