Gemini 4 Argon от Google сравнялся с GPT-6 Astra от OpenAI по одному индексу, уступает ведущим моделям Anthropic и сначала запускается для избранных тестировщиков.

Google представила Gemini 4 Argon — новую флагманскую модель, которая возвращает компанию к прямой конкуренции с OpenAI и Anthropic после более чем семи месяцев без нового релиза передовой модели. Ранние тесты показывают, что Argon значительно сильнее предыдущей модели Google и сопоставим с GPT-6 Astra от OpenAI, однако ведущие системы Anthropic, судя по всему, по-прежнему имеют общее преимущество.
Релиз примечателен не столько победой в одном бенчмарке, сколько демонстрируемыми компромиссами. Argon предлагает лимит вывода в миллион токенов и необычно низкие стартовые цены, тогда как независимые тесты показывают, что для выполнения тех же задач он расходует значительно больше токенов, чем некоторые конкуренты. Google также ограничивает доступ, собирая отзывы о безопасности, поэтому разработчики пока не могут оценивать модель через широко доступный API.
По данным The Decoder, Google сначала предоставляет Argon выбранным «надёжным защитникам киберпространства» в рамках программы Fairwind, а также внутренним командам. Сообщается, что в этой тестовой среде первоначальная версия работает без киберзащитных ограничений. Google также участвует в добровольной программе правительства США, предоставляющей ведомствам ранний доступ к новым моделям.
Компания планирует использовать отзывы тестировщиков для доработки механизмов безопасности Argon, прежде чем расширить доступ для разработчиков, бизнеса и потребителей. Ожидается, что следующими доступ получат платные клиенты API и подписчики Google AI Ultra, хотя Google не назвала точную публичную дату.
Главная особенность модели — лимит вывода в миллион токенов против 64 000 токенов у предыдущего поколения. Argon сохраняет контекстное окно в миллион токенов и принимает текст, изображения, видео и аудио, но выдаёт только текст. В Gemini API Google добавляет функцию Long Decode Continuation, которая позволяет приостановить длинный ответ и продолжить его последующими запросами вместо того, чтобы дать длительному процессу рассуждения завершиться по тайм-ауту.
Такая конструкция рассчитана на сложные исследовательские, программные и агентские рабочие процессы, где модели требуется поддерживать длинную цепочку рассуждений. Но она ставит перед покупателями практический вопрос: приводит ли больший лимит вывода к лучшим результатам при приемлемой стоимости или просто генерирует больше текста?
Наиболее убедительные доступные данные о производительности получены от Artificial Analysis, сообщает The Decoder. При максимальной заявленной настройке рассуждений Argon набрал 53 балла в Artificial Analysis Intelligence Index. Он сравнялся с GPT-6 Astra от OpenAI и Claude Fable 5.1 от Anthropic и на один балл опередил GPT-6.1 Sol. Claude Opus 5.5 от Anthropic набрал 58 баллов, а Claude Sonnet 5.5 — 56.
Это существенное улучшение по сравнению с Gemini 3.1 Pro Preview от Google, который Argon, как сообщается, превзошёл на 23 балла. Однако равенство с одной моделью OpenAI — не то же самое, что явное лидерство на всём передовом уровне. По оценке The Decoder, в этом индексе впереди находится Anthropic, а результаты бенчмарков значительно различаются в зависимости от задачи.
В некоторых оценках агентских возможностей Argon выступил особенно хорошо. Artificial Analysis сообщила о результате 77,5% в AutomationBench-AA — на шесть пунктов выше Claude Sonnet 5.5. В Terminal Bench 4 Argon набрал 57%: это значительный рост относительно Gemini 3.1 Pro Preview, но ниже результатов Claude Sonnet 5.5 — 64%, Claude Opus 5.5 — 60% и GPT-6 Astra — 59%.
В тесте AA-Omniscience модель также показала более низкий уровень галлюцинаций, чем сравниваемые системы: 15% против 51% у GPT-6 Astra и 54% у GPT-6.1 Sol. Однако её точность в этом тесте составила 50% — меньше, чем у Gemini 3.1 Pro Preview и GPT-6 Astra. Для корпоративных приложений это различие важно: отказ от догадок может повысить надёжность, но автоматически не означает, что система знает больше.
Собственные результаты Google в бенчмарках, как сообщается, показывают лидерство Argon во многих категориях, а Vals AI поставила его на первое место с результатом 68,9%. Эти заявления связаны с поставщиком или основаны на отдельных внешних оценках, поэтому их не следует считать универсальным рейтингом. The Decoder также отметил, что результаты Vals поставили промежуточную модель Anthropic Sonnet 5.5 выше флагманской Opus 5.5 — ещё одна причина осторожно интерпретировать рейтинг.
Google запускает Argon по цене 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Ожидается, что стандартные цены вырастут до 4 и 20 долларов соответственно. Для кэшированных входных данных действует скидка 95%, что, исходя из цифр The Decoder, даст стартовую цену около 10 центов за миллион токенов.
Эти тарифы кажутся низкими для передовой модели, но цена токена сама по себе не определяет стоимость приложения. По данным Artificial Analysis, Argon в среднем использовал 62 000 выходных токенов на одну задачу Intelligence Index, тогда как GPT-6 Astra — 27 000. В результате расчётная стоимость задачи Argon по промоциональной цене составила 1,99 доллара против 3,26 доллара у Astra. После перехода Argon на обычную цену тот же расчёт вырастет примерно до 3,98 доллара.
Для разработчиков вывод очевиден: Argon может быть экономичным для рабочих нагрузок, которым полезны длительные рассуждения и дополнительный объём вывода, но менее выгодным, если важны задержка, объём токенов или предсказуемые расходы. Командам нужно измерять стоимость полного рабочего процесса, а не сравнивать только опубликованные цены за токен.
Производительность модели за пределами необработанного рассуждения также неоднородна. По сообщениям, Arena.ai поставила Gemini 4 Argon на первое место в своей Text Arena, включающей программирование, следование инструкциям, сложные запросы и творческое письмо. Однако в тесте WebDev от Code Arena он занял восьмое место. Этот разрыв подчёркивает важность оценки модели внутри программного стека, инструментов, систем поиска и пользовательского интерфейса, где она будет реально работать.
Ближайшим сигналом станет публичный запуск API Google и то, будет ли компания достаточно долго сохранять стартовую цену, чтобы разработчики успели протестировать рабочие нагрузки в продакшене. Доступ для платных клиентов API и подписчиков Google AI Ultra запланирован, но дата не объявлена.
Корпоративным покупателям стоит следить за независимыми измерениями задержки, использования выходных токенов, поведения при отказе и надёжности работы с инструментами. Лимит вывода в миллион токенов будет иметь значение только в том случае, если длинные ответы улучшают выполнение задач, не создавая неконтролируемых расходов или поведения агентов, которое сложно проверять.
Более широкий конкурентный сигнал поступит от интеграции в продукты. The Decoder сообщил, что приложение Gemini от Google по-прежнему уступает таким продуктам, как Claude Cowork и ChatGPT Work, несмотря на сильные результаты Argon в бенчмарках. Если Google не сможет объединить модель с более совершенными интерфейсами агентов, инструментами и средствами управления рабочими процессами, успехи в бенчмарках могут оказать ограниченное влияние на внедрение.
Gemini 4 Argon выглядит как убедительное возвращение на передовой уровень, а не как решительный захват лидерства. Его прогресс значителен: по сообщениям, модель закрывает большую часть разрыва с OpenAI, улучшает слабые результаты Google в нескольких агентских тестах и предлагает привлекательную стартовую цену. Но более высокие баллы Anthropic в Intelligence Index и большое потребление токенов Argon усложняют оценку соотношения стоимости и производительности.
Для разработчиков ИИ этот релиз лучше всего рассматривать как ещё один сильный вариант, требующий тестирования на конкретных рабочих нагрузках. Победителя этого раунда определит не одна таблица лидеров. Им станет модель, которая обеспечит надёжные результаты, управляемые расходы на инференс, полезное выполнение действий через инструменты и безопасное развертывание, когда доступ получат реальные пользователи, а не только выбранные тестировщики.