
xAI выпустила Grok 4.6 — новую модель, которая, согласно сообщению The Decoder, сравнялась с GPT-5.6 Sol от OpenAI в Artificial Analysis Intelligence Index, при этом обходится значительно дешевле в эксплуатации. Заявленная цена модели составляет 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов, что более чем на 60% ниже указанных цен конкурирующих frontier-моделей.
Этот релиз важен не столько как простое обновление таблицы лидеров, сколько как шаг в позиционировании. Grok 4.6 доступен через API и через продукты для разработчиков, включая Cursor и Grok Build, а лучший по отчету результат модели получен на бенчмарке, рассчитанном на многошаговую компьютерную работу. Если цифры подтвердятся в реальных внедрениях, xAI конкурирует не только по возможностям модели, но и по стоимости запуска ИИ-агентов в длинных рабочих процессах.
Согласно описанию Artificial Analysis Intelligence Index от The Decoder, Grok 4.6 набирает 61 балл. Это ставит его вровень с GPT-5.6 Sol и ниже Claude Opus 5 от Anthropic с 63 баллами и Claude Fable 5 с 62. Сообщаемый результат на пять баллов выше, чем у Grok 4.5.
Эти рейтинги следует рассматривать как доказательство по бенчмарку, а не как универсальный вердикт о качестве модели. Составные индексы объединяют несколько оценок, и производительность может существенно меняться в зависимости от задачи, дизайна промпта, доступа к инструментам, длины контекста и требований к надежности. Доступный источник не приводит подробного разбора тестов индекса или независимых результатов в продуктивной среде.
Тем не менее, этот результат дает xAI более сильную позицию на рынке, где покупатели все чаще сравнивают модели по кодированию, исследованиям, рассуждению и автономному выполнению задач. Ничья с заявленной лидирующей моделью OpenAI может сделать Grok 4.6 релевантным для команд, которые раньше рассматривали xAI прежде всего как альтернативную разговорную модель.
Сообщается, что Grok 4.6 особенно хорошо работает на GDPval-AA v2 — бенчмарке, предназначенном для оценки реальной умственной работы за компьютером. Модель занимает второе место с Elo-рейтингом 1.753, уступая Claude Opus 5.
Более заметная цифра касается числа шагов, необходимых для завершения сложных рабочих процессов. The Decoder сообщает, что Grok 4.6 выполняет такие задачи примерно за 53 шага, тогда как Claude Opus 5 требуется около 103. Меньшее число шагов может указывать на более эффективное планирование или исполнение, хотя сам по себе счетчик шагов не доказывает, что модель выдает лучший конечный результат. Более короткая последовательность также может включать иные вызовы инструментов, допущения или компромиссы при оценке.
Для разработчиков, создающих ИИ-агентов, это различие важно. Каждое дополнительное действие может увеличивать задержку, расход токенов, риск при использовании инструментов и число точек, где агент может дать сбой. Модель, достигающая удовлетворительного результата меньшим числом действий, может снизить операционные расходы и упростить мониторинг. С другой стороны, командам все равно нужно проверять, сохраняются ли у более коротких рабочих процессов точность, устойчивое восстановление после ошибок и соблюдение разрешений в продакшн-системах.
Заявленная цена Grok 4.6 составляет 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов. The Decoder сравнивает это с 5 и 25 долларами для Claude Opus 5, а также 5 и 30 долларами для GPT-5.6 Sol. По этим прайс-листам Grok 4.6 более чем на 60% дешевле обоих альтернатив, причем наибольшая разница приходится на выходные токены.
Этот разрыв может быть особенно важен для приложений, генерирующих большой объем вывода или многократно обращающихся к модели в агентном рабочем процессе. Это может сделать более практичным использование модели frontier-уровня для расследований в поддержке клиентов, задач по программному обеспечению, обработки документов или внутреннего исследования, а не только для небольшого числа запросов высокой ценности.
Одной цены недостаточно для определения общей стоимости. Покупателям также нужно учитывать задержку, лимиты запросов, поведение окна контекста, интеграцию с инструментами, надежность, модерацию, обработку данных и инженерную работу, необходимую для смены поставщика. Источник не содержит таких операционных сравнений, поэтому ценовое преимущество следует понимать как преимущество по прайс-листу, а не как полный расчет совокупной стоимости владения.
В сообщении говорится, что Grok 4.6 доступен через xAI API, Cursor, Grok Build и партнеров, включая OpenRouter, Vercel и Cloudflare. По данным The Decoder, xAI также предлагает удвоенные квоты использования в Grok Build и Cursor в течение первой недели. Эта акция может стимулировать раннее тестирование, но пока не показывает устойчивого внедрения или долгосрочной экономики использования.
Немедленная возможность для разработчиков — протестировать Grok 4.6 на своих рабочих нагрузках в сравнении с существующими моделями, особенно в задачах с повторными вызовами инструментов. Командам следует измерять не только бенчмарк-оценки, но и успешность выполнения задач, а также среднее число шагов, задержку, расход токенов, повторные попытки и участие человека.
Наличие модели через несколько каналов для разработчиков может снизить барьер для сравнения. Команда, уже использующая Cursor, Vercel, Cloudflare или OpenRouter, может оценить Grok 4.6 без построения совершенно нового пути приложения. Однако каждый способ доступа может накладывать разные ограничения, ценовые условия, доступность функций или политики обработки данных, поэтому «доступно» не обязательно означает операционную взаимозаменяемость.
Для корпоративных покупателей ключевой вопрос в том, сохраняется ли заявленная агентная эффективность в контролируемых тестах с частными данными, правами доступа, восстановлением после сбоев и требованиями аудита. Модель, которая дешева и сильна на бенчмарке, все равно может оказаться непригодной для чувствительных рабочих процессов, если она непоследовательна, трудна для мониторинга или плохо соблюдает организационные ограничения.
Релиз также усиливает конкурентное давление на OpenAI и Anthropic. Конкуренция frontier-моделей смещается в сторону сочетания возможностей, стоимости инференса, дистрибуции и надежности агентов. Заявленная стратегия xAI с Grok 4.6 — использовать более низкую цену и широкую доступность, чтобы превратить паритет на бенчмарке в экспериментирование разработчиков.
Самой важной последующей проверкой станут независимые тесты Grok 4.6 в задачах кодирования, работы с браузером, автоматизации бизнес-процессов и длительных агентных задач. Сравнения должны использовать одинаковые промпты, идентичные инструменты и прозрачный учет повторных попыток и помощи человека.
Покупателям также стоит следить за отчетами в продакшене от разработчиков, использующих xAI API, Cursor и Grok Build. Полезными сигналами будут устойчивый успех задач, реальные затраты на токены, задержка под нагрузкой, поведение при ограничениях по скорости и то, превращается ли заявленное преимущество по числу шагов в меньшее число сбоев.
Наконец, стоит отслеживать коммерческую реакцию xAI. Акция с удвоенными квотами в первую неделю может быть временной, а цены конкурентов и выпуск новых моделей быстро изменят экономику. Устойчивость позиции Grok 4.6 будет зависеть от качества сервиса и реального внедрения, а не только от его начального индекса.
Сообщаемые результаты Grok 4.6 делают экономичное выполнение агентов самой значимой частью этого релиза. Модель, сочетающая почти frontier-уровень бенчмарк-производительности с существенно более низкими ценами на токены, может изменить то, какие рабочие процессы экономически жизнеспособны, особенно когда приложения делают много вызовов модели.
Но доказательства пока ограничены специализированным отчетом, ссылающимся на бенчмарк и цены. Разработчикам следует воспринимать релиз как вескую причину провести сравнительную оценку, а не как доказательство того, что Grok 4.6 универсально лучше или дешевле в продакшене. Следующее конкурентное преимущество достанется поставщикам, которые смогут продемонстрировать надежное поведение агентов в масштабе.
Grok 4.6 от xAI сравнялся с сообщаемой топовой моделью OpenAI в ведущем индексе и нацелен на агентные рабочие нагрузки при ценах более чем на 60% ниже.