
Claude Opus 5 от Anthropic занял первое место в опубликованных результатах на ARC-AGI-3 — бенчмарке, созданном для проверки того, насколько хорошо ИИ-системы справляются с незнакомыми интерактивными задачами, а не воспроизводят шаблоны из обучающих данных. По данным The Decoder, который ссылается на результаты ARC Prize, Claude Opus 5 набрал 30,2 % на ARC-AGI-3, значительно опередив предыдущий заявленный лучший результат GPT-5.6 Sol (Max) от OpenAI — 7,8 %.
Такой разрыв достаточно велик, чтобы иметь значение не только как повод для разговоров в лидербордах. Для разработчиков ИИ и корпоративных команд ARC-AGI-3 рассматривается как индикатор того, улучшаются ли у передовых моделей планирование, адаптация и многошаговое решение проблем в новых средах. Если результат отражает более широкое повышение способностей, а не узкую оптимизацию, это означало бы, что Anthropic улучшает именно тот тип рассуждения, который нужен ИИ-агентам, системам для программирования и инструментам рабочих процессов, которым необходимо восстанавливаться после ошибок без ручных костылей.
Опубликованный результат принадлежит команде ARC Prize, которая разрабатывает и поддерживает семейство бенчмарков ARC-AGI. Более новый бенчмарк ARC-AGI-3 задуман как интерактивный тест в игровом стиле: модель должна выводить скрытые правила, выбирать действия и выполнять их шаг за шагом. Это отличает его от многих статичных бенчмарков, которые могут поощрять заученные форматы или поверхностное распознавание шаблонов.
Согласно The Decoder, Claude Opus 5 решил пять ранее нерешённых сред ARC-AGI-3. Сообщается, что четыре из них были решены на уровне человека или выше. ARC Prize также заявила, что в общей сложности решены уже шесть из 25 публичных демонстрационных сред, а результаты, повторы и код доступны публично.
В статье также сказано, что Claude Opus 5 превзошёл собственные модели Anthropic класса “Fable-class”, которые ARC Prize, по сообщениям, оценивает примерно в 20 % на ARC-AGI-3. Это делает скачок заметным не только по сравнению с GPT-5.6 Sol, но и внутри собственной недавней линейки моделей Anthropic.
На более старых версиях семейства бенчмарков прирост выглядит менее драматичным. По данным The Decoder, Claude Opus 5 достиг 90,4 % на ARC-AGI-2 и 97,5 % на ARC-AGI-1, что соответствует прежним лучшим результатам, но при несколько более высокой стоимости, исходя из анализа ARC Prize. Иными словами, главный заголовочный прорыв сосредоточен в новейшей и, вероятно, самой сложной версии теста.
Самая сильная интерпретация результата исходит от исследователей ARC Prize, а не напрямую от Anthropic. Как цитирует и пересказывает The Decoder, команда бенчмарка связывает лидерство с более сильным логическим рассуждением, которое поддерживает более автономное исследование, планирование и выполнение в незнакомых средах.
Самая бросающаяся в глаза деталь — качественная, а не числовая. Во время тестирования Claude Opus 5, по сообщениям, переводил задачи в алгебраическую нотацию и самостоятельно формулировал “reflection equations” — поведение, которое, по словам исследователей ARC Prize, они ранее не наблюдали у другой модели в этом контексте. Если это описание выдержит более широкую проверку, оно указывает на то, что модель не просто пробует больше действий, а строит более явные внутренние представления проблемы.
Это важно, потому что основное обещание систем вроде Claude Opus 5 — не просто лучшее качество чата. Речь о моделях, которые могут исследовать новую среду, находить её правила, пересматривать неудачную стратегию и продолжать работу. Именно такие свойства нужны надёжным ИИ-агентам в разработке ПО, работе с данными, исследовательской поддержке и автоматизации бэк-офиса.
При этом сам бенчмарк несёт философию, которая влияет на интерпретацию результатов. ARC Prize различает «сырой» потенциал языковой модели и производительность, усиленную внешним harness. Некоторые системы могут лучше справляться с такими задачами благодаря дополнительному оркестрационному ПО, но официальный скоринг ARC-AGI акцентирует именно собственную производительность модели. The Decoder отмечает, что ARC Prize утверждает: будущим системам, подобным AGI, не должна требоваться внешняя помощь для действительно новых задач.
Результат впечатляет, но он не снимает давний вопрос: становятся ли передовые модели действительно умнее в общем смысле или просто лучше подстроены под конкретные тесты.
The Decoder сообщает, что Anthropic публично не объяснила источник прироста. Среди возможных механизмов называются целевая разметка данных, reinforcement learning и тот факт, что Claude Opus 5 разрабатывался после ARC-AGI-3, а формат теста уже стал публичным. Это важно по времени. Как только формат бенчмарка известен, разработчики модели могут обучать её под те типы абстракций, циклов взаимодействия и структур головоломок, которые он поощряет, не обязательно обучаясь именно на отложенных заданиях.
Это не обесценило бы результат, но сузило бы выводы. Лучшее выполнение ARC-AGI-3 может отражать реальный рост способности к исследованию и выводу правил. Но это также может быть следствием концентрированной оптимизации под уже видимую категорию задач. Эти объяснения не исключают друг друга.
Напряжение становится яснее во втором тесте, на который ссылается The Decoder: Witness — приватном бенчмарке исследователя Guanghan Ning для интерактивных головоломок. На Witness Claude Opus 5, как сообщается, набрал 43,4, статистически сравнявшись с Kimi K3 и Fable 5. Прирост по сравнению с Opus 4.8 там был значительно меньше, чем на ARC-AGI-3, и, по сообщениям, Opus 5 уступил Opus 4.8 как минимум в одной игре с менее привычной механикой.
Ning сказал The Decoder, что такой паттерн может соответствовать обучению на данных, специфичных для жанра, но позже уточнил, что Claude Opus 5 всё же обобщил на Witness, просто гораздо слабее, чем на ARC-AGI-3. Greg Kamradt, которого The Decoder называет одним из исследователей, стоящих за ARC-AGI-3, утверждал, что один более слабый результат не перевешивает более широкий прогресс, а пересечение дизайна Witness с головоломками в стиле ARC-AGI-3 может отражать подлинный перенос знаний.
На данный момент наиболее справедливая интерпретация такова: Claude Opus 5 выглядит существенно сильнее по крайней мере в одном важном бенчмарке интерактивного рассуждения, но широта этого выигрыша на несвязанных задачах остаётся открытым вопросом.
База доказательств здесь уже, чем может показаться по заголовку. Вся картина строится на материале The Decoder, опирающемся на результаты ARC Prize. В предоставленных материалах нет прямой технической публикации Anthropic, объясняющей изменения модели, методы обучения или условия оценки.
Из репортажа относительно надёжно выглядят несколько фактов: Claude Opus 5 набрал 30,2 % на ARC-AGI-3; предыдущий лучший результат GPT-5.6 Sol (Max) составлял 7,8 %; и ARC Prize опубликовала результаты, повторы и код бенчмарка. Это факты, сообщённые бенчмарком и переданные The Decoder.
Другие важные пункты — это интерпретации, а не установленные причины. Идея о том, что лидерство отражает «действительно лучшее рассуждение», — это оценка ARC Prize. Предположение, что прирост объясняется целевой разметкой данных или reinforcement learning, — это анализ The Decoder о вероятных причинах, а не подтверждённое раскрытие от Anthropic. Аналогично, опасение, что публичные форматы бенчмарков могут поощрять оптимизацию под конкретную задачу, — разумная методологическая осторожность, но не доказательство переобучения или загрязнения данных.
Покупателям и разработчикам также стоит помнить, что победы в бенчмарках напрямую не равны эффективности в продакшене. Модель может лидировать на ARC-AGI-3 и при этом уступать по задержке, стоимости, использованию инструментов, управляемости или требованиям интеграции, важным в реальной эксплуатации. The Decoder отмечает, что Claude Opus 5 повторил прежние лучшие результаты на ARC-AGI-1 и ARC-AGI-2 при несколько более высокой стоимости — напоминание о том, что способности и эффективность не всегда растут вместе.
Для команд, создающих ИИ-агентов, результат Claude Opus 5 важнее всего как сигнал об автономном восстановлении в незнакомых рабочих процессах. Если модель лучше выводит скрытые правила и корректирует стратегию на ходу, это может улучшить продукты для помощи в программировании, автоматизации браузера, извлечения данных и корпоративные ИИ-системы, которым приходится работать с хрупкими интерфейсами.
Для продуктовых команд, сравнивающих Anthropic с OpenAI, прямой разрыв в бенчмарке относительно GPT-5.6 Sol обострит вопросы выбора модели. Но правильный вывод — не просто менять поставщика по одному скору. Командам следует тестировать Claude Opus 5, GPT-5.6 Sol и альтернативы вроде Kimi K3 на собственных сценариях отказов: долгосрочных задачах, двусмысленных инструкциях, ошибках инструментов и новых пограничных случаях.
Для корпоративных покупателей ИИ спор о harness тоже важен. Многие коммерческие внедрения опираются на слои оркестрации, retrieval, внешнюю память и оболочки инструментов. Акцент ARC-AGI-3 на «чистой» способности модели полезен, потому что он изолирует саму модель, но производственные системы почти никогда так не работают. Высокий сырой скор не отменяет необходимости в защитных механизмах, мониторинге и оценке под конкретные рабочие процессы.
Ещё одно стратегическое следствие — конкурентное. Если Anthropic сможет снова и снова показывать успехи в интерактивном рассуждении, а не только в качестве диалога, это укрепит позиции компании в программировании, агентных рабочих процессах и высокодоверенных корпоративных задачах. Именно здесь лидерство в бенчмарках может влиять на выбор платформы, даже если абсолютные оценки всё ещё далеки от идеала.
Следующий сигнал, за которым стоит следить, — независимое воспроизведение. Исследователи захотят увидеть, подтверждают ли публичные повторы и код тезис о том, что Claude Opus 5 обнаруживает правила существенно иным способом, а не просто делает более удачные шаги поиска.
Во-вторых, следите за более широким переносом. Результаты на Witness и других частных или постоянно обновляемых бенчмарках будут важнее, чем ещё один прогон только на ARC-AGI-3. Если Claude Opus 5 покажет схожий прирост на задачах с другой механикой, аргумент в пользу реального улучшения рассуждения станет сильнее.
В-третьих, следите за раскрытиями Anthropic. Любые технические детали об изменениях в обучении, настройке reinforcement learning или курировании данных помогут рынку понять, произошёл ли скачок благодаря общему улучшению способностей или из-за подготовки именно под бенчмарк.
Наконец, следите за ответом конкурентов. OpenAI, ARC Prize и независимые оценщики, вероятно, будут испытывать всё большее давление с целью публиковать более сложные и динамичные тесты, по мере того как фронтирные лаборатории всё быстрее адаптируются к известным форматам бенчмарков.
Скор Claude Opus 5 на ARC-AGI-3 важен, потому что указывает на прогресс в категории способностей, которую индустрии трудно измерять чисто: адаптацию к незнакомым интерактивным задачам. Это более релевантно для реальных продуктов, чем многие насыщенные текстовые бенчмарки. Но этот результат следует читать как сильную точку данных, а не как вердикт о том, что «настоящий интеллект» уже решён.
Более глубокий урок связан с оценкой. По мере того как бенчмарки вроде ARC-AGI становятся важными целями, фронтирные лаборатории будут оптимизировать под них свои модели. Поэтому прозрачная отчётность, свежий дизайн тестов и перекрёстная проверка между бенчмарками становятся необходимыми. Для основателей и корпоративных команд практический вывод прост: воспринимайте Claude Opus 5 как новую убедительную опцию для агентных задач, но проверяйте его в своих средах, прежде чем считать скачок в бенчмарке истиной для продакшена.
Claude Opus 5 от Anthropic установил новый максимум ARC-AGI-3, вновь подняв вопросы о реальном росте способности к рассуждению versus оптимизация под бенчмарк.