AI News

Anthropic делает существенное заявление о безопасности ИИ-агентов: согласно материалу The Decoder, ссылающемуся на system card Anthropic, связка Claude Opus 5 и фирменного Auto Mode снизила успех атак browser-based prompt injection до 0% в 129 тестовых сценариях. Если этот результат подтвердится за пределами собственной оценочной среды Anthropic, это станет заметным шагом вперёд в одной из самых трудных проблем безопасности агентов.

Эта новость важна, потому что prompt injection стала ключевым препятствием для внедрения ИИ-агентов, которые просматривают веб, читают документы и совершают действия от имени пользователя. В таких атаках вредоносные инструкции скрываются внутри веб-страниц или другого внешнего контента, и модель следует указаниям атакующего, а не намерению разработчика или пользователя. OpenAI в декабре, как цитирует The Decoder, заявила, что prompt injection, возможно, никогда не будет решена полностью. На этом фоне сообщённый Anthropic результат выделяется не как очередное обновление модели, а как тест того, могут ли многоуровневые защиты сделать браузерную автоматизацию заметно безопаснее.

Что, по словам Anthropic, достиг Opus 5

Согласно сообщению The Decoder о system card Anthropic, показатель успеха атак на браузер в 0% был зафиксирован, когда Claude Opus 5 использовался с Auto Mode в продуктах Anthropic, таких как Claude Cowork. Сообщённая оценка охватывала 129 тестовых сценариев браузерного агента.

Различие между самой моделью и полным продуктовым стеком — центральный момент этой истории. The Decoder сообщает, что Claude Opus 5 сам по себе не достиг нуля: без дополнительных защитных слоёв Auto Mode браузерная prompt injection проходила в 3,7% случаев. В том же материале говорится, что Sonnet 5 по этому более узкому показателю показал себя лучше Opus 5 — 0,93%. Иными словами, Anthropic не утверждает, что базовая модель в одиночку решила проблему. Более сильное заявление состоит в том, что это сделала комбинация модели и runtime-защит.

Это важно для того, как покупатели и разработчики должны читать объявление. Безопасность ИИ-агентов всё чаще становится проблемой системы, а не только модели. Браузерный агент сталкивается с недоверенным контентом, многошаговыми задачами и правами на выполнение действий. Модель может лучше игнорировать вредоносный текст, но если окружающий её продукт слишком легко выполняет опасные команды, система остаётся уязвимой.

Почему браузерная prompt injection — такая сложная проблема безопасности

Prompt injection часто описывают как эквивалент атак на LLM через недоверенный ввод, но браузерные агенты усугубляют проблему, потому что работают с живыми веб-страницами, которые могут содержать любой текст, скрытые элементы или инструкции, созданные для манипуляции моделью. Если агент может нажимать, копировать, отправлять формы, получать доступ к коннекторам или обрабатывать чувствительные данные, успешная prompt injection может означать не просто плохой ответ. Это может привести к утечке данных или нежелательным действиям.

Именно поэтому этот результат, если он воспроизводим, имеет более широкое значение для корпоративного ИИ и ИИ-агентов. Многие из самых привлекательных сценариев автоматизации связаны с навигацией по SaaS-инструментам, внутренним порталам, консольным системам поддержки и публичным веб-сайтам. Это именно те среды, где могут появляться скрытые или враждебные инструкции.

The Decoder называет браузерную prompt injection крупнейшей уязвимостью безопасности, нависающей над ИИ-агентами, и эта оценка отражает текущие опасения рынка. Основатели, создающие агентные продукты, и корпоративные команды безопасности, которые их оценивают, вынуждены относиться к любому автономному браузерному поведению с осторожностью. Вопрос был не в том, полезны ли модели, а в том, можно ли доверять им рядом с враждебным контентом.

Подход к безопасности, похоже, многоуровневый, а не только на уровне модели

Сообщённый результат нулевого успеха зависел от Auto Mode, который, по словам The Decoder, добавляет два независимых защитных слоя поверх Claude Opus 5. Один слой сканирует входящий контент на скрытые инструкции до того, как модель его обработает. Второй слой блокирует опасные действия до исполнения. Как описано, атакующему нужно отдельно преодолеть оба барьера.

Такая архитектура значима, потому что соответствует тому, как команды безопасности обычно снижают риск высокоопасных угроз: изолируют рискованные входные данные, классифицируют подозрительный контент и ограничивают выполнение действий. На практике это означает, что Anthropic, похоже, рассматривает prompt injection не как чистый сбой рассуждения, а как сквозную проблему безопасности продукта.

Для разработчиков это имеет немедленное значение. Команды, выпускающие браузерную автоматизацию, не должны считать, что одного более сильного frontier-моделя достаточно. Им могут понадобиться фильтры предварительной обработки, policy engines, уровни подтверждения действий и более жёсткая песочница вокруг рабочих процессов. Сообщённый Anthropic результат указывает на то, что защитный стек может существенно превосходить модель в изоляции.

Упоминание Claude Cowork также намекает, где Anthropic видит коммерческую значимость. Продуктам, которые действуют от имени специалистов умственного труда, особенно прямо в браузере, нужна не просто высокая оценка в бенчмарках. Им нужны механизмы контроля, которые убеждают предприятия, что система не будет следовать скрытому тексту на случайной веб-странице.

Доказательства, бенчмарки и что остаётся непроверенным

Самые сильные заявления здесь связаны с вендором, и их следует так и читать. The Decoder приписывает ключевые цифры собственной system card Anthropic. Следовательно, показатель успеха 0% в 129 сценариях браузерных агентов — это оценочный результат, сообщённый самим вендором, а не независимая сертификация третьей стороной.

The Decoder также ссылается на отдельный общий тест prompt injection от компании Gray Swan. В этом тесте после 15 попыток атаки сообщённый показатель успеха снизился с 5,5% для Opus 4.8 до 2,0% для Claude Opus 5. Эта цифра Gray Swan полезна, потому что указывает на улучшение не только в конкретной браузерной конфигурации, но это всё равно лишь один бенчмарк, а не всеобъемлющее доказательство надёжности.

Не менее важно и то, что детали самого материала ограничивают общий вывод. Сообщённый нулевой показатель относится к браузерным агентам с включённым Auto Mode, а не ко всем сценариям использования Claude Opus 5. Без этих защит, по словам The Decoder, показатель успешности атак составлял 3,7%. Это намного лучше, чем могли бы ожидать многие наблюдатели, но это не ноль. Кроме того, это означает, что сравнение моделей сложнее, чем кажется по заголовку: Sonnet 5, как сообщается, показал себя лучше Opus 5 по браузерному показателю без Auto Mode, хотя заголовок сосредоточен на Opus 5.

Отсутствует внешняя валидация. Исходный материал не даёт независимого воспроизведения в открытых red-team средах, клиентских развёртываниях или длительных реальных браузерных сессиях. Он также не уточняет точный состав 129 сценариев, разнообразие атак или то, как именно определялся успех — узко или широко. Эти пробелы не опровергают результат, но означают, что покупателям следует воспринимать его как многообещающее свидетельство, а не как окончательно установленный факт.

Что это значит для разработчиков и корпоративных покупателей

Для команд, создающих продукты-помощники для кодинга, инструменты автоматизации работы или внутренних ИИ-агентов, практический вывод таков: архитектура развёртывания может быть не менее важна, чем выбор модели. Сообщённые Anthropic цифры указывают на то, что обёртывание модели проверкой контента и контролем действий может резко снизить успешность эксплуатации в браузерных задачах.

Это также имеет закупочные последствия для покупателей корпоративного ИИ. Поставщикам, продающим браузерных агентов, всё чаще придётся объяснять не только, какую LLM они используют, но и как они проверяют веб-страницы, изолируют system prompts, ограничивают инструменты и блокируют рискованные действия. Покупателю, сравнивающему Claude Opus 5, Sonnet 5 или конкурирующие модели OpenAI, понадобятся ответы по безопасности на уровне продукта, а не только графики бенчмарков.

Это также меняет конкурентную рамку. Если Anthropic сможет показать, что Claude Opus 5 и Auto Mode сохраняют устойчивость в более широких независимых тестах, это может усилить её позиционирование в чувствительных корпоративных ИИ-внедрениях, где надёжность и сдерживание важнее эффектных демонстраций. Рынок ИИ-агентов движется от «может ли он выполнить задачу?» к «может ли он безопасно выполнить задачу на хаотичных, враждебных входных данных?»

На что смотреть дальше

Следующий сигнал, за которым стоит следить, — независимое тестирование. Если security-компании помимо Gray Swan опубликуют воспроизводимые оценки Claude Opus 5, Auto Mode и Claude Cowork в реальных браузерных условиях, это скажет больше, чем любая отдельная vendor system card.

Второй сигнал — масштаб продукта. Сообщённый Anthropic результат касается сценариев браузерных агентов. Покупателям стоит смотреть, распространяются ли подобные защиты на обработку документов, электронную почту, инструменты, подключённые через API, и многоагентные рабочие процессы, где prompt injection может приходить по другим каналам.

В-третьих, будет полезно отслеживать, ответят ли конкуренты напрямую. OpenAI публично признала глубину проблемы prompt injection, и другие агентные платформы находятся под тем же давлением. Если подход Anthropic окажется устойчивым, многоуровневые защиты могут стать базовым ожиданием для ИИ-агентов, а не конкурентным отличием.

Наконец, важнее всего — поделится ли Anthropic дополнительными подробностями о дизайне тестов: таксономией атак, определениями отказа, ложноположительными срабатываниями фильтров и компромиссами Auto Mode в удобстве использования. Защиты, которые блокируют атаки, но при этом замедляют или чрезмерно ограничивают автоматизацию, всё ещё сложно коммерчески внедрять.

Взгляд Creati.ai

Самая интересная часть этой истории — не заголовочная цифра, а архитектура, стоящая за ней. Anthropic, похоже, показывает, что защита от prompt injection для ИИ-агентов достижима как дисциплина уровня продукта, даже если на чистом уровне модели она остаётся нерешённой. Это более реалистичный путь для рынка. Компании не покупают «голые» модели для браузерной автоматизации; они покупают системы.

И всё же это ещё не решённая проблема. Доступные здесь доказательства ограничены, а самый сильный результат — собственный результат Anthropic. Но для разработчиков ИИ-агентов и корпоративных ИИ-платформ вывод очевиден: перестаньте считать prompt injection абстрактной исследовательской задачей и начните проектировать системы с многоуровневыми контролями, наблюдаемыми действиями и явными границами доверия. Если Claude Opus 5 и Auto Mode выдержат внешнюю проверку, они могут обозначить момент, когда безопасная браузерная автоматизация станет выглядеть не экспериментально рискованной, а операционно правдоподобной.

Рекомендуемые

Anthropic заявила, что Claude Opus 5 с Auto Mode свёл успех браузерных prompt injection к нулю в внутренних тестах агентов

Anthropic утверждает, что Claude Opus 5 и Auto Mode снизили успех браузерных prompt injection до нуля во внутренних тестах — заметное заявление для ИИ-агентов.