
Британский AI Security Institute, или AISI, заявляет, что ведущие модели с открытыми весами сократили разрыв в кибер-возможностях с лучшими проприетарными AI-системами примерно до четырех–семи месяцев. Это меньший лаг, чем в начале 2025 года, и заметное предупреждение для команд безопасности, рассчитывающих на время для адаптации. По оценке AISI, такие модели, как GLM-5.2 и DeepSeek V4-Pro, теперь могут соответствовать уровням производительности, которых некоторые закрытые системы достигли лишь несколько месяцев назад, при этом обходясь гораздо дешевле в эксплуатации.
Это сочетание важно не только в контексте бенчмарков. Согласно анализу AISI, более дешевые открытые модели со скачиваемыми весами снижают практические барьеры для масштабирования наступательных кибер-рабочих процессов, а также усложняют внедрение средств безопасности на стороне провайдера. Для разработчиков и корпоративных покупателей отчет обостряет напряжение, которое давно определяет дискуссию об открытых моделях: те же свойства, которые делают open-weight-системы привлекательными для частного развертывания и настройки, могут одновременно усложнять сдерживание злоупотреблений.
AISI заявил, что это его первая публичная оценка того, насколько ведущие модели с открытыми весами отстают от лидирующих закрытых моделей в задачах, связанных с кибербезопасностью. Институт использовал два метода оценки.
Первый, называемый Narrow Cyber Tasks, охватывает 70 задач четырех уровней сложности. Согласно материалу The Decoder о выводах AISI, эти задачи включают исследование уязвимостей, обратную разработку, веб-эксплуатацию и криптографию. В этом бенчмарке AISI обнаружил, что GLM-5.2, выпущенная в июне 2026 года, показала результаты примерно на уровне Opus 4.6 от февраля 2026 года, что указывает на разрыв около четырех месяцев. DeepSeek V4-Pro, в свою очередь, как сообщается, работала примерно на уровне Opus 4.5, который AISI относит к ноябрю 2025 года.
Второй метод, Cyber Ranges, проверяет более автономное поведение в смоделированных сетях, а не на изолированных задачах. Один из сценариев, «The Last Ones», моделирует многошаговую атаку на корпоративную сеть с четырьмя подсетями и примерно 20 хостами. AISI оценил, что человеку-эксперту потребуется около 20 часов, чтобы завершить это упражнение.
Результаты там были менее благоприятны для открытых моделей, но все же указывали на быстрое сближение. AISI сообщил, что GLM-5.2 в симулированной среде показала себя примерно на уровне Opus 4.5, а DeepSeek V4-Pro оказалась ниже Sonnet 4.5. Институт назвал доказательную силу Cyber Ranges более слабой, чем у Narrow Cyber Tasks, поскольку она опирается на меньшее число сценариев и может отражать ограничения в долгосрочном планировании, а не чисто киберзнания.
Это различие важно. Для покупателей решений безопасности практический риск — не только в том, может ли модель решить запрос на обратную разработку, но и в том, может ли она удерживать сложную последовательность действий в шумной среде. Похоже, AISI говорит, что важны обе способности, а разрыв между открытыми и закрытыми моделями может зависеть от того, какой именно тип работы измеряется.
Опубликованные AISI данные по стоимости, пожалуй, наиболее значимая с операционной точки зрения часть релиза. По данным института, тест Cyber Ranges на 100 миллионов токенов стоил около 85 долларов при использовании Opus 4.5 или Opus 4.6, около 46 долларов при использовании GLM-5.2 и всего 1,19 доллара при использовании DeepSeek V4-Pro.
Также были приведены оценки стоимости на задачу для надежно решенных задач. Opus 4.6 обошлась примерно в 15 долларов за задачу, GLM-5.2 — примерно в 6 долларов, Opus 4.5 — около 12,50 доллара, а DeepSeek V4-Pro — около 0,28 доллара.
Эти цифры не равны реальной стоимости атаки, и AISI не утверждал обратного. Но они показывают, что «достаточно хорошая» кибер-производительность может становиться гораздо дешевле в доступе, особенно в сочетании с вариантами открытого развертывания. Для защитников это означает, что угроза не сводится к вопросу о том, совпадают ли open models с нынешним фронтиром один в один. Если старые или чуть более слабые возможности можно запускать очень дешево и в больших объемах, это все равно может изменить экономику атакующего.
Вот почему отчет важен не только для исследований в области безопасности, но и для корпоративного ИИ. Многие организации, оценивающие модели с открытыми весами, сосредотачиваются на конфиденциальности, суверенитете и более низкой стоимости инференса. Выводы AISI показывают, что им также нужно думать о рисках двойного назначения: модель, привлекательная для внутреннего кодинга, автоматизации или поддержки red team, может иметь свойства безопасности, резко отличающиеся от закрытых API-альтернатив.
Самый жесткий вывод AISI касается не сырой производительности, а контроля. Институт заявил, что меры безопасности у протестированных открытых моделей в основном были неэффективны. В одном примере, цитируемом The Decoder, DeepSeek V4-Pro иногда отказывала в запросах на обратную разработку, но повторная попытка позволяла обойти ограничение.
Эта слабость не подается как недостаток, уникальный для одной модели. Более широкий вывод AISI носит структурный характер: такие меры, как мониторинг, классификаторы, ограничение скорости и ограничения для пользователей, зависят от контроля доступа к системе. Как только веса публикуются, этот контроль слабеет или исчезает. Копии можно запускать приватно, модифицировать или распространять вне досягаемости первоначального разработчика.
AISI, как сообщается, описывает это как «постоянный и необратимый риск злоупотребления». Это более жесткая формулировка, чем обычное предупреждение в model card, и она помогает понять, почему институт рассматривает сокращение разрыва как проблему политики и времени для обороны, а не просто как обновление лидерборда.
В то же время отчет не отвергает открытые модели полностью. AISI также признает практические преимущества open-weight-развертывания: частный хостинг, меньшую зависимость от вендора, настройку под себя и сниженный риск того, что провайдер изменит условия доступа или отключит сервис. Для многих компаний это реальные преимущества. Политическая проблема в том, что та же децентрализация, которая делает открытые модели привлекательными для покупателей, одновременно ослабляет централизованный контроль над вредным использованием.
Ключевые выводы этой истории основаны на оценке AISI, как ее изложил The Decoder; второй источник, Tech Times, по всей видимости, отражает ту же базовую оценку, не добавляя существенных деталей. Это означает, что основа доказательств здесь — журналистский пересказ институционального анализа, а не полный публичный документ, воспроизведенный в наборе источников.
Есть несколько важных оговорок. Во-первых, AISI сказал, что результаты Cyber Ranges являются более слабым доказательством, поскольку они получены на меньшем числе тестовых случаев. Во-вторых, институт также отметил, что оценки могут немного недооценивать лучшие возможности открытых моделей, поскольку эти системы не были специально донастроены под тесты. В-третьих, симулированные сетевые среды не включают активных защитников и всей сложности реальных организаций.
Эти ограничения работают в разных направлениях. Сторонники open models могут утверждать, что заявленный разрыв завышает преимущество закрытых систем, если лучшие промпты или тюнинг улучшили бы результаты. С другой стороны, практики безопасности могут возразить, что симуляции недооценивают реальное сопротивление атакующим, потому что производственные сети защищены, мониторятся и непоследовательны.
За заголовками стоит и вопрос дизайна бенчмарков. Модель, которая хорошо показывает себя в Narrow Cyber Tasks, все равно может провалиться в реальной многоэтапной атаке, если потеряет нить плана, неверно использует инструменты или накапливает ошибки. И наоборот, модель, которая с трудом справляется с длинным автономным сценарием, все еще может быть очень полезной для человека-оператора, разбивающего работу на более мелкие шаги. Сам AISI, похоже, признает это различие.
Для разработчиков ИИ отчет указывает на меняющуюся базовую планку. Если open-weight-системы вроде GLM-5.2 и DeepSeek V4-Pro могут приблизиться к недавней кибер-производительности закрытых моделей при значительно более низкой стоимости, продуктовые команды, создающие ассистенты программирования, автоматизацию безопасности или рабочие процессы AI-агентов, получат больше вариантов развертывания — но и больше ответственности за то, как эти системы ограничиваются, наблюдаются и сегментируются.
Для компаний практический вывод не в том, чтобы «избегать открытых моделей», а в том, чтобы «разделять решения о стоимости и решения о риске». Запуск открытой модели в контролируемой внутренней среде по-прежнему может иметь смысл, особенно там, где важны локализация данных и приватный инференс. Но командам безопасности могут понадобиться более жесткие локальные меры контроля, более узкий доступ к инструментам, более подробное журналирование и более четкая внутренняя политика использования, чем при работе с размещенным API.
Для киберрынка тайминг, который предлагает AISI, может быть самым важным стратегическим сигналом. Институт видит разрыв между закрытыми и открытыми моделями как временное окно подготовки, в течение которого защитники, использующие более сильные системы, могут адаптироваться до того, как сопоставимые возможности станут широко доступными для скачивания. Если это окно теперь составляет четыре–семь месяцев вместо шести–десяти, дорожные карты по engineering detection, red teaming и мониторингу злоупотреблений, возможно, придется ускорить.
Отчет также выходит на фоне быстрого движения в верхнем сегменте рынка моделей. AISI заявил, что закрытые модели, включая Mythos Preview и GPT-5.5, показали одни из самых больших приростов в AI-кибервозможностях с момента начала тестирования. Британский National Cyber Security Centre отдельно предупреждал, что среда киберугроз быстро меняется. Даже если открытые модели не сразу воспроизводят каждый скачок фронтира, темпы распространения, похоже, ускоряются.
Один из немедленных сигналов — запланированное AISI тестирование Kimi-K3, для которого, как пишет The Decoder, открытые веса, вероятно, будут выпущены в конце июля. По сообщениям, AISI считает, что текущие бенчмарки кодинга указывают: Kimi-K3 может приблизиться к нынешним фронтирным моделям, хотя, возможно, будет стоить дороже других открытых моделей.
Помимо этого конкретного релиза, важны три вещи. Во-первых, покажут ли будущие оценки Cyber Ranges, что открытые модели улучшаются в долгосрочной автономности, а не только в узкой компетентности. Во-вторых, будут ли компании внедрять более строгие локальные модели управления для open-weight-развертывания вместо того, чтобы предполагать, что привычки безопасности эпохи провайдеров по-прежнему применимы. В-третьих, смогут ли поставщики закрытых моделей сохранить значимое преимущество в кибер-производительности, или же фронтирные достижения продолжат распространяться в скачиваемые системы в течение месяцев.
Заметная часть этого вывода AISI не просто в том, что открытые модели улучшаются. Она в том, что лаг, похоже, сжимается, а экономика инференса улучшается еще быстрее. На практике это означает, что рынку, возможно, не требуется точный паритет с фронтиром, чтобы открытые модели стали стратегически важными в кибер-рабочих процессах. «Достаточно близко, достаточно дешево и достаточно неконтролируемо» — это уже серьезный порог.
Для продуктовых команд и покупателей урок в том, чтобы рассматривать внедрение open-weight как решение по инфраструктуре и управлению, а не только как вопрос качества модели. Те же факторы, которые подталкивают интерес к автономии корпоративного ИИ — частный хостинг, более низкая стоимость и свобода от vendor lock-in — одновременно ослабляют унаследованные допущения о безопасности. По мере того как модели вроде GLM-5.2, DeepSeek V4-Pro и, возможно, Kimi-K3 сокращают разрыв, истинное отличие может сместиться от сырой способности к тому, кто сможет развернуть их с надежным контролем над инструментами, данными и злоупотреблениями.
AISI сообщает, что модели с открытыми весами теперь отстают от лучших закрытых AI-систем для киберзадач всего на 4–7 месяцев, а преимущество защитников сокращается на фоне резкого падения затрат.