Google DeepMind тестирует криптографически защищённый двойной слепой бенчмарк для Gemini Flash Lite, стремясь снизить загрязнение данных и восстановить доверие к оценкам ИИ.

Оценки в AI-бенчмарках всё труднее интерпретировать, когда разработчики моделей могли видеть оценочные промпты или когда тестовые данные могут попадать в обучающие пайплайны. Google DeepMind теперь тестирует криптографически защищённую двойную слепую оценку, призванную не допустить доступа обеих сторон этого процесса к чувствительной информации друг друга.
Пилот, проводимый с Singapore AI Safety Institute и другими партнёрами, использует модель из линейки Gemini Flash Lite против конфиденциальных бенчмарков. Google говорит, что подход предназначен для предотвращения загрязнения бенчмарков, при этом позволяя независимым оценщикам тестировать проприетарную модель, не получая её веса.
Проект важен, потому что результаты бенчмарков влияют на выбор модели, исследовательские заявления, закупочные решения и надзор за безопасностью. Но имеющиеся на данный момент доказательства касаются метода оценки, а не нового результата по производительности модели. Нет опубликованного результата или независимой оценки того, улучшает ли система измеряемую точность.
Согласно материалу The Decoder, Google DeepMind использует Confidential Space от Google Cloud для создания защищённой среды для пилота. Эта схема предназначена для того, чтобы скрыть внешние тестовые промпты от Google и одновременно не позволить оценщикам просматривать веса модели Gemini.
Ключевая идея — двойной слепой обмен. Организация, проводящая оценку, предоставляет вопросы или задачи, не раскрывая их поставщику модели. Поставщик делает модель доступной для тестирования, не передавая исходные веса. Затем криптографические механизмы проверяют, что согласованные компоненты работают в предполагаемой среде.
Google называет это первой двойной слепой оценкой проприетарной frontier AI-модели, хотя такая характеристика — это заявление компании, переданное The Decoder, а не независимо подтверждённый отраслевой факт. Пилотная модель — Gemini Flash Lite, но доступный источник не уточняет ни версию, ни задания бенчмарка, ни размер теста, ни итоговые результаты.
Техническая основа — Confidential Space, часть портфеля confidential computing у Google. В принципе, confidential computing может использовать аппаратно поддерживаемую защиту и аттестацию, чтобы ограничить, что операторы могут видеть внутри защищённой рабочей нагрузки. В данном случае цель — создать проверяемое разделение между моделью и оценочными данными.
Бенчмарк наиболее полезен, когда его вопросы новы для тестируемой системы. Если промпты или ответы встречались в обучающих данных, или если модель специально настраивалась под тест, высокий результат может отражать прежнее знакомство, а не широкие способности к рассуждению или выполнению задач.
Эта проблема обычно называется загрязнением бенчмарков. Она может возникать случайно из-за публичных датасетов, обучения в масштабе интернета или повторных внутренних тестов. Она также может стать стратегической проблемой, когда бенчмарк широко обсуждается и у разработчиков моделей есть время оптимизироваться под него.
Сам процесс оценки создаёт ещё один риск. Внешние организации могут не захотеть предоставлять чувствительные промпты компании-разработчику модели, поскольку это может раскрыть проприетарные данные, правительственную информацию или материалы для тестирования кибербезопасности. Разработчики моделей, в свою очередь, обычно не хотят передавать веса, представляющие ценную интеллектуальную собственность.
The Decoder описывал традиционные меры защиты, такие как соглашения о нулевом логировании и договорные ограничения, но Google утверждает, что криптографическая защита добавляет более сильный технический уровень. Предлагаемая система не устраняет необходимость доверять программному обеспечению, оборудованию и операционным процедурам. Скорее, она стремится уменьшить объём доверия, возлагаемого на любого отдельного участника.
Самые сильные заявления в доступной публикации исходят из описания пилота со стороны Google DeepMind. Google говорит, что его метод может удерживать тестовые вопросы от поставщика и веса модели от оценщика, а также помогать предотвращать использование моделью конфиденциальных вопросов для оптимизации под конкретный тест.
Это цели дизайна, а не независимо проверенные результаты в материалах, доступных для этого отчёта. The Decoder сообщает, что Google опубликовала методологические детали и результаты в техническом отчёте, однако предоставленные доказательства не включают выводы этого отчёта или внешний аудит реализации.
Использование Gemini Flash Lite также ограничивает выводы. Это может показать, что схема оценки работает с проприетарной моделью, но не доказывает, что каждая frontier model, каждый тип бенчмарка или среда развёртывания могут использовать тот же процесс при разумных затратах и скорости.
Несколько практических вопросов остаются открытыми. Источники не сообщают, сколько времени занимают прогоны оценки, какой вычислительный оверхед вносит Confidential Space, как обрабатываются сбои и как оценщики проверяют, что тестируемая модель — именно та, которая была задумана. Они также не объясняют, как метод решает проблему утечки данных до или после защищённого запуска.
Для исследователей ИИ успешный двойной слепой рабочий процесс мог бы упростить проведение независимых оценок без необходимости выбирать между чувствительными тестовыми данными и проприетарными весами. Это было бы особенно важно для оценок кибербезопасности, правительственного тестирования и других проверок, связанных с ограниченной информацией.
Для поставщиков моделей этот подход может предложить способ получать убедительные внешние результаты, ограничивая при этом раскрытие своих систем. Он также может снизить споры о том, видел ли поставщик тестовые промпты до оценки. Однако криптографические меры сами по себе не гарантируют, что бенчмарк измеряет полезную способность, избегает плохого дизайна задач или предсказывает производительность в продакшене.
Корпоративные покупатели могут выиграть, если оценочные организации начнут публиковать результаты защищённых тестов, которые более сопоставимы между поставщиками. Закупочная команда может придавать больший вес независимо проведённым оценкам, чем результатам, полученным разработчиком модели по нераскрытым процедурам.
Коммерческий вопрос заключается в том, станет ли метод практичным за пределами пилота. Безопасное выполнение, аттестация, воспроизводимость и доступ для аудита могут добавить операционную сложность. Небольшие исследовательские группы могут не иметь инфраструктуры или финансирования для проведения того же процесса, что потенциально сосредоточит высокодоверительные оценки у крупных облачных и модельных провайдеров.
Следующий важный сигнал — уровень детализации технического отчёта. Разработчикам и оценщикам стоит искать описание криптографической архитектуры, процесса аттестации, политики логирования, проверок идентичности модели и режимов отказа.
Независимая репликация будет важнее самого объявления. Доказательства от Singapore AI Safety Institute или других участвующих организаций могли бы прояснить, действительно ли процедура на практике не даёт поставщику доступ к промптам и может ли оценщик подтвердить, что веса модели остаются защищёнными.
Результаты по дополнительным семействам моделей и более чувствительным бенчмаркам также покажут, является ли метод общим стандартом оценки или узко ограниченной демонстрацией. Стоимость, задержка и требования к доступу определят, можно ли использовать его регулярно, а не только для громких тестов.
Пилот Google DeepMind устраняет реальную слабость в AI-бенчмаркинге: участникам часто приходится доверять друг другу в том, что никто не будет просматривать, сохранять или оптимизировать под чувствительные оценочные материалы. Перенос части этого доверия в проверяемые технические механизмы — полезное направление, особенно для оценок безопасности и государственных проверок.
Но объявление следует воспринимать как эксперимент с инфраструктурой оценки, а не как доказательство того, что результаты бенчмарков теперь надёжны. Ценность подхода будет зависеть от независимых аудитов, прозрачных протоколов и доказательств того, что защищённое тестирование меняет качество решений, принимаемых исследователями, компаниями и регуляторами.