Google DeepMind testa benchmarks de IA em dupla ocultação para enfrentar problemas de confiança na avaliação

A Google DeepMind está testando um benchmark protegido criptograficamente em dupla ocultação para o Gemini Flash Lite, com o objetivo de reduzir a contaminação e reconstruir a confiança nas avaliações de IA.

AI News

As pontuações de benchmarks de IA estão cada vez mais difíceis de interpretar quando os desenvolvedores do modelo podem ter visto prompts de avaliação ou quando dados de teste podem entrar nos pipelines de treinamento. A Google DeepMind está testando agora uma avaliação em dupla ocultação, protegida criptograficamente, projetada para impedir que ambos os lados desse processo acessem as informações sensíveis um do outro.

O piloto, conduzido com o Singapore AI Safety Institute e outros parceiros, usa um modelo da linha Gemini Flash Lite contra benchmarks confidenciais. A Google afirma que a abordagem tem a intenção de evitar a contaminação de benchmarks, ao mesmo tempo em que permite que avaliadores independentes testem um modelo proprietário sem receber seus pesos.

O projeto importa porque os resultados de benchmarks influenciam a seleção de modelos, alegações de pesquisa, decisões de compra e supervisão de segurança. Mas as evidências disponíveis atualmente cobrem o método de avaliação, não um novo resultado de desempenho do modelo. Não há pontuação reportada nem avaliação independente sobre se o sistema melhora a precisão medida.

O que a Google está testando

De acordo com a reportagem do The Decoder, a Google DeepMind está usando o Confidential Space da Google Cloud para criar um ambiente protegido para o piloto. O arranjo foi projetado para manter os prompts de teste externos ocultos da Google e, ao mesmo tempo, impedir que avaliadores inspecionem os pesos do modelo Gemini.

A ideia central é uma troca em dupla ocultação. Uma organização de avaliação fornece perguntas ou tarefas sem expô-las ao fornecedor do modelo. O fornecedor disponibiliza o modelo para teste sem transferir os pesos subjacentes. Controles criptográficos então verificam se os componentes acordados estão em execução no ambiente pretendido.

A Google descreve isso como a primeira avaliação em dupla ocultação de um modelo proprietário de IA de fronteira, embora essa caracterização seja uma alegação da empresa relatada pelo The Decoder, e não uma constatação da indústria estabelecida de forma independente. O modelo do piloto é o Gemini Flash Lite, mas a fonte disponível não especifica qual versão, as tarefas do benchmark, o tamanho do teste ou os resultados finais.

A base técnica é o Confidential Space, parte do portfólio de computação confidencial da Google. Em princípio, a computação confidencial pode usar proteções apoiadas por hardware e atestação para limitar o que os operadores podem ver dentro de uma carga de trabalho protegida. Neste caso, o objetivo é criar uma separação verificável entre o modelo e os dados de avaliação.

Por que a contaminação de benchmarks importa

Um benchmark é mais útil quando suas perguntas são novas para o sistema que está sendo testado. Se prompts ou respostas apareceram nos dados de treinamento, ou se um modelo foi ajustado especificamente para o teste, uma pontuação alta pode refletir exposição prévia em vez de ampla capacidade de raciocínio ou execução de tarefas.

Esse problema é comumente chamado de contaminação de benchmark. Ele pode surgir acidentalmente por meio de conjuntos de dados públicos, treinamento em escala da web ou testes internos repetidos. Também pode se tornar uma preocupação estratégica quando um benchmark é amplamente discutido e os desenvolvedores de modelos têm tempo para otimizar contra ele.

O próprio processo de avaliação cria outro risco. Organizações externas podem hesitar em fornecer prompts sensíveis a uma empresa de modelos porque isso poderia expor dados proprietários, informações governamentais ou material de teste de cibersegurança. Já os desenvolvedores de modelos geralmente não querem entregar pesos que representem propriedade intelectual valiosa.

O The Decoder descreveu salvaguardas convencionais, como acordos de zero logging e restrições contratuais, mas a Google argumenta que a proteção criptográfica adiciona uma camada técnica mais forte. O sistema proposto não elimina a necessidade de confiar em software, hardware e procedimentos operacionais. Em vez disso, ele pretende reduzir a quantidade de confiança colocada em qualquer participante individual.

Evidências, alegações e limites restantes

As alegações mais fortes na cobertura disponível vêm da descrição do piloto pela Google DeepMind. A Google diz que seu método pode manter as perguntas de teste longe do fornecedor e os pesos do modelo longe do avaliador, ao mesmo tempo em que ajuda a impedir que um modelo use perguntas confidenciais para otimizar um teste específico.

Esses são objetivos de projeto, não resultados verificados de forma independente no material disponível para esta reportagem. O The Decoder informa que a Google publicou detalhes metodológicos e resultados em um relatório técnico, mas as evidências fornecidas não incluem as conclusões desse relatório nem uma auditoria externa da implementação.

O uso do Gemini Flash Lite também limita o que pode ser inferido. Ele pode demonstrar que a configuração de avaliação funciona com um modelo proprietário, mas não estabelece que todo modelo de fronteira, tipo de benchmark ou ambiente de implantação possa usar o mesmo processo a um custo e velocidade razoáveis.

Várias questões práticas permanecem em aberto. As fontes não dizem quanto tempo as execuções de avaliação levam, qual sobrecarga de computação o Confidential Space introduz, como as falhas são tratadas ou como os avaliadores verificam se o modelo testado é exatamente o modelo pretendido. Elas também não explicam como o método lida com vazamento de dados antes ou depois da execução protegida.

Implicações para construtores de IA e empresas

Para pesquisadores de IA, um fluxo de trabalho em dupla ocultação bem-sucedido poderia facilitar a realização de avaliações independentes sem forçar uma escolha entre dados de teste sensíveis e pesos proprietários. Isso seria especialmente relevante para avaliações de cibersegurança, testes governamentais e outras avaliações que envolvem informações restritas.

Para fornecedores de modelos, a abordagem pode oferecer uma forma de obter resultados externos confiáveis enquanto limita a exposição de seus sistemas. Ela também pode reduzir disputas sobre se um fornecedor viu prompts de teste antes de uma avaliação. No entanto, controles criptográficos por si só não garantem que um benchmark meça uma capacidade útil, evite um design de tarefa ruim ou preveja desempenho em produção.

Compradores corporativos poderiam se beneficiar se organizações de avaliação começarem a publicar resultados de testes protegidos mais comparáveis entre fornecedores. Uma equipe de compras pode dar mais peso a avaliações administradas de forma independente do que a pontuações geradas por um desenvolvedor de modelo usando procedimentos não divulgados.

A questão comercial é se o método se tornará prático além de um piloto. Execução segura, atestação, reprodutibilidade e acesso para auditoria podem adicionar complexidade operacional. Grupos de pesquisa menores podem não ter a infraestrutura ou o financiamento para executar o mesmo processo, potencialmente concentrando avaliações de alta confiança entre grandes provedores de nuvem e de modelos.

O que observar em seguida

O próximo sinal importante é o nível de detalhe do relatório técnico. Construtores e avaliadores devem procurar uma descrição da arquitetura criptográfica, do processo de atestação, da política de logging, das verificações de identidade do modelo e dos modos de falha.

A replicação independente será mais importante do que o anúncio em si. Evidências do Singapore AI Safety Institute ou de outras organizações participantes podem esclarecer se o procedimento realmente impede o acesso do fornecedor aos prompts na prática e se o avaliador pode confirmar que os pesos do modelo permanecem protegidos.

Resultados de famílias adicionais de modelos e benchmarks mais sensíveis também mostrarão se o método é um padrão geral de avaliação ou uma demonstração de escopo restrito. Custo, latência e requisitos de acesso determinarão se ele pode ser usado rotineiramente em vez de apenas para testes de alto perfil.

Perspectiva da Creati.ai

O piloto da Google DeepMind aborda uma fraqueza real no benchmarking de IA: os participantes muitas vezes precisam confiar uns nos outros para não inspecionar, reter ou otimizar contra material de avaliação sensível. Mover parte dessa confiança para controles técnicos verificáveis é uma direção útil, especialmente para avaliações de segurança e governamentais.

Mas o anúncio deve ser lido como um experimento de infraestrutura de avaliação, não como prova de que as pontuações de benchmark agora são confiáveis. O valor da abordagem dependerá de auditorias independentes, protocolos transparentes e evidências de que testes protegidos mudam a qualidade das decisões tomadas por pesquisadores, empresas e reguladores.

Anúncios