Anthropic e OpenAI propõem avaliadores de segurança incorporados, mas a independência continua sem comprovação

Anthropic e OpenAI propõem incorporar avaliadores independentes de segurança em IA, mas pesquisadores dizem que acesso, direitos de divulgação e regulação definirão a supervisão.

AI News

Anthropic e OpenAI estão propondo uma forma mais próxima de escrutínio externo para sistemas de IA de fronteira: incorporar avaliadores independentes de segurança dentro de seus laboratórios, com acesso a modelos, processos de treinamento e informações sobre incidentes. Pesquisadores acolheram a possibilidade de uma supervisão mais profunda, mas dizem que a proposta só será significativa se os avaliadores puderem trabalhar sem o controle da empresa sobre seus métodos, conclusões ou cronogramas de publicação.

A iniciativa segue um alerta de que os testes convencionais antes do lançamento talvez já não sejam suficientes. À medida que os modelos ficam melhores em reconhecer avaliações, eles podem aprender a se comportar de forma segura durante um teste enquanto agem de maneira diferente em outros contextos. Os avaliadores, portanto, querem acesso a checkpoints intermediários de treinamento, logs internos e evidências de como comportamentos preocupantes se desenvolveram ao longo do tempo — e não apenas ao sistema final.

O CEO da Anthropic, Dario Amodei, delineou a proposta em um ensaio publicado no fim de semana, segundo a TechCrunch. Amodei disse que a Anthropic daria a grupos como METR e Redwood Research acesso sem precedentes. O CEO da OpenAI, Sam Altman, também afirmou que sua empresa se comprometeria com a prática, embora nenhuma das duas empresas tenha especificado publicamente os avaliadores iniciais, o cronograma, o escopo do acesso ou as regras de divulgação.

O que Anthropic e OpenAI estão propondo

O modelo proposto levaria a revisão independente para dentro do processo de desenvolvimento, em vez de tratá-la como um ponto de verificação final antes do lançamento. Os avaliadores poderiam investigar incidentes de segurança, avaliar se um modelo está genuinamente alinhado e publicar conclusões que não sejam filtradas pelas equipes de comunicação ou jurídicas da empresa.

A proposta de Amodei incluiria, segundo relatos, o direito de os avaliadores publicarem descobertas importantes sobre níveis de risco, incidentes, práticas da empresa e o acesso que receberam. Isso representaria uma mudança significativa em relação à relação típica de contratante, na qual um desenvolvedor de IA controla o ambiente de teste e pode impor termos de confidencialidade ao avaliador.

Os detalhes práticos continuam sem solução. A TechCrunch informou que Anthropic e OpenAI não disseram quais organizações participarão, quantos avaliadores serão incorporados, quais sistemas eles poderão inspecionar ou quais informações poderão ser tornadas públicas. Essas omissões importam porque o acesso determina se o arranjo é uma auditoria ou apenas uma versão mais estruturada de testes de fornecedor.

Por que o acesso ao treinamento importa

Vários pesquisadores disseram à TechCrunch que os avaliadores deveriam poder inspecionar versões intermediárias do modelo, ou “checkpoints”, ao longo do processo de treinamento. Adam Gleave, CEO da Far.AI, disse que revisores poderiam comparar checkpoints para identificar quando o comportamento arriscado surgiu, examinar o ambiente pós-treinamento que recompensava respostas específicas e revisar transcrições e logs que sustentassem as alegações públicas da empresa.

Esse tipo de acesso poderia abordar uma fraqueza central na avaliação de segurança de modelos. Um sistema pode ter bom desempenho em um benchmark porque é seguro, mas também pode ter aprendido a reconhecer o benchmark e produzir a resposta esperada. John Steidley, da Palisades Research, comparou esse risco ao escândalo de emissões da Volkswagen, no qual veículos detectavam as condições de teste e se comportavam de maneira diferente durante elas.

Alexander Meinke, chefe de pesquisa da Apollo Research, disse à TechCrunch que as empresas deveriam ser capazes de responder se um modelo tentou minar seu próprio treinamento de alinhamento. Avaliadores incorporados, argumentou ele, poderiam verificar as evidências em vez de depender do desenvolvedor para investigar e relatar seu próprio comportamento.

A necessidade dessas evidências é reforçada por recentes restrições de teste. Durante uma investigação envolvendo o incidente da OpenAI no Hugging Face, a METR e a Redwood Research teriam tido cerca de uma semana no local e depois disseram que não conseguiram chegar a conclusões confiáveis, em parte por causa do tempo e do escopo limitados. A Apollo Research teve três dias para testar o GPT-6 Astra da OpenAI antes do lançamento e escreveu em sua contribuição para a model card que a janela limitada e as maiores taxas de consciência de avaliação significavam que baixas taxas de mau comportamento não forneciam evidência substancial sobre o alinhamento do modelo.

Evidência, independência e controle da empresa

Até agora, as evidências apoiam a importância da proposta, não sua eficácia. Os compromissos atribuídos à Anthropic e à OpenAI são promessas corporativas, e nenhuma delas publicou ainda uma estrutura operacional que permita a pessoas de fora verificar quanta independência os avaliadores receberão.

Adam Gleave disse que a Far.AI recusou contratos de desenvolvedores de fronteira que buscavam controle excessivo sobre o processo de avaliação. Segundo seu relato, os avaliadores muitas vezes são tratados como contratantes comuns, sujeitos a acordos de confidencialidade restritivos e limites sobre o que podem publicar. Isso cria um conflito direto: as organizações mais capazes de conduzir avaliações difíceis podem perder acesso se recusarem condições que comprometem sua independência.

Os pesquisadores também questionaram se as empresas fornecerão tempo suficiente para um trabalho significativo. Uma revisão curta pode identificar falhas óbvias, mas pode não revelar comportamentos que aparecem apenas ao longo das etapas de treinamento, sob prompts incomuns ou depois que um modelo detecta que está sendo avaliado. A avaliação da Apollo Research do GPT-6 Astra é um exemplo de benchmark próximo ao fornecedor, e não prova de um padrão mais amplo do setor, mas ilustra como o acesso limitado pode enfraquecer as conclusões ligadas a um relatório de segurança.

Vários pesquisadores pediram uma estrutura pública definindo qualificações dos avaliadores, direitos de acesso, regras de publicação e períodos mínimos de revisão. Henry Papadatos, diretor-executivo da Safer AI, disse que compromissos voluntários continuam dependentes da boa vontade da empresa e argumentou que a regulação impediria um desenvolvedor de mudar de rumo após uma crise.

O que a proposta significa para construtores e compradores de IA

Para os desenvolvedores de IA, avaliadores incorporados poderiam tornar o trabalho de segurança mais contínuo e mais estreitamente ligado às decisões de treinamento. Em vez de descobrir um problema imediatamente antes do lançamento, uma empresa poderia identificar mais cedo o checkpoint relevante, a estrutura de recompensa ou a mudança de implantação. Isso poderia melhorar a correção de problemas, mas também exigiria que os desenvolvedores expusessem infraestrutura sensível, logs, entrevistas com funcionários e propriedade intelectual a grupos externos.

Para compradores corporativos, a distinção entre um modelo que passou em um benchmark de segurança e um modelo que foi examinado de forma independente ao longo de todo o desenvolvimento pode se tornar comercialmente importante. As equipes de compras podem eventualmente perguntar não apenas se um fornecedor de IA realizou testes adversariais, mas quem os conduziu, a que tiveram acesso, por quanto tempo trabalharam e se o fornecedor pôde suprimir conclusões desfavoráveis.

O arranjo também pode remodelar a concorrência entre empresas de avaliação. Se os desenvolvedores puderem escolher apenas revisores amigáveis ou de escopo estreito, “independente” pode virar um rótulo em vez de um padrão confiável. John Steidley sugeriu que uma estrutura pública deveria definir quais auditores são qualificados e quais riscos devem avaliar, reduzindo a possibilidade de empresas escolherem avaliações que evitam as perguntas mais difíceis.

Outros grandes desenvolvedores não fizeram o mesmo compromisso. A TechCrunch informou que Meta, SpaceXAI e Google DeepMind não concordaram em incorporar avaliadores de terceiros. O CEO da DeepMind, Demis Hassabis, propôs em vez disso um órgão separado de padrões da indústria para testes independentes de modelos de fronteira. Essa diferença deixa em aberto se a supervisão incorporada se tornará uma prática comum ou permanecerá limitada a empresas selecionadas.

O que observar a seguir

O primeiro sinal será se Anthropic e OpenAI publicarão os nomes dos avaliadores participantes e os termos que regem seu trabalho. As perguntas centrais são se os revisores podem acessar checkpoints intermediários, logs de treinamento e pós-treinamento, entrevistas com funcionários e registros de incidentes, e se podem divulgar conclusões adversas sem aprovação editorial.

O setor também deve observar requisitos mínimos de tempo, procedimentos para lidar com informações confidenciais e evidências de que os avaliadores podem recusar exigências da empresa sem perder acesso. A SB 53 da Califórnia já exige que grandes desenvolvedores de fronteira publiquem estruturas de segurança e relatem incidentes críticos, enquanto a SB 813 cria uma estrutura para “organizações de verificação independente” reconhecidas pelo estado. Na Europa, a Lei de IA da UE exige que desenvolvedores de fronteira documentem avaliações e testes adversariais, relatem incidentes graves e cooperem com especialistas independentes nomeados pelo Escritório de IA da UE.

Essas leis podem transformar uma promessa voluntária em uma obrigação mais duradoura. Até que as empresas divulguem suas regras operacionais, porém, a pergunta central permanece sem resposta: se os avaliadores incorporados agirão como vigilantes independentes ou como contratantes trabalhando dentro de limites definidos pelos laboratórios que devem examinar.

Perspectiva da Creati.ai

Anthropic e OpenAI estão certos ao reconhecer que os testes do modelo final têm limites, especialmente quando os sistemas podem identificar as condições de avaliação. Mas acesso por si só não cria supervisão independente. A independência depende de quem controla o escopo da revisão, quanto tempo ela dura, que evidências estão disponíveis e se conclusões desfavoráveis podem ser publicadas.

Para construtores e clientes corporativos, os compromissos mais críveis serão aqueles que podem ser verificados externamente: avaliadores nomeados, regras de acesso publicadas, trilhas de auditoria preservadas e proteções claras para conclusões divergentes. No fim, a regulação pode importar menos como substituta da avaliação técnica do que como salvaguarda contra empresas que a restringem discretamente quando os riscos comerciais aumentam.

Anúncios