Pesquisadores do Google propõem RRSI para impedir que agentes de IA que se autaprimoram memorizem testes

Pesquisadores do Google propõem o RRSI para conter a memorização de testes por agentes de IA que se autaprimoram, melhorando pontuações em benchmarks não vistos e reduzindo o uso de tokens em tempo de execução.

AI News

Pesquisadores do Google propuseram um método para melhorar agentes de IA sem permitir que eles se ajustem excessivamente às tarefas usadas para otimizá-los. Chamado de Regularized Recursive Self-Improvement of Agent Harnesses, ou RRSI, o método mira um problema que se torna mais sério à medida que os sistemas reescrevem automaticamente seus próprios prompts, fluxos de trabalho, ferramentas e lógica de memória.

Segundo um artigo de pesquisa descrito pelo The Decoder, o RRSI melhorou os resultados em benchmarks não vistos anteriormente em até 4,7 pontos e usou cerca de 30% menos tokens em tempo de execução do que uma abordagem de otimização não regularizada. Os ganhos relatados vêm da alteração do harness do agente em torno de um modelo congelado, em vez da atualização dos pesos do modelo.

Por que os harnesses de agentes se tornam o alvo

Muitos agentes de IA de produção consistem em um modelo de linguagem fixo cercado por um harness de agente: prompts, chamadas de ferramentas, regras de fluxo de trabalho, sistemas de memória, comportamento de recuperação e tratamento de saída determinam como o modelo opera. O harness pode decidir se um agente verifica um arquivo antes de editá-lo, tenta novamente após um erro ou estrutura sua resposta final.

Pesquisadores do Google Cloud AI Research e colaboradores universitários estudam maneiras de automatizar melhorias nessa camada. Em um ciclo típico de autaprimoramento recursivo, um modelo de linguagem propõe mudanças no harness, avalia-as em um conjunto de tarefas e usa os resultados para gerar novas mudanças.

O risco é que a otimização repetida em uma pequena coleção de testes torne um agente melhor nesses testes exatos sem torná-lo mais capaz em geral. O sistema pode aprender padrões específicos do benchmark, selecionar mudanças que funcionam por acaso ou acumular complexidade desnecessária que eleva a pontuação medida enquanto aumenta o custo e a fragilidade.

Isso importa porque os agentes de IA costumam ser avaliados em conjuntos limitados de tarefas, enquanto os ambientes de implantação pretendidos são muito menos previsíveis. Um harness que funciona bem em fluxos familiares pode falhar quando estruturas de arquivos, instruções, ferramentas ou objetivos dos usuários mudam.

Como o RRSI limita o sobreajuste

O RRSI aplica controles em dois pontos do processo de otimização. Ao gerar revisões candidatas, limita quantas edições independentes podem ser agrupadas em uma proposta. O número permitido de edições diminui com o tempo, deslocando o processo de grandes reformulações para modificações mais direcionadas.

O sistema também registra tentativas anteriores, ajudando a evitar a exploração repetida de mudanças que já falharam. Quando o progresso para, ele direciona a experimentação para partes do harness que ainda não foram examinadas.

Um crítico separado avalia as mudanças propostas antes que se tornem permanentes. Ele rejeita revisões que pareçam codificar nomes de tarefas, soluções ou outros comportamentos específicos de benchmarks. O RRSI também exige um benefício de desempenho observável antes de aceitar mudanças que aumentem o custo computacional e remove componentes que já não contribuem.

Em conjunto, essas regras pretendem favorecer melhorias menores e explicáveis, que sejam transferidas para novas tarefas, em vez de mudanças agressivas que maximizem uma pontuação estreita. O método mantém o harness editável, mas limita a velocidade e a liberdade com que ele pode se reescrever.

O que os resultados relatados mostram

Os pesquisadores testaram o RRSI em oito benchmarks que abrangiam programação, trabalho de agentes voltado para escritórios e projeto de engenharia. O modelo subjacente, identificado no relatório como Claude Opus 4.8, permaneceu congelado. A comparação incluiu um harness de referência sem alterações e quatro outros métodos de otimização.

Os resultados relatados mostram uma compensação. O RRSI produziu ganhos de até 14,1 pontos nas tarefas usadas durante a otimização, mas o resultado mais significativo foi seu desempenho em cinco benchmarks não vistos, nos quais a melhoria máxima chegou a 4,7 pontos. Segundo o artigo conforme relatado pelo The Decoder, o harness RRSI não ficou abaixo da referência em nenhuma dessas avaliações não vistas.

Outras abordagens teriam apresentado bom desempenho nas tarefas de treinamento, mas se transferido com menos eficácia. Dois métodos ficaram abaixo da referência em tarefas novas. O RRSI apresentou a menor melhoria no conjunto de treinamento entre as variantes testadas, o que os pesquisadores interpretam como evidência de que sacrificou a especialização em benchmarks em favor de uma generalização mais ampla.

O resultado relativo aos tokens também é relevante para equipes que operam agentes em escala. O sistema RRSI otimizado usou aproximadamente 30% menos tokens do que a versão não regularizada e exigiu menos etapas entre os harnesses otimizados. A referência original, porém, continuou mais econômica; portanto, a regularização não tornou todo o sistema mais barato do que todas as alternativas.

São resultados de pesquisa, não benchmarks independentes de produção. Os números de desempenho são alegações da avaliação dos pesquisadores, e as evidências disponíveis não estabelecem como o método se comportaria em distribuições maiores de tarefas, modelos diferentes ou cargas de trabalho empresariais reais.

Implicações para desenvolvedores e compradores de IA

Para os desenvolvedores, o trabalho sugere que melhorar um agente deve envolver mais do que maximizar um benchmark de desenvolvimento. Os conjuntos de avaliação precisam incluir tarefas que o processo de otimização nunca veja; caso contrário, um sistema de autaprimoramento pode se recompensar por aprender o teste em vez de melhorar seu fluxo de trabalho subjacente.

O design do RRSI também aponta para controles operacionais do autaprimoramento recursivo. As equipes poderiam impor limites ao número de mudanças simultâneas, manter um histórico de experimentos fracassados, exigir justificativas de custo para fluxos mais caros e bloquear edições aparentemente ligadas a casos de teste específicos. Esses controles poderiam facilitar a auditoria e a reversão da otimização automatizada de harnesses.

A abordagem pode ser especialmente relevante para a IA empresarial, na qual custos de tokens, comportamento previsível e confiabilidade em processos internos variados são tão importantes quanto pontuações máximas em benchmarks. Um harness que generaliza para documentos ou procedimentos desconhecidos pode ser mais útil do que um que obtém uma pontuação maior em uma coleção fixa de demonstrações.

O trabalho não resolve as questões mais amplas de segurança e governança relacionadas a agentes que alteram sua própria lógica operacional. O RRSI restringe mudanças no harness, mas as evidências disponíveis não mostram se seus críticos conseguem detectar de forma confiável todas as formas de comportamento oculto específico de benchmarks. Ele também não aborda sistemas nos quais os pesos do modelo mudam durante a otimização.

A transferência relatada entre modelos, contudo, é relevante. Um harness de programação descoberto com o Gemini 3.5 Flash teria elevado a precisão do modelo mais fraco Gemini 3.1 Flash Lite de 11,2 para 14,6 pontos sem modificar este último. A descoberta sugere que algumas melhorias de fluxo de trabalho podem ser portáteis entre modelos com capacidades diferentes, embora venha do mesmo relatório de pesquisa e exija validação mais ampla.

O que observar a seguir

O primeiro sinal será a replicação independente do RRSI em modelos e famílias de tarefas adicionais. Os resultados devem ser comparados em tarefas reservadas, ocultas tanto do otimizador do harness quanto de seu crítico.

Pesquisadores e equipes de produto também devem testar se o método continua eficaz quando ferramentas, prompts, armazenamentos de memória e distribuições de dados mudam após a implantação. As medições de custo também serão importantes: a redução de 30% nos tokens é relativa a um sistema otimizado não regularizado, não necessariamente a uma referência cuidadosamente projetada.

Outra questão em aberto é se controles semelhantes podem governar agentes que atualizam os pesos do modelo, e não apenas o harness ao redor. O estudo atual abrange modelos congelados, deixando fora de seu escopo essa forma mais consequente de autaprimoramento.

Perspectiva da Creati.ai

O RRSI aborda uma fraqueza prática da atual corrida pelos agentes: as equipes conseguem automatizar a busca por fluxos de trabalho melhores mais rapidamente do que conseguem determinar se esses fluxos generalizam. Sua principal contribuição é, portanto, metodológica. Ele trata o desempenho em tarefas não vistas e o custo computacional como restrições fundamentais, em vez de depender de uma única pontuação de otimização.

A pesquisa não prova que o autaprimoramento recursivo esteja pronto para implantação sem supervisão. Mas oferece aos desenvolvedores um princípio de design mais claro: um agente deve conquistar o direito de se tornar mais complexo demonstrando ganhos confiáveis além dos testes que produziram a mudança.

Anúncios