WikiSkill da Google Research dá aos agentes de IA um registro persistente de seus erros

O WikiSkill da Google Research permite que agentes de IA retenham registros de falhas e sucessos, melhorando o desempenho em tarefas repetidas sem re-treinar os modelos subjacentes.

AI News

A Google Research apresentou o WikiSkill, um framework projetado para ajudar agentes de IA a melhorar em tarefas repetidas preservando o que funcionou e o que falhou. Em vez de atualizar os parâmetros de um modelo, o sistema registra a experiência de execução em uma base de conhecimento persistente, no estilo de uma wiki, e transforma lições selecionadas em instruções reutilizáveis.

A abordagem enfrenta uma fraqueza central dos agentes de IA de hoje: as informações coletadas durante uma execução frequentemente são descartadas quando a tarefa termina. Na pesquisa relatada, o WikiSkill produziu ganhos substanciais em vários benchmarks, embora os resultados venham de uma avaliação de pesquisa, e não de um lançamento comercial de produto ou de uma implementação verificada de forma independente.

Um sistema de memória em três camadas para agentes de IA

O WikiSkill organiza o espaço de trabalho de um agente em três camadas. A Raw Layer mantém trilhas completas de execução, incluindo chamadas de ferramentas e seus resultados. De acordo com a descrição da pesquisa relatada por The Decoder, esse material é imutável e fornece as evidências usadas para análises posteriores.

A Wiki Layer destila essas trilhas em conhecimento estruturado. Ela pode registrar padrões de falha recorrentes, estratégias bem-sucedidas e lições de tentativas anteriores. Diferentemente das instruções ativas usadas pelo agente, essa camada foi projetada para persistir e crescer ao longo do tempo.

A Skill Layer contém a orientação procedimental que o agente realmente usa. Essas instruções são empacotadas como “Agent Skills”, permitindo que o sistema mude a forma como aborda uma tarefa sem modificar os pesos de treinamento do modelo. As skills podem ser revertidas se uma atualização reduzir o desempenho, enquanto a wiki subjacente mantém o registro do que foi tentado.

O fluxo de trabalho separa a coleta de experiência das atualizações de instrução. Um agente de inferência executa tarefas e cria trilhas. Um “Wiki Maintainer” analisa essas trilhas, enquanto um “Skill Proposer” usa a informação acumulada para sugerir mudanças. Um mecanismo de filtragem então avalia a proposta em um conjunto de validação separado. Se a skill proposta não ajudar, ela é rejeitada, mas o experimento fracassado permanece disponível para propostas futuras.

Esse design é mais próximo de memória externa persistente e de otimização iterativa de prompts ou workflows do que de aprendizado contínuo dentro de um modelo. The Decoder observou que o modelo subjacente não aprende de fato após a implantação; em vez disso, o sistema escreve instruções melhores e as recupera em execuções posteriores.

Ganhos de benchmark relatados, com limites importantes

Os pesquisadores avaliaram o WikiSkill em cinco áreas: raciocínio matemático, busca na web, manipulação de planilhas, perguntas e respostas sobre documentos e tarefas interativas em um ambiente virtual. Os modelos relatados incluíam várias variantes de Qwen, Gemma-4-31B e Gemini-3.5-Flash.

Segundo os resultados do estudo citados por The Decoder, o WikiSkill elevou a pontuação média do Gemini-3.5-Flash de 49,5% para 68,1%. O Qwen-3.6-27B aumentou de 39,4% para 63,3% na mesma comparação. Os ganhos relatados foram maiores em algumas tarefas individuais: o Gemini-3.5-Flash subiu de 33,0% para 72,6% no LiveMath e de 50,5% para 76,6% no SpreadSheet.

Essas são alegações de benchmark de pesquisa, não evidência de que o WikiSkill entregará os mesmos ganhos em produção. A avaliação teria sido média de três execuções independentes, e o framework foi comparado com outros métodos de evolução de skills no estudo. O material de origem disponível não fornece detalhes suficientes para avaliar a configuração experimental completa, os custos operacionais ou como o sistema se comporta sob dados do mundo real em mudança.

O desempenho também variou por tarefa. Trabalhos de matemática e planilhas mostraram as maiores melhorias, enquanto o OfficeQA, que envolve contextos longos de documentos, se beneficiou muito menos. Os pesquisadores atribuíram os resultados mais fracos de modelos menores em parte à dificuldade de executar estratégias de busca evoluídas, em várias etapas, ao longo de contextos longos. Nesses casos, os modelos às vezes voltavam ao comportamento padrão.

Os resultados sugerem que a memória persistente não elimina as limitações de capacidade do modelo. Um sistema pode documentar com sucesso um procedimento útil e ainda assim falhar em executá-lo de forma confiável, especialmente quando o procedimento envolve muitas etapas, janelas de contexto longas ou várias interações com ferramentas.

O que o sistema significa para builders e empresas

Para builders de IA, o WikiSkill aponta para uma alternativa prática ao re-treinamento sempre que um agente encontra repetidamente a mesma classe de tarefa. Um assistente de código, um agente de pesquisa ou um operador de planilhas poderia preservar procedimentos validados, documentar chamadas de ferramentas malsucedidas e refinar gradualmente seu workflow. Isso poderia reduzir a necessidade de colocar cada lição em um system prompt cada vez maior, desde que a memória seja estruturada e recuperada seletivamente.

A separação entre a Wiki Layer e a Skill Layer é especialmente relevante para sistemas de produção. As equipes poderiam preservar um rastro de auditoria completo enquanto permitem que apenas instruções validadas afetem o comportamento ao vivo. Os rollbacks tornariam a experimentação menos arriscada do que editar diretamente um prompt ou uma política de agente, embora a qualidade do maintainer e do processo de filtragem ainda determine se lições ruins entram no conjunto ativo de skills.

O framework também pode afetar a economia dos modelos. O estudo relata que modelos menores usando o WikiSkill podem igualar o desempenho de modelos maiores sem o framework em alguns cenários. Se esse padrão se mantiver fora dos benchmarks testados, as empresas poderiam usar skills persistentes para reduzir custos de inferência ou reservar modelos maiores para casos difíceis. Essa conclusão, porém, permanece condicional: a fonte não estabelece os custos totais do sistema, incluindo armazenamento de trilhas, manutenção, execuções de validação e chamadas adicionais ao modelo.

A transferibilidade é outra possível vantagem. A pesquisa relatada descobriu que skills desenvolvidas por um modelo às vezes podiam ser usadas por outro e, ocasionalmente, tinham desempenho melhor do que skills criadas pelo próprio modelo receptor. Mas a transferência não foi universal, então as organizações precisariam testar as skills contra cada modelo, tarefa e ambiente de ferramentas, em vez de assumir que um procedimento bem-sucedido é portátil.

Para equipes de IA empresarial, a principal questão operacional é governança. Um registro persistente de falhas de agentes pode melhorar a confiabilidade, mas também pode preservar conclusões incorretas, informações sensíveis ou procedimentos desatualizados. O mecanismo de filtragem relatado trata regressão de desempenho, não necessariamente privacidade, autorização ou segurança. Qualquer implementação em produção precisaria de controles sobre o que entra na wiki, quem pode inspecioná-la e quando o conhecimento acumulado expira.

O que observar a seguir

O próximo sinal será se a Google Research publicar detalhes técnicos mais completos, código ou avaliações mais amplas do WikiSkill. Esses materiais ajudariam a esclarecer a sobrecarga de computação do framework, os requisitos de memória, o design de validação e o comportamento sob mudanças de distribuição.

Builders também devem observar resultados em agentes de execução mais longa e fluxos de trabalho empresariais menos estruturados. A evidência atual é mais forte para tarefas matemáticas e de planilha e mais fraca para trabalho documental de longo contexto. Testes em operações de suporte ao cliente, repositórios de software e ambientes multiusuário mostrariam se o método se generaliza além dos episódios de benchmark.

Outra questão é se skills persistentes continuam úteis à medida que ferramentas, sites e formatos de dados mudam. Um procedimento aprendido em uma interface pode se tornar prejudicial após uma atualização de aplicativo. Métricas de idade da skill, proveniência, frequência de rollback e detecção de memória obsoleta, portanto, seriam tão importantes quanto a precisão geral da tarefa.

Perspectiva da Creati.ai

O WikiSkill é notável menos porque resolve o aprendizado contínuo e mais porque oferece um atalho disciplinado para uma das limitações mais visíveis dos agentes. O framework trata a experiência como um ativo de engenharia: preservar a trilha, resumir a lição, propor uma mudança e testá-la antes da implantação.

Esse padrão é promissor para equipes que constroem agentes de IA, mas os ganhos relatados devem ser lidos como evidência inicial de pesquisa. O trabalho difícil em produção será decidir quais lições são confiáveis, quanta memória manter e como evitar que um agente fique consistentemente melhor em repetir uma estratégia ultrapassada ou incorreta.

Anúncios