Agentes de IA ampliam o trabalho de desenvolvimento de modelos, mas os humanos ainda controlam as decisões críticas

Um estudo ligado à Fudan conclui que os agentes de IA propõem grande parte do trabalho de desenvolvimento de modelos, enquanto os humanos mantêm o controle final — revelando os limites da autonomia na prática.

AI News

Os agentes de IA estão assumindo uma parcela crescente do trabalho envolvido na construção de modelos de IA, mas uma nova análise sugere que eles continuam muito menos influentes quando os pesquisadores decidem o que perseguir e como proceder.

Uma equipe de pesquisa envolvendo a Universidade Fudan, na चीन, revisou 769 registros de tarefas de um projeto de desenvolvimento de modelo envolvendo 56 participantes e os agentes que eles usaram. O estudo constatou que a IA forneceu até 55,4% das propostas de métodos e parâmetros, enquanto os humanos tomaram 85,5% das decisões finais nessas áreas. Os humanos também selecionaram os objetivos e o escopo do projeto em 93,4% dos casos.

Os achados oferecem um retrato mais qualificado da autonomia dos agentes do que medidas brutas de atividade poderiam sugerir. Os agentes realizaram trabalho, geraram opções e lidaram com revisões, mas o julgamento humano permaneceu o principal ponto de controle — especialmente quando o projeto enfrentou ambiguidade, falhas ou escolhas estratégicas.

Atria Dawn Preview como caso de teste

O projeto se concentrou em Atria Dawn Preview, um modelo de linguagem agentivo construído sobre uma arquitetura mixture-of-experts com 744 bilhões de parâmetros. A equipe o projetou para tarefas de pesquisa e engenharia, usando um fluxo de trabalho em que cada tarefa estava conectada a um ambiente de execução. Os agentes podiam chamar ferramentas, produzir resultados intermediários e receber feedback de testes, métricas ou evidências de origem.

Os pesquisadores relataram que a IA foi usada em 96,5% das tarefas revisadas. Ao longo de quatro semanas, a razão mediana entre ações dos agentes e entradas humanas aumentou de 11 para 28,5. Esse aumento pode parecer mostrar agentes se tornando mais independentes, mas os autores argumentam que ele reflete principalmente um padrão diferente: uma decisão humana frequentemente desencadeava uma cadeia mais longa de ações dos agentes.

O modelo teria liderado em cinco de 16 benchmarks, incluindo busca na web e cibersegurança. A fonte não indica que Atria Dawn Preview tenha alcançado uma liderança geral sobre sistemas concorrentes, portanto os resultados dos benchmarks devem ser tratados como uma alegação de desempenho limitada, e não como prova de superioridade ampla.

Agentes propuseram opções; pessoas escolheram as direções

O padrão de decisão mais comum foi “a IA propõe, o humano seleciona”, respondendo por 55,4% das decisões sobre métodos e parâmetros. Na mesma categoria, a IA tomou 9,2% das decisões finais, em comparação com 85,5% dos humanos. A parcela de propostas da IA variou conforme o tipo de decisão, de 17% a 55%, mas seu papel na seleção final permaneceu em um dígito.

O controle humano foi ainda mais forte nas escolhas em nível de projeto. Os pesquisadores tomaram a decisão final sobre objetivos e escopo em 93,4% dos casos. Entre 151 tarefas que os participantes disseram que não seriam viáveis sem IA, os humanos ainda escolheram o objetivo 95,4% das vezes.

Essa distinção importa para o desenvolvimento de modelos. Um agente pode explorar um grande espaço de possíveis implementações ou conduzir um experimento complexo sem decidir se esse experimento vale a pena ser executado. As evidências do estudo sugerem que os sistemas atuais são mais eficazes como operadores de pesquisa e geradores de propostas do que como proprietários de uma agenda de pesquisa.

A IA possibilitou mais trabalho, não apenas mais rápido

O estudo também aponta para um efeito menos óbvio dos agentes de IA. Das 455 tarefas concluídas com assistência de IA, os participantes julgaram 151 — cerca de um terço — inviáveis sem IA no mesmo escopo e qualidade. Essas tarefas envolveram 27 dos 56 participantes, em vez de se concentrarem em apenas alguns usuários avançados.

Esse resultado sugere que os agentes podem ampliar o conjunto de trabalhos que as equipes podem tentar, em vez de apenas acelerar fluxos de trabalho existentes. Para quem constrói IA, isso pode significar mais experimentos, avaliações e mudanças de engenharia entrando em um pipeline de projeto. Também pode significar uma carga maior de supervisão, porque o número de ações que exigem revisão cresce junto com a quantidade de trabalho tentada.

Quando as tarefas ficavam difíceis, a intervenção humana era o caminho habitual. Em um conjunto de 588 tarefas com dificuldade registrada, 76% avançaram por meio de ajuda humana, enquanto os agentes resolveram 23% sem intervenção. As formas mais comuns de ajuda foram fornecer contexto ou esclarecer requisitos, com 35,2%, e diagnosticar problemas ou mudar métodos, com 34,7%.

Os humanos raramente assumiram a execução diretamente. Edições parciais representaram 3,2% das intervenções, e tomadas de controle completas, 0,7%. Após o feedback ser fornecido, os agentes trataram as revisões sozinhos em 75,4% dos casos. Na prática, o gargalo humano era geralmente o julgamento e a informação — não a execução manual da tarefa.

O problema de supervisão cresce com a atividade dos agentes

Os achados não eliminam a possibilidade de um desenvolvimento de modelos mais autônomo. Em vez disso, identificam um problema de controle que se torna mais agudo à medida que as cadeias de agentes ficam mais longas. Se nenhuma pessoa puder inspecionar cada ação intermediária, a revisão humana pode se degradar em aprovação de resumos ou resultados finais, em vez de supervisão significativa.

Os pesquisadores também observaram que os participantes frequentemente usavam modos autônomos para evitar interromper processos longos. Segundo o relatório, esse limite foi escolhido por conveniência, não porque as equipes tivessem decidido formalmente quanta autoridade os agentes deveriam receber. Para equipes empresariais de IA, isso é um alerta de que configurações operacionais podem, silenciosamente, se tornar decisões de governança.

O estudo situa os sistemas atuais entre duas etapas de desenvolvimento: a IA avançou além de ser apenas um objeto de pesquisa ou uma ferramenta estreita para tarefas específicas, mas ainda não se tornou claramente uma diretora de pesquisa independente. Os autores descrevem uma possível próxima etapa como autoaperfeiçoamento recursivo, em que sistemas mais fortes ajudam a produzir seus sucessores, enquanto enfatizam que o caminho da melhor performance em tarefas de treinamento para um melhor design de modelos continua sem solução.

O que observar a seguir

A questão de acompanhamento mais importante será saber se padrões de decisão semelhantes aparecem em outras organizações e projetos de desenvolvimento de modelos. Este estudo examinou o trabalho de uma única equipe, então suas observações não devem ser tratadas como uma medida universal da autonomia da IA.

Pesquisadores e compradores devem observar três sinais. Primeiro, avaliações futuras devem separar ações de agentes de decisões sobre objetivos, métodos e alocação de recursos. Segundo, plataformas de desenvolvimento podem precisar de trilhas de auditoria que exponham como uma recomendação final surgiu de uma longa cadeia de agentes. Terceiro, empresas que afirmam fazer pesquisa automatizada em IA devem divulgar com que frequência os humanos definem objetivos, rejeitam propostas, mudam métodos ou intervêm após falhas.

O debate sobre autoaperfeiçoamento recursivo também dependerá de evidências sobre julgamento de pesquisa, não apenas sobre velocidade de codificação ou throughput de experimentos. Alegações de empresas como Anthropic sobre direção de pesquisa cada vez mais automatizada permanecem uma categoria de evidência separada deste projeto descrito independentemente e não devem ser tratadas como diretamente comparáveis sem métricas comuns.

Perspectiva da Creati.ai

A principal lição deste estudo é operacional: mais atividade dos agentes não significa necessariamente mais autoridade dos agentes. Os agentes de IA podem multiplicar o número de experimentos e tarefas de engenharia que uma equipe pode executar, enquanto os humanos continuam determinando quais perguntas importam e se os resultados justificam uma mudança de direção.

Para construtores e equipes corporativas, a prioridade imediata não é simplesmente maximizar execuções autônomas. É projetar sistemas que preservem a proveniência das decisões, tornem a incerteza visível e possibilitem revisar as escolhas ocultas em longas cadeias de trabalho dos agentes. Até que os agentes consigam avaliar de forma confiável os objetivos de pesquisa antes que os resultados estejam disponíveis, o julgamento humano continua sendo o recurso escasso no desenvolvimento de modelos.

Anúncios