Un estudio vinculado a Fudan encuentra que los agentes de IA proponen gran parte del trabajo de desarrollo de modelos, mientras los humanos conservan el control final, revelando los límites de la autonomía en la práctica.

Los agentes de IA están asumiendo una parte cada vez mayor del trabajo implicado en la construcción de modelos de IA, pero un nuevo análisis sugiere que siguen teniendo mucha menos influencia cuando los investigadores deciden qué perseguir y cómo proceder.
Un equipo de investigación que incluyó a la Universidad de Fudan, en China, revisó 769 registros de tareas de un proyecto de desarrollo de modelos en el que participaron 56 personas y los agentes que utilizaron. El estudio encontró que la IA aportó hasta el 55,4 % de las propuestas de métodos y parámetros, mientras que los humanos tomaron el 85,5 % de las decisiones finales en esas áreas. Los humanos también seleccionaron los objetivos y el alcance del proyecto en el 93,4 % de los casos.
Los hallazgos ofrecen una imagen más matizada de la autonomía de los agentes de lo que podrían sugerir las métricas de actividad brutas. Los agentes realizaron trabajo, generaron opciones y gestionaron revisiones, pero el juicio humano siguió siendo el principal punto de control, especialmente cuando el proyecto se enfrentó a ambigüedad, fallos o decisiones estratégicas.
El proyecto se centró en Atria Dawn Preview, un modelo de lenguaje agéntico construido sobre una arquitectura de mezcla de expertos con 744 mil millones de parámetros. El equipo lo diseñó para tareas de investigación e ingeniería, utilizando un flujo de trabajo en el que cada tarea estaba conectada a un entorno de ejecución. Los agentes podían llamar herramientas, producir resultados intermedios y recibir retroalimentación de pruebas, métricas o evidencia de origen.
Los investigadores informaron que la IA se utilizó en el 96,5 % de las tareas revisadas. Durante cuatro semanas, la proporción mediana de acciones de los agentes frente a las entradas humanas aumentó de 11 a 28,5. Ese aumento podría parecer que muestra agentes cada vez más independientes, pero los autores sostienen que refleja principalmente un patrón distinto: una sola decisión humana a menudo desencadenaba una cadena más larga de acciones de los agentes.
Según el informe, el modelo lideró en cinco de 16 benchmarks, incluyendo búsqueda web y ciberseguridad. La fuente no indica que Atria Dawn Preview lograra una ventaja global frente a sistemas competidores, por lo que los resultados de los benchmarks deben tratarse como una afirmación de rendimiento limitada y no como prueba de superioridad amplia.
El patrón de decisión más común fue “la IA propone, el humano selecciona”, y representó el 55,4 % de las decisiones sobre métodos y parámetros. Dentro de la misma categoría, la IA tomó el 9,2 % de las decisiones finales, frente al 85,5 % de los humanos. La proporción de propuestas de la IA varió según el tipo de decisión, entre el 17 % y el 55 %, pero su papel en la selección final siguió estando en los dígitos simples.
El control humano fue aún más fuerte en las decisiones a nivel de proyecto. Los investigadores tomaron la decisión final sobre los objetivos y el alcance en el 93,4 % de los casos. Entre 151 tareas que los participantes dijeron que no habrían sido factibles sin IA, los humanos siguieron eligiendo el objetivo el 95,4 % de las veces.
Esa distinción importa para el desarrollo de modelos. Un agente puede explorar un gran espacio de posibles implementaciones o llevar a cabo un experimento complejo sin decidir si vale la pena ejecutarlo. La evidencia del estudio sugiere que los sistemas actuales son más eficaces como operadores de investigación y generadores de propuestas que como dueños de una agenda de investigación.
El estudio también apunta a un efecto menos obvio de los agentes de IA. De 455 tareas completadas con ayuda de IA, los participantes consideraron que 151 —aproximadamente un tercio— no habrían sido factibles sin IA con el mismo alcance y calidad. Esas tareas involucraron a 27 de los 56 participantes, en lugar de concentrarse solo entre unos pocos usuarios avanzados.
Este resultado sugiere que los agentes pueden ampliar el conjunto de trabajos que los equipos pueden intentar, en lugar de simplemente acelerar los flujos de trabajo existentes. Para quienes construyen IA, eso podría significar que entren más experimentos, evaluaciones y cambios de ingeniería en la tubería de un proyecto. También podría significar una mayor carga de supervisión, porque el número de acciones que requieren revisión crece junto con la cantidad de trabajo que se intenta realizar.
Cuando las tareas se volvían difíciles, la intervención humana era la forma habitual de seguir adelante. En un conjunto de 588 tareas con dificultad registrada, el 76 % avanzó gracias a la ayuda humana, mientras que los agentes resolvieron el 23 % sin intervención. Las formas más comunes de ayuda fueron aportar contexto o aclarar requisitos, con un 35,2 %, y diagnosticar problemas o cambiar métodos, con un 34,7 %.
Rara vez los humanos asumieron directamente la ejecución. Las ediciones parciales representaron el 3,2 % de las intervenciones, y las tomas de control completas el 0,7 %. Después de proporcionar retroalimentación, los agentes gestionaron las revisiones por sí mismos en el 75,4 % de los casos. En términos prácticos, el cuello de botella humano solía ser el juicio y la información, no la ejecución manual de la tarea.
Los hallazgos no eliminan la posibilidad de un desarrollo de modelos más autónomo. En cambio, identifican un problema de control que se agudiza a medida que las cadenas de agentes se alargan. Si ninguna persona puede inspeccionar cada acción intermedia, la revisión humana podría degradarse hasta convertirse en la aprobación de resúmenes o resultados finales en lugar de una supervisión significativa.
Los investigadores también observaron que los participantes a menudo usaban modos autónomos para evitar interrumpir procesos de larga duración. Según el informe, ese límite se eligió por conveniencia, no porque los equipos hubieran decidido formalmente cuánta autoridad debían recibir los agentes. Para los equipos empresariales de IA, esto es una advertencia de que los ajustes operativos pueden convertirse silenciosamente en decisiones de gobernanza.
El estudio sitúa a los sistemas actuales entre dos etapas de desarrollo: la IA ha dejado de ser solo un objeto de investigación o una herramienta estrecha para tareas concretas, pero aún no se ha convertido claramente en una directora de investigación independiente. Los autores describen una posible etapa siguiente como mejora recursiva de sí misma, en la que sistemas más potentes ayudan a producir a sus sucesores, al tiempo que subrayan que el camino desde un mejor rendimiento en tareas de entrenamiento hasta un mejor diseño de modelos sigue sin resolverse.
La pregunta de seguimiento más importante será si patrones de decisión similares aparecen en otras organizaciones y proyectos de desarrollo de modelos. Este estudio examinó el trabajo de un solo equipo, por lo que sus observaciones no deben tomarse como una medida universal de la autonomía de la IA.
Los investigadores y compradores deberían vigilar tres señales. Primero, las evaluaciones futuras deberían separar las acciones de los agentes de las decisiones sobre objetivos, métodos y asignación de recursos. Segundo, las plataformas de desarrollo pueden necesitar registros de auditoría que expongan cómo surgió una recomendación final a partir de una larga cadena de agentes. Tercero, las empresas que afirmen realizar investigación de IA automatizada deberían revelar con qué frecuencia los humanos establecen objetivos, rechazan propuestas, cambian métodos o intervienen tras fallos.
El debate sobre la mejora recursiva de sí misma también dependerá de pruebas sobre el juicio de investigación, no solo sobre la velocidad de codificación o el rendimiento de los experimentos. Las afirmaciones de empresas como Anthropic sobre una dirección de investigación cada vez más automatizada siguen siendo una categoría de evidencia distinta de este proyecto descrito de forma independiente y no deben tratarse como directamente comparables sin métricas comunes.
La lección central de este estudio es operativa: más actividad de los agentes no significa necesariamente más autoridad de los agentes. Los agentes de IA pueden multiplicar el número de experimentos y tareas de ingeniería que un equipo puede ejecutar, mientras los humanos siguen determinando qué preguntas importan y si los resultados justifican un cambio de dirección.
Para los creadores y los equipos empresariales, la prioridad inmediata no es simplemente maximizar ejecuciones autónomas. Es diseñar sistemas que preserven la procedencia de las decisiones, hagan visible la incertidumbre y permitan revisar las elecciones ocultas dentro de largas cadenas de trabajo de los agentes. Hasta que los agentes puedan evaluar de forma fiable los objetivos de investigación antes de que haya resultados disponibles, el juicio humano sigue siendo el recurso escaso en el desarrollo de modelos.