Les agents d’IA élargissent le travail de développement des modèles, mais les humains gardent le contrôle des décisions critiques

Une étude liée à l’université Fudan montre que les agents d’IA proposent une grande partie du travail de développement des modèles, tandis que les humains conservent le contrôle final — révélant les limites de l’autonomie dans la pratique.

AI News

Les agents d’IA prennent en charge une part croissante du travail nécessaire à la construction de modèles d’IA, mais une nouvelle analyse suggère qu’ils restent bien moins influents lorsque les chercheurs décident de ce qu’il faut poursuivre et de la manière d’avancer.

Une équipe de recherche comprenant l’université Fudan, en Chine, a examiné 769 journaux de tâches issus d’un projet de développement de modèle impliquant 56 participants et les agents qu’ils utilisaient. L’étude a révélé que l’IA fournissait jusqu’à 55,4 % des propositions de méthodes et de paramètres, tandis que les humains prenaient 85,5 % des décisions finales dans ces domaines. Les humains ont également choisi les objectifs et le périmètre du projet dans 93,4 % des cas.

Ces résultats offrent une image plus nuancée de l’autonomie des agents que ne le laisseraient penser de simples mesures d’activité. Les agents ont effectué du travail, généré des options et géré des révisions, mais le jugement humain est resté le principal point de contrôle — en particulier lorsque le projet faisait face à des ambiguïtés, des échecs ou des choix stratégiques.

Atria Dawn Preview comme cas de test

Le projet s’est concentré sur Atria Dawn Preview, un modèle de langage agentique construit sur une architecture de mélange d’experts avec 744 milliards de paramètres. L’équipe l’a conçu pour des tâches de recherche et d’ingénierie, en utilisant un flux de travail dans lequel chaque tâche était reliée à un environnement d’exécution. Les agents pouvaient appeler des outils, produire des résultats intermédiaires et recevoir des retours issus de tests, de métriques ou de preuves sources.

Les chercheurs ont indiqué que l’IA avait été utilisée dans 96,5 % des tâches examinées. Sur quatre semaines, le ratio médian entre les actions des agents et les entrées humaines est passé de 11 à 28,5. Cette hausse pourrait donner l’impression que les agents deviennent plus autonomes, mais les auteurs soutiennent qu’elle reflète surtout un autre schéma : une seule décision humaine déclenchait souvent une chaîne plus longue d’actions d’agents.

Selon le rapport, le modèle est arrivé en tête sur cinq des 16 benchmarks, dont la recherche web et la cybersécurité. La source n’indique pas qu’Atria Dawn Preview ait obtenu une avance globale face à des systèmes concurrents ; les résultats de benchmark doivent donc être considérés comme une affirmation de performance limitée plutôt que comme une preuve d’une supériorité générale.

Les agents proposaient des options ; les humains choisissaient l’orientation

Le schéma de décision le plus courant était « l’IA propose, l’humain sélectionne », représentant 55,4 % des décisions concernant les méthodes et les paramètres. Dans cette même catégorie, l’IA a pris 9,2 % des décisions finales, contre 85,5 % pour les humains. La part des propositions de l’IA variait selon le type de décision, de 17 % à 55 %, mais son rôle dans la sélection finale restait à un chiffre.

Le contrôle humain était encore plus fort pour les choix au niveau du projet. Les chercheurs ont pris la décision finale sur les objectifs et le périmètre dans 93,4 % des cas. Parmi 151 tâches que les participants ont jugées impossibles sans IA, les humains ont tout de même choisi l’objectif 95,4 % du temps.

Cette distinction est importante pour le développement de modèles. Un agent peut explorer un vaste espace d’implémentations possibles ou mener une expérience complexe sans décider si cette expérience mérite d’être lancée. Les éléments de preuve de l’étude suggèrent que les systèmes actuels sont plus efficaces comme opérateurs de recherche et générateurs de propositions que comme détenteurs d’un programme de recherche.

L’IA a rendu plus de travail possible, pas seulement plus rapide

L’étude met également en évidence un effet moins évident des agents d’IA. Sur 455 tâches achevées avec assistance IA, les participants ont jugé 151 — soit environ un tiers — irréalisables sans IA avec la même portée et la même qualité. Ces tâches concernaient 27 des 56 participants, et ne se concentraient pas seulement chez quelques utilisateurs avancés.

Ce résultat suggère que les agents peuvent élargir l’éventail des travaux que les équipes peuvent entreprendre, plutôt que de simplement accélérer les flux de travail existants. Pour les concepteurs d’IA, cela pourrait signifier davantage d’expériences, d’évaluations et de changements d’ingénierie dans un pipeline de projet. Cela pourrait aussi signifier une charge de supervision plus importante, car le nombre d’actions nécessitant une vérification augmente avec la quantité de travail tentée.

Lorsque les tâches devenaient difficiles, l’intervention humaine était la voie habituelle à suivre. Dans un ensemble de 588 tâches dont la difficulté était enregistrée, 76 % ont progressé grâce à l’aide humaine, tandis que les agents ont résolu 23 % sans intervention. Les formes d’aide les plus courantes consistaient à fournir du contexte ou à clarifier les exigences, à hauteur de 35,2 %, et à diagnostiquer des problèmes ou modifier des méthodes, à 34,7 %.

Les humains ont rarement pris directement le relais de l’exécution. Les modifications partielles représentaient 3,2 % des interventions, et les prises de contrôle complètes 0,7 %. Après la fourniture de retours, les agents ont géré eux-mêmes les révisions dans 75,4 % des cas. En pratique, le goulot d’étranglement humain était donc généralement le jugement et l’information, et non l’exécution manuelle de la tâche.

Le problème de supervision s’aggrave avec l’activité des agents

Les résultats n’écartent pas la possibilité d’un développement de modèles plus autonome. Ils identifient plutôt un problème de contrôle qui se renforce à mesure que les chaînes d’agents s’allongent. Si personne ne peut inspecter chaque action intermédiaire, la revue humaine risque de se dégrader en approbation de résumés ou de résultats finaux plutôt qu’en supervision réelle.

Les chercheurs ont également observé que les participants utilisaient souvent les modes autonomes pour éviter d’interrompre des processus longs. Cette limite aurait été choisie pour des raisons de commodité, et non parce que les équipes avaient formellement décidé du niveau d’autorité à accorder aux agents. Pour les équipes d’IA en entreprise, c’est un avertissement : des réglages opérationnels peuvent discrètement devenir des décisions de gouvernance.

L’étude place les systèmes actuels entre deux étapes de développement : l’IA a dépassé le stade d’objet de recherche ou d’outil étroit pour une tâche précise, mais elle n’est pas encore devenue clairement une directrice de recherche indépendante. Les auteurs décrivent une étape possible suivante comme une amélioration récursive de soi, dans laquelle des systèmes plus puissants contribuent à produire leurs successeurs, tout en soulignant que le passage d’une meilleure performance sur des tâches d’entraînement à une meilleure conception de modèles reste non résolu.

Ce qu’il faut surveiller ensuite

La question la plus importante à suivre sera de savoir si des schémas de décision similaires apparaissent dans d’autres organisations et projets de développement de modèles. Cette étude a examiné le travail d’une seule équipe, donc ses observations ne doivent pas être considérées comme une mesure universelle de l’autonomie de l’IA.

Les chercheurs et les acheteurs devraient surveiller trois signaux. Premièrement, les évaluations futures devraient séparer les actions des agents des décisions concernant les objectifs, les méthodes et l’allocation des ressources. Deuxièmement, les plateformes de développement pourraient avoir besoin de pistes d’audit montrant comment une recommandation finale a émergé d’une longue chaîne d’agents. Troisièmement, les entreprises qui prétendent mener des recherches automatisées sur l’IA devraient divulguer à quelle fréquence les humains fixent les objectifs, rejettent des propositions, changent de méthode ou interviennent après des échecs.

Le débat sur l’amélioration récursive de soi dépendra également d’éléments de preuve concernant le jugement de recherche, et pas seulement la vitesse de codage ou le débit des expériences. Les affirmations d’entreprises telles que Anthropic concernant une direction de recherche de plus en plus automatisée restent une catégorie de preuve distincte de ce projet décrit indépendamment et ne doivent pas être considérées comme directement comparables sans mesures communes.

Point de vue de Creati.ai

La leçon centrale de cette étude est opérationnelle : davantage d’activité des agents ne signifie pas nécessairement davantage d’autorité des agents. Les agents d’IA peuvent multiplier le nombre d’expériences et de tâches d’ingénierie qu’une équipe peut mener, tandis que les humains continuent de déterminer quelles questions comptent et si les résultats justifient un changement de cap.

Pour les développeurs et les équipes d’entreprise, la priorité immédiate n’est pas simplement de maximiser les exécutions autonomes. Il s’agit de concevoir des systèmes qui préservent la traçabilité des décisions, mettent en évidence l’incertitude et permettent d’examiner les choix dissimulés dans de longues chaînes de travail d’agents. Tant que les agents ne peuvent pas évaluer de manière fiable les objectifs de recherche avant que les résultats ne soient disponibles, le jugement humain reste la ressource rare dans le développement de modèles.

Publicités