Pourquoi un ancien chercheur d’AlphaGo affirme que les LLM actuels ne raisonnent toujours pas

L’ancien chercheur d’AlphaGo Thore Graepel estime que les LLM ont besoin d’états de croyance auditables et de recherche, pas simplement de chaînes de pensée plus longues.

AI News

Les grands modèles de langage sont devenus meilleurs pour produire des réponses étape par étape, mais cette délibération apparente ne constitue pas nécessairement un raisonnement, selon Thore Graepel, ancien chercheur de Google DeepMind et membre clé de l’équipe AlphaGo.

Dans une analyse publiée par MIT Technology Review, Graepel soutient que les LLM actuels restent fondamentalement des systèmes de prédiction du prochain token. Selon lui, une intelligence artificielle digne de confiance nécessitera une architecture de raisonnement distincte, capable d’enregistrer les croyances, de tester différentes explications, de mettre à jour ses conclusions à partir des preuves et de rendre son processus de décision vérifiable.

Cet argument est important alors que les concepteurs d’IA et les acheteurs professionnels déploient de plus en plus de modèles pour le codage, la recherche, le diagnostic, la planification et d’autres tâches où une réponse plausible ne suffit pas. La proposition de Graepel n’est ni une annonce de produit ni un nouveau résultat de benchmark. Il s’agit d’une critique technique formulée par un chercheur reconnu qui a récemment quitté Google DeepMind et appelle à une autre orientation du développement de l’IA.

L’argument derrière le titre

La distinction centrale de Graepel oppose la complétion fluide de motifs au raisonnement délibératif. Un LLM génère un token après l’autre à partir de relations statistiques apprises dans les données. Ce processus peut produire des explications utiles, des solutions mathématiques et du code, mais le mécanisme sous-jacent reste le même, même lorsque le modèle génère des étapes intermédiaires.

Ces étapes intermédiaires sont généralement appelées chaîne de pensée. Graepel reconnaît qu’une chaîne de pensée peut améliorer les performances, notamment en mathématiques et en programmation. Son objection est que produire davantage de texte ne crée pas un système de raisonnement indépendant. Le modèle prolonge toujours une séquence par prédiction du prochain token, au lieu de manipuler un ensemble explicite de propositions ou d’hypothèses.

Il identifie trois faiblesses. Les modèles actuels ne disposent généralement pas d’un registre persistant et vérifiable de ce qu’ils croient, de leur degré de confiance, des preuves soutenant chaque affirmation et des questions restant sans réponse. Ils combinent également les connaissances stockées avec les opérations servant à les manipuler à l’intérieur des poids du réseau neuronal, au lieu de maintenir une séparation nette entre connaissances et raisonnement. Enfin, leurs explications écrites peuvent ne pas représenter fidèlement la manière dont une réponse a été produite.

Ce dernier problème est particulièrement lourd de conséquences pour les systèmes à forts enjeux. Si une IA commet une erreur en médecine, en ingénierie ou dans la recherche scientifique, les utilisateurs doivent pouvoir déterminer si l’échec vient de mauvaises preuves, d’une hypothèse invalide ou d’une inférence erronée. Une explication convaincante générée après la réponse peut ne pas fournir cette information diagnostique.

Ce qu’AlphaGo a fait différemment

Graepel utilise AlphaGo pour illustrer le type d’architecture dont l’IA moderne aurait besoin selon lui. Lors de son match de 2016 contre le champion sud-coréen Lee Sedol, AlphaGo a joué un coup inhabituel appelé le coup 37. Ce coup a d’abord semblé être une erreur, mais AlphaGo a finalement remporté la partie et le match par 4 à 1.

Le point essentiel, soutient Graepel, est que ce coup ne provenait pas de l’intuition seule. AlphaGo combinait un réseau neuronal de politique, qui estimait les coups prometteurs, avec un système de recherche explorant les suites possibles. La recherche construisait un arbre de jeu contenant des positions alternatives et des coups futurs, puis évaluait ces branches avant de sélectionner une action.

Dans cette conception, les réseaux neuronaux fournissaient des jugements rapides, tandis que la recherche apportait une délibération structurée. Graepel compare cet agencement à la distinction comportementale entre pensée rapide et intuitive, et pensée plus lente et analytique. Les deux composants se soutenaient mutuellement : l’intuition réduisait les possibilités, tandis que la recherche testait ces possibilités face à leurs conséquences futures.

La comparaison a toutefois ses limites. Le go fournit un plateau défini, un ensemble fixe d’actions légales et des règles qui déterminent l’issue de chaque coup. Les problèmes ouverts de la science ou des affaires ne présentent pas ces conditions. L’état du monde est incomplet, les actions disponibles varient et les conséquences peuvent être incertaines.

Même ainsi, Graepel estime que cette architecture offre un modèle utile. Un système de raisonnement généraliste pourrait conserver un « état épistémique », c’est-à-dire un registre structuré des affirmations établies, des doutes, des explications rejetées, des questions ouvertes et des preuves à l’appui. Chaque étape de raisonnement mettrait à jour cet état au lieu de simplement ajouter du texte généré.

Preuves et affirmations

Les affirmations les plus fortes de cette histoire proviennent de l’analyse de Graepel publiée dans MIT Technology Review, et non d’une nouvelle expérience rapportée ou d’une évaluation indépendante d’un produit. L’article fournit des détails historiques et architecturaux sur AlphaGo, mais ne présente pas de nouveau benchmark comparant les LLM actuels à un système d’état épistémique proposé.

Graepel fait également référence à des travaux montrant que les modèles de langage peuvent produire des explications qui ne reflètent pas de manière fiable les processus ayant conduit à leurs réponses. L’article fourni n’identifie pas suffisamment précisément les études, les jeux de données ou les résultats de modèles concernés pour permettre d’évaluer ici l’ampleur ou la généralité de cet effet.

Cette distinction est importante. La critique ne signifie pas que les modèles actuels sont inutiles ou incapables de résoudre des problèmes en plusieurs étapes. Elle signifie que la performance sur une tâche ne doit pas automatiquement être considérée comme la preuve qu’un modèle raisonne au même sens qu’un système qui suit explicitement les alternatives, les preuves et les révisions de croyances.

L’article présente également l’orientation de conception proposée par Graepel. Il suggère d’utiliser les LLM pour proposer des stratégies, interagir avec des outils au moyen d’API ou de code et évaluer si les affirmations sont étayées par des preuves. Un évaluateur indépendant déterminerait ensuite si chaque étape réduit réellement l’incertitude avant d’autoriser le système à mettre à jour ses connaissances.

Ce qu’il faudra surveiller ensuite

Pour les concepteurs d’IA, le signal concret sera de voir si les nouveaux systèmes dépassent les prompts plus longs et les traces de raisonnement générées plus longues. Les développeurs devraient surveiller les architectures qui conservent un état intermédiaire vérifiable, séparent la mémoire factuelle des procédures d’inférence et consignent la manière dont les preuves modifient une conclusion.

L’utilisation d’outils sera un autre domaine clé. Un système capable d’exécuter du code, d’interroger des bases de données, de récupérer des documents ou de concevoir une expérience pourrait devenir plus fiable si ces actions sont reliées à des tests explicites, plutôt que traitées comme des ornements autour d’une réponse de modèle de langage. La question pertinente n’est pas simplement de savoir si un agent appelle un outil, mais si le résultat modifie un état de croyance structuré de manière traçable.

Les acheteurs professionnels devraient également demander aux fournisseurs comment ils auditent les décisions des modèles, reproduisent les défaillances et distinguent les preuves récupérées des affirmations générées. Les interfaces actuelles de chaîne de pensée peuvent donner l’impression qu’une réponse est davantage raisonnée sans rendre le processus sous-jacent plus vérifiable.

Les chercheurs devront quant à eux montrer si les architectures inspirées d’AlphaGo peuvent gérer des tâches en monde ouvert sans devenir trop coûteuses ou trop lentes. Le maintien et l’évaluation de nombreuses hypothèses peuvent améliorer la fiabilité, mais aussi accroître les besoins de calcul, la latence, la complexité technique et la charge de validation de chaque mise à jour.

Le point de vue de Creati.ai

L’intervention de Graepel doit surtout être comprise comme une remise en question de la manière dont l’industrie de l’IA définit le progrès. De meilleurs résultats aux benchmarks de raisonnement et des explications plus élaborées sont utiles, mais ne suffisent pas à établir qu’un modèle dispose d’un processus de raisonnement auditable.

Le test le plus difficile est opérationnel : un système peut-il préserver l’incertitude, exposer les preuves à l’origine d’une conclusion, réviser ses croyances lorsque de nouvelles informations arrivent et montrer où une défaillance s’est produite ? Si l’IA doit soutenir la découverte scientifique, la médecine et d’autres flux de travail à forts enjeux, ces capacités pourraient compter autant que la taille brute du modèle. La prochaine génération de systèmes d’IA sera jugée non seulement sur les réponses qu’elle produit, mais aussi sur la possibilité pour les utilisateurs d’examiner et de juger fiable le chemin suivi pour y parvenir.

Publicités