Les étapes de raisonnement écrit des modèles d’IA correspondent à des schémas internes distincts, selon une étude

Une étude de KAIST et de Naver AI Lab révèle que les modèles encodent en interne des opérations de raisonnement distinctes, ouvrant de nouvelles possibilités et de nouvelles limites pour la supervision de l’IA.

AI News

Une étude menée par des chercheurs de KAIST, en Corée du Sud, et de Naver AI Lab montre que plusieurs opérations de raisonnement visibles dans la solution écrite d’un modèle d’IA apparaissent également sous forme de schémas séparables dans ses représentations internes. Le signal était le plus fort dans les couches intermédiaires des modèles testés, ce qui suggère que l’activité interne pourrait révéler davantage sur le calcul d’un modèle que son texte final seul.

Cette découverte est importante parce que les développeurs utilisent de plus en plus le raisonnement écrit comme une fenêtre imparfaite sur la manière dont les modèles résolvent les problèmes. Si les états internes distinguent des activités comme récupérer une formule, décomposer une tâche ou effectuer un calcul, les chercheurs pourraient un jour être en mesure de surveiller ou d’intervenir directement sur ces processus. L’étude ne montre pas encore que ces schémas peuvent détecter de manière fiable les erreurs ou contrôler la génération en temps réel.

Ce que les chercheurs ont découvert

L’équipe a examiné trois modèles — Qwen2.5-7B, Qwen3-8B et Gemma4-31B — alors qu’ils résolvaient des problèmes de mathématiques. Les chercheurs ont découpé les solutions générées en segments et ont classé chaque segment selon l’une de huit opérations récurrentes. Les catégories comprenaient l’extraction d’informations, la décomposition d’un problème en parties, le rappel d’une formule, la déduction et le calcul.

Les étiquettes de classification ont été produites avec GPT-5, selon le compte rendu de The Decoder sur la recherche. Les chercheurs ont ensuite testé si les représentations numériques internes des modèles contenaient suffisamment d’informations pour distinguer ces opérations.

Dans les trois modèles, des classificateurs ont pu séparer les catégories de raisonnement à partir des représentations internes. La distinction était la plus marquée dans les couches intermédiaires, plutôt qu’au début ou à la fin des réseaux. Ce schéma suggère que les modèles peuvent d’abord traiter le langage sous une forme relativement mélangée avant de l’organiser en états internes plus spécifiques à une opération.

Les chercheurs ont également constaté que des mots courants pouvaient prendre des représentations internes différentes selon l’activité de raisonnement environnante. Des termes comme « a », « is » et « the » apparaissaient dans de nombreuses catégories en surface, mais leurs états internes se séparaient selon l’opération en cours.

Ce résultat est important car il va à l’encontre d’une explication simple fondée uniquement sur le vocabulaire. Un classificateur utilisant les jetons eux-mêmes a obtenu de moins bons résultats qu’un classificateur utilisant les représentations internes. La position d’un segment dans la solution n’expliquait pas non plus cette séparation.

Preuves et limites du résultat

L’étude comprenait plusieurs tests destinés à montrer que le signal reflétait davantage que de simples motifs textuels superficiels. Dans une intervention, les chercheurs ont bloqué l’attention portée aux 30 jetons précédents. La représentation associée à l’opération courante s’est affaiblie, ce qui indique qu’une étape de raisonnement dépend du contexte antérieur plutôt que de se former de manière indépendante.

Les catégories d’opérations restaient également identifiables lorsque le modèle aboutissait à une mauvaise réponse. Un calcul erroné ressemblait toujours, en interne, à un calcul, tandis que la récupération de formule et la déduction conservaient leurs signatures respectives. Cette distinction pourrait un jour aider les chercheurs à séparer le type de processus qu’un modèle tente d’exécuter de la question de savoir si ce processus a produit un résultat correct.

L’effet rapporté a été reproduit avec Llama-3-8B. Pour Qwen3-8B, des classificateurs entraînés sur un ensemble de tâches ont été transférés à GPQA-Diamond et MATH-500, selon The Decoder. Ces tests supplémentaires suggèrent que les représentations pourraient se généraliser au-delà des exemples initiaux, mais ils n’établissent pas une fiabilité large à travers les modèles ou les domaines.

Les preuves restent limitées. Les expériences se sont concentrées sur des tâches de mathématiques et un petit groupe de modèles de langage. Le compte rendu disponible ne fournit pas assez de détails pour évaluer l’ensemble du jeu de données, la conception du classificateur, les marges statistiques ou le fait que la recherche ait été reproduite indépendamment. Le transfert à d’autres domaines, à des traces de raisonnement plus longues, à des systèmes multimodaux et à des modèles à l’échelle de production reste non testé dans les preuves disponibles.

Pourquoi cela compte pour la sécurité de l’IA et pour les créateurs de modèles

L’implication centrale est que la chaîne de pensée visible d’un modèle n’est peut-être qu’un compte rendu partiel de son calcul interne. The Decoder cite des travaux antérieurs d’Anthropic indiquant que les modèles ne révélaient les indices utilisés dans leur raisonnement que dans 25 % à 39 % des cas. Il renvoie également à des recherches suggérant que Claude Opus 4.6 traite des informations qui n’apparaissent pas dans son raisonnement en sortie.

Cette limite complique les systèmes de supervision construits autour de la lecture d’explications générées. Un modèle peut produire une explication plausible tout en s’appuyant sur des étapes internes absentes du texte, ou bien décrire une opération de raisonnement sans l’exécuter correctement. Le résultat de KAIST et Naver AI Lab ne résout pas ce problème, mais il fournit des preuves que les représentations internes contiennent des informations structurées sur le type de raisonnement en cours.

Pour les chercheurs en modèles, la prochaine opportunité consiste à entraîner des sondes qui identifient les opérations pendant la génération. De tels outils pourraient potentiellement signaler un calcul inattendu, détecter un passage de la déduction à une supposition non fondée, ou aider à diagnostiquer pourquoi une solution a échoué. Pour les équipes produit, cependant, ces possibilités restent des pistes de recherche plutôt que des garde-fous déployables.

Cette découverte pourrait aussi devenir pertinente à mesure que davantage de systèmes déplacent le raisonnement vers des états numériques cachés. The Decoder relie ce travail à OpenAI Astra et à sa technique Recurrent Depth, qui déplace une partie du processus de raisonnement hors du texte visible habituel. Si les modèles effectuent de plus en plus de calculs en interne, les méthodes qui inspectent les représentations pourraient devenir plus importantes que celles qui n’analysent que les explications générées.

Ce qu’il faut surveiller ensuite

Le suivi le plus important consiste à savoir si les signatures d’opérations restent stables en dehors des mathématiques. Des tests en codage, en analyse scientifique, en planification et en utilisation d’outils montreraient si les schémas décrivent des fonctions générales de raisonnement ou reflètent surtout la structure des solutions mathématiques.

Les chercheurs devront également déterminer si les signaux internes peuvent identifier les erreurs avant qu’un modèle ne termine une réponse. Le résultat actuel montre qu’un calcul incorrect peut toujours être reconnu comme un calcul ; il ne montre pas qu’un système de surveillance peut dire quand le calcul a mal tourné.

Une autre question ouverte concerne l’intervention. L’étude a montré que la suppression du contexte précédent affaiblit le signal, mais elle n’a pas montré que le renforcement ou la modification d’une représentation peut orienter de manière fiable le modèle vers une opération souhaitée. La reproductibilité sur des modèles plus grands et plus diversifiés sera un autre test clé.

Les acheteurs d’IA en entreprise devraient surveiller les outils de supervision qui prétendent lire le raisonnement caché. Tant que ces méthodes n’auront pas été validées sur différentes tâches et évaluées face à des comportements adversariaux, l’analyse de l’état interne devrait compléter — et non remplacer — les tests de sortie, la vérification des résultats d’outils et les contrôles de sécurité conventionnels.

Perspective de Creati.ai

Cette étude renforce une vision prudente de la surveillance de la chaîne de pensée : le raisonnement écrit est une preuve utile, mais pas une transcription complète du calcul du modèle. Les schémas internes identifiés par les chercheurs montrent que les modèles encodent des distinctions entre activités de raisonnement, mais l’écart entre l’identification d’un processus et son évaluation ou son contrôle reste important.

Pour les développeurs, la leçon pratique consiste à considérer les sondes d’interprétabilité comme une couche diagnostique émergente. Elles pourraient à terme aider au débogage des modèles et à l’évaluation de la sécurité, en particulier pour les systèmes qui cachent davantage leur raisonnement. Pour l’instant, l’affirmation la plus solide soutenue par les preuves est plus étroite : les représentations internes contiennent des signaux structurés sur le type d’étape de raisonnement qu’un modèle semble être en train d’exécuter, même lorsque la réponse est erronée.

Publicités