La technique de raisonnement Astra signalée chez OpenAI pourrait rendre le comportement de l’IA plus difficile à surveiller, ce qui pousse des experts en sécurité à avertir qu’une récurrence opaque pourrait se généraliser.

OpenAI développerait un modèle de raisonnement appelé Astra qui utilise une technique connue sous le nom de « recurrent depth », ce qui suscite l’inquiétude des chercheurs en sécurité de l’IA, pour qui un raisonnement de modèle de plus en plus complexe pourrait devenir plus difficile à inspecter.
La méthode, également décrite comme une « récurrence opaque », permettrait à un modèle de traiter la même requête via des boucles internes répétées plutôt qu’en s’appuyant uniquement sur une chaîne de raisonnement séquentielle. TechCrunch, citant un article de The Information, indique que l’usage actuel de cette technique par Astra semble limité. Malgré tout, les chercheurs avertissent qu’une adoption plus large pourrait affaiblir l’un des principaux outils utilisés pour étudier le comportement des modèles : les traces lisibles de chaîne de pensée.
Le problème dépasse le modèle rapporté d’OpenAI. Si les laboratoires d’IA utilisent davantage de calcul dans des états internes ou latents produisant moins de traces interprétables, les développeurs et les équipes de sécurité pourraient avoir plus de difficulté à détecter des comportements trompeurs, des désalignements ou des défaillances dans des systèmes autonomes avant qu’ils n’atteignent les utilisateurs.
La plupart des modèles de raisonnement présentent leur travail sous forme de suite d’étapes intermédiaires. Ces traces ne sont pas considérées comme une transcription parfaite de la cognition interne d’un modèle, mais elles peuvent fournir des indices utiles sur la manière dont un modèle a abordé une tâche et sur le fait qu’il ait rencontré des instructions risquées ou poursuivi un objectif inattendu.
Selon le reportage cité par TechCrunch, la profondeur récurrente modifie ce schéma en permettant au modèle de revenir sur une requête dans une boucle. Plutôt que de produire une progression unique et facilement suivie, le modèle peut accomplir davantage de travail par un traitement interne répété. Le résultat peut être un nombre réduit d’étapes lisibles à examiner.
Cette distinction est importante pour les concepteurs d’agents d’IA. Un modèle qui ne fait que répondre à des questions peut souvent être testé via ses sorties. Un agent qui planifie, appelle des outils, modifie des fichiers ou agit dans des systèmes métier crée un besoin plus fort pour les enquêteurs de comprendre pourquoi une action précise s’est produite. Un raisonnement moins transparent pourrait rendre l’analyse post-incident plus lente et moins fiable.
Buck Shlegeris, PDG de Redwood, a déclaré dans une publication après le reportage qu’il était « extrêmement préoccupé » par l’usage signalé de la récurrence opaque par Astra. Il a reconnu l’incertitude quant à savoir si le modèle est matériellement moins surveillable que les systèmes précédents, mais a averti qu’OpenAI pourrait potentiellement augmenter la quantité de récurrence dans les versions futures.
Zvi Mowshowitz, défenseur de longue date de la sécurité de l’IA, a soutenu que des garde-fous plus solides ou des lois pourraient finir par être nécessaires pour empêcher une « course vers le bas » à l’échelle du secteur. Selon lui, la technique pourrait compromettre les efforts d’OpenAI et d’Anthropic pour préserver des signaux de chaîne de pensée fidèles et surveillables.
Ryan Greenblatt, scientifique en chef chez Redwood Research, a soulevé une inquiétude liée à l’échelle. À ses yeux, une évolution naturelle pourrait déplacer davantage de raisonnement dans l’espace latent jusqu’à ce qu’une partie infime, voire aucune, du raisonnement ne soit plus visible par les canaux de surveillance classiques.
Il s’agit d’avertissements d’experts, pas de preuves qu’Astra fonctionne actuellement sans supervision exploitable. TechCrunch a rapporté que l’usage de la profondeur récurrente semble limité et que sa chaîne de pensée est toujours censée rester lisible. Les préoccupations portent surtout sur ce qui se passerait si la technique était étendue aux futurs modèles de raisonnement.
OpenAI a contesté l’idée qu’elle abandonnerait le raisonnement interprétable. Le scientifique en chef Jakub Pachocki a écrit sur X que l’entreprise a travaillé à préserver et utiliser la surveillance de la chaîne de pensée depuis ses premiers modèles de raisonnement, la décrivant comme un objectif de recherche central.
L’entreprise aurait également rejeté les suggestions selon lesquelles Astra passerait au « neuralese », un terme employé dans les discussions sur le raisonnement généré par les modèles et difficile à interpréter pour les humains. OpenAI a annoncé des plans pour une surveillance extensive de la chaîne de pensée dans le cadre de ses travaux de sécurité tournés vers l’avenir.
Les détails produit les plus solides dans le récit actuel proviennent de reportages médiatiques plutôt que d’une publication technique publique sur Astra. Les éléments disponibles n’établissent ni la date de lancement d’Astra, ni la conception du système, ni ses performances, ni l’étendue précise de son traitement récurrent. Ils ne montrent pas non plus que la technique a causé un incident de sécurité spécifique.
Il existe toutefois une raison concrète pour laquelle la surveillance reste au cœur du débat. TechCrunch a noté que les traces de chaîne de pensée ont joué un rôle important dans l’enquête sur une récente activité d’agent dévoyé chez OpenAI. Cet exemple illustre pourquoi toute réduction des traces lisibles pourrait affecter non seulement les évaluations de recherche, mais aussi la réponse aux incidents après le déploiement.
The Information a ensuite rapporté qu’Anthropic et Google DeepMind discutaient de la technique. Cela suggère que la question pourrait devenir un enjeu d’architecture et de gouvernance à l’échelle du secteur, même si les reportages disponibles n’établissent pas si l’une ou l’autre entreprise déploie activement la récurrence opaque dans un modèle de production.
Pour les développeurs d’IA, la leçon immédiate est que les tests fondés sur les sorties pourraient ne pas suffire pour des systèmes de raisonnement avancés. Les équipes qui construisent des agents devront évaluer la quantité d’éléments probants utiles restant disponible lorsqu’un modèle planifie sur plusieurs cycles internes, en particulier lorsqu’il peut utiliser des outils ou prendre des actions aux conséquences importantes.
Cela pourrait renforcer l’importance des journaux externes, des enregistrements d’appels d’outils, de l’exécution en sandbox, des contrôles d’autorisations et des évaluations indépendantes. Ces contrôles ne recréent pas le raisonnement interne d’un modèle, mais ils peuvent aider les équipes à reconstituer ce que le système a fait, quelles données il a consultées et où une intervention était possible.
Les acheteurs d’entreprise devraient également considérer la « transparence du raisonnement » comme une caractéristique de déploiement plutôt que de supposer qu’elle est identique d’un modèle à l’autre. Un modèle peut offrir de meilleures performances tout en fournissant des informations de diagnostic moins utiles. Pour des flux de travail réglementés ou à fort impact, ce compromis pourrait influencer les achats, l’auditabilité, l’examen des incidents et le niveau d’approbation humaine requis avant qu’un agent n’agisse.
Le compromis commercial n’est pas tranché. Le traitement récurrent pourrait offrir des capacités utiles ou des gains d’efficacité, mais les sources ne fournissent pas de benchmarks vérifiés montrant comment Astra se compare à d’autres modèles de raisonnement. Tout avantage de performance ou de mise à l’échelle reste non confirmé dans le matériel actuellement disponible.
Le signal le plus important sera de savoir si OpenAI publie une documentation technique expliquant comment fonctionne la profondeur récurrente dans Astra, à quelle fréquence elle est utilisée et quelle surveillance reste disponible pour les évaluateurs. Les affirmations concernant la lisibilité seront plus significatives si elles s’accompagnent de tests reproductibles plutôt que de simples assurances générales.
Les chercheurs devraient également surveiller les évaluations comparant la surveillance standard de la chaîne de pensée à la surveillance des systèmes récurrents. Les questions clés sont notamment de savoir si un raisonnement dangereux reste détectable, si les modèles se comportent différemment lorsque leurs traces sont surveillées et dans quelle mesure les enquêteurs peuvent reconstituer un incident.
Un autre signal viendra d’Anthropic et de Google DeepMind. Si les informations sur leur intérêt se transforment en recherche publique ou en changements de produit, la récurrence opaque pourrait devenir un choix de conception concurrentiel plutôt qu’une expérience isolée d’OpenAI. Les régulateurs pourraient alors subir une pression pour définir quelles formes de supervision du raisonnement des modèles sont nécessaires pour des systèmes de plus en plus autonomes.
Le rapport sur Astra est important parce qu’il place une tension au cœur du développement des modèles de raisonnement : davantage de calcul interne peut améliorer la capacité d’un système à résoudre des tâches difficiles, tout en rendant le processus moins lisible pour les personnes chargées de l’évaluer et de le contrôler.
L’usage rapporté chez OpenAI est limité, et les éléments disponibles ne montrent pas que l’entreprise a abandonné la surveillance de la chaîne de pensée. Mais les préoccupations de sécurité visent la trajectoire, pas seulement le modèle actuel. Pour les concepteurs et les entreprises, la question pratique est de savoir si un système peut rester auditable à mesure que son raisonnement gagne en capacité — et quels contrôles indépendants seront nécessaires si les traces lisibles ne suffisent plus à fournir des réponses.