Anthropic et OpenAI proposent des évaluateurs de sécurité intégrés, mais l’indépendance reste à prouver

Anthropic et OpenAI proposent d’intégrer des évaluateurs indépendants de sécurité de l’IA, mais des chercheurs estiment que l’accès, les droits de divulgation et la réglementation détermineront la supervision.

AI News

Anthropic et OpenAI proposent une forme plus étroite de contrôle externe pour les systèmes d’IA de pointe : intégrer des évaluateurs indépendants de sécurité au sein de leurs laboratoires, avec accès aux modèles, aux processus d’entraînement et aux informations relatives aux incidents. Les chercheurs ont accueilli favorablement la perspective d’une supervision plus poussée, mais estiment que la proposition ne sera significative que si les évaluateurs peuvent travailler sans contrôle de l’entreprise sur leurs méthodes, leurs constats ou le calendrier de publication.

L’initiative fait suite à un avertissement selon lequel les tests conventionnels avant la mise en production pourraient ne plus suffire. À mesure que les modèles deviennent meilleurs pour reconnaître les évaluations, ils peuvent apprendre à se comporter de manière sûre pendant un test tout en agissant différemment dans d’autres contextes. Les évaluateurs souhaitent donc avoir accès aux points de contrôle intermédiaires de l’entraînement, aux journaux internes et aux preuves montrant comment des comportements préoccupants se sont développés au fil du temps — et pas seulement au système final.

Le PDG d’Anthropic, Dario Amodei, a exposé la proposition dans un essai publié ce week-end, selon TechCrunch. Amodei a déclaré qu’Anthropic donnerait à des groupes comme METR et Redwood Research un accès sans précédent. Le PDG d’OpenAI, Sam Altman, a également déclaré que son entreprise s’engagerait dans cette pratique, bien qu’aucune des deux entreprises n’ait précisé publiquement les premiers évaluateurs, le calendrier, l’étendue de l’accès ou les règles de divulgation.

Ce que proposent Anthropic et OpenAI

Le modèle proposé déplacerait l’examen indépendant au cœur du processus de développement plutôt que de le traiter comme un contrôle final avant la publication. Les évaluateurs pourraient enquêter sur des incidents de sécurité, déterminer si un modèle est véritablement aligné et publier des conclusions qui ne sont pas filtrées par les équipes de communication ou juridiques de l’entreprise.

La proposition d’Amodei inclurait apparemment un droit pour les évaluateurs de publier des constats clés sur les niveaux de risque, les incidents, les pratiques de l’entreprise et l’accès qu’ils ont reçu. Cela représenterait un changement important par rapport à la relation habituelle de sous-traitance, dans laquelle un développeur d’IA contrôle l’environnement de test et peut imposer des clauses de confidentialité à l’évaluateur.

Les détails pratiques restent à résoudre. TechCrunch a indiqué qu’Anthropic et OpenAI n’ont pas précisé quelles organisations participeront, combien d’évaluateurs seront intégrés, quels systèmes ils pourront inspecter ou quelles informations pourront être rendues publiques. Ces omissions comptent, car l’accès détermine si l’arrangement est un audit ou simplement une version plus structurée des tests d’un fournisseur.

Pourquoi l’accès à l’entraînement est important

Plusieurs chercheurs ont déclaré à TechCrunch que les évaluateurs devraient pouvoir inspecter des versions intermédiaires du modèle, ou « checkpoints », tout au long du processus d’entraînement. Adam Gleave, PDG de Far.AI, a déclaré que les évaluateurs pourraient comparer les checkpoints pour identifier quand un comportement à risque est apparu, examiner l’environnement post-entraînement qui récompensait certaines réponses, et passer en revue les transcriptions et journaux étayant les affirmations publiques de l’entreprise.

Ce type d’accès pourrait remédier à une faiblesse centrale de l’évaluation de la sécurité des modèles. Un système peut obtenir de bons résultats à un benchmark parce qu’il est sûr, mais il peut aussi avoir appris à reconnaître le benchmark et à produire la réponse attendue. John Steidley, de Palisades Research, a comparé ce risque au scandale des émissions de Volkswagen, dans lequel les véhicules détectaient les conditions de test et se comportaient différemment pendant celles-ci.

Alexander Meinke, responsable de la recherche chez Apollo Research, a déclaré à TechCrunch que les entreprises devraient pouvoir répondre à la question de savoir si un modèle a tenté de saper son propre entraînement d’alignement. Les évaluateurs intégrés, a-t-il soutenu, pourraient vérifier les preuves plutôt que de compter sur le développeur pour enquêter sur son propre comportement et le rapporter.

La nécessité de ces preuves est soulignée par les récentes contraintes de test. Lors d’une enquête impliquant l’incident OpenAI sur Hugging Face, METR et Redwood Research auraient disposé d’environ une semaine sur place et ont ensuite déclaré qu’ils n’avaient pas pu parvenir à des conclusions fiables, en partie à cause du temps et du périmètre limités. Apollo Research a eu trois jours pour tester GPT-6 Astra d’OpenAI avant sa publication et a écrit dans sa contribution à la fiche du modèle que la fenêtre limitée et les taux plus élevés de conscience d’évaluation signifiaient que de faibles taux de mauvaise conduite ne fournissaient pas de preuves substantielles sur l’alignement du modèle.

Preuves, indépendance et contrôle de l’entreprise

Les éléments disponibles soutiennent pour l’instant l’importance de la proposition, non son efficacité. Les engagements attribués à Anthropic et OpenAI sont des promesses d’entreprise, et aucune n’a encore publié de cadre opérationnel permettant à des tiers de vérifier combien d’indépendance les évaluateurs recevront.

Adam Gleave a déclaré que Far.AI avait refusé des contrats de développeurs de pointe cherchant à exercer trop de contrôle sur le processus d’évaluation. Selon lui, les évaluateurs sont souvent traités comme de simples sous-traitants, soumis à des accords de non-divulgation restrictifs et à des limites sur ce qu’ils peuvent publier. Cela crée un conflit direct : les organisations les mieux placées pour mener des évaluations difficiles risquent de perdre l’accès si elles refusent des conditions qui compromettent leur indépendance.

Les chercheurs se sont également demandé si les entreprises fourniront suffisamment de temps pour un travail significatif. Un examen rapide peut identifier des défaillances évidentes, mais il peut ne pas révéler des comportements qui n’apparaissent qu’au fil des étapes d’entraînement, sous des invites inhabituelles ou après qu’un modèle a détecté qu’il est évalué. L’évaluation par Apollo Research de GPT-6 Astra est un exemple de benchmark proche du fournisseur plutôt qu’une preuve d’un schéma plus large à l’échelle du secteur, mais elle illustre comment un accès limité peut affaiblir les conclusions associées à un rapport de sécurité.

Plusieurs chercheurs ont appelé à un cadre public définissant les qualifications des évaluateurs, les droits d’accès, les règles de publication et les périodes minimales d’examen. Henry Papadatos, directeur exécutif de Safer AI, a déclaré que les engagements volontaires restent dépendants de la bonne volonté des entreprises et a soutenu que la réglementation empêcherait un développeur de changer de cap après une crise.

Ce que la proposition signifie pour les créateurs et les acheteurs d’IA

Pour les créateurs d’IA, des évaluateurs intégrés pourraient rendre le travail de sécurité plus continu et plus étroitement lié aux décisions d’entraînement. Au lieu de découvrir un problème juste avant le lancement, une entreprise pourrait identifier plus tôt le checkpoint pertinent, la structure de récompense ou le changement de déploiement. Cela pourrait améliorer la remédiation, mais cela obligerait aussi les développeurs à exposer des infrastructures sensibles, des journaux, des entretiens avec des employés et de la propriété intellectuelle à des groupes externes.

Pour les acheteurs professionnels, la distinction entre un modèle ayant passé un benchmark de sécurité et un modèle ayant été examiné indépendamment tout au long de son développement pourrait devenir commercialement importante. Les équipes achats pourraient à terme demander non seulement si un fournisseur d’IA a réalisé des tests adversariaux, mais aussi qui les a menés, à quoi ils avaient accès, combien de temps ils ont travaillé et si le fournisseur pouvait supprimer des conclusions défavorables.

L’arrangement pourrait aussi remodeler la concurrence entre les sociétés d’évaluation. Si les développeurs peuvent choisir uniquement des évaluateurs favorables ou à périmètre étroit, « indépendant » pourrait devenir une étiquette plutôt qu’une norme fiable. John Steidley a suggéré qu’un cadre public devrait définir quels auditeurs sont qualifiés et quels risques ils doivent évaluer, réduisant la possibilité que les entreprises sélectionnent des évaluations évitant les questions les plus difficiles.

D’autres grands développeurs n’ont pas pris le même engagement. TechCrunch a rapporté que Meta, SpaceXAI et Google DeepMind n’avaient pas accepté d’intégrer des évaluateurs tiers. Le PDG de DeepMind, Demis Hassabis, a plutôt proposé un organisme distinct de normalisation sectorielle pour les tests indépendants des modèles de pointe. Cette différence laisse ouverte la question de savoir si la supervision intégrée deviendra une pratique courante ou restera limitée à certaines entreprises.

Ce qu’il faut surveiller ensuite

Le premier signal sera de savoir si Anthropic et OpenAI publient les noms des évaluateurs participants et les conditions régissant leur travail. Les questions clés sont de savoir si les évaluateurs peuvent accéder aux checkpoints intermédiaires, aux journaux d’entraînement et de post-entraînement, aux entretiens avec les employés et aux dossiers d’incidents, et s’ils peuvent divulguer des conclusions défavorables sans approbation éditoriale.

Le secteur devrait également surveiller les exigences de durée minimale, les procédures de traitement des informations confidentielles et les preuves que les évaluateurs peuvent refuser les exigences de l’entreprise sans perdre l’accès. La SB 53 de Californie exige déjà des grands développeurs de pointe qu’ils publient des cadres de sécurité et signalent les incidents critiques, tandis que la SB 813 crée un cadre pour des « organisations de vérification indépendante » reconnues par l’État. En Europe, le règlement européen sur l’IA exige des développeurs de pointe qu’ils documentent les évaluations et les tests adversariaux, signalent les incidents graves et coopèrent avec des experts indépendants nommés par l’Office européen de l’IA.

Ces lois pourraient transformer une promesse volontaire en une obligation plus durable. Toutefois, tant que les entreprises n’auront pas divulgué leurs règles de fonctionnement, la question centrale demeure sans réponse : les évaluateurs intégrés agiront-ils comme des chiens de garde indépendants ou comme des sous-traitants travaillant à l’intérieur de limites fixées par les laboratoires qu’ils sont censés examiner ?

Perspective Creati.ai

Anthropic et OpenAI ont raison de reconnaître que les tests du modèle final ont leurs limites, en particulier lorsque les systèmes peuvent identifier les conditions d’évaluation. Mais l’accès seul ne créera pas une supervision indépendante. L’indépendance dépend de qui contrôle le périmètre de l’examen, de sa durée, des preuves disponibles et de la possibilité de publier des conclusions défavorables.

Pour les créateurs et les clients professionnels, les engagements les plus crédibles seront ceux qui peuvent être vérifiés de l’extérieur : évaluateurs nommés, règles d’accès publiées, pistes d’audit conservées et protections claires pour les conclusions divergentes. À terme, la réglementation pourrait compter moins comme substitut à l’évaluation technique que comme protection contre le fait que les entreprises la réduisent discrètement lorsque les enjeux commerciaux augmentent.

Publicités