Base Labs, Hugging Face et Goodfire construisent une infrastructure de sécurité IA en poids ouvert, afin de rendre les garde-fous plus transparents à mesure que les risques des modèles augmentent.

Base Labs, le groupe de recherche créé par l’entreprise d’inférence IA Baseten, s’associe à Hugging Face et Goodfire AI pour développer une infrastructure de sécurité pour les modèles à poids ouverts. L’initiative vise à faire de l’évaluation et de la surveillance de la sécurité une partie intégrante du processus de développement et de déploiement des modèles, plutôt qu’une couche séparée ajoutée plus tard.
Cette annonce intervient alors que les développeurs et les décideurs débattent de la manière de gérer des modèles dont les poids peuvent être téléchargés, modifiés et privés de leurs garde-fous intégrés. Pour les constructeurs d’IA et les équipes d’entreprise, ce partenariat pourrait devenir un premier test pour savoir si les écosystèmes de modèles ouverts peuvent établir des pratiques de sécurité crédibles sans dépendre d’un contrôle centralisé par un petit nombre de fournisseurs de modèles.
Base Labs indique qu’il développera et publiera des méthodes pour entraîner et surveiller des modèles ouverts, avec l’objectif à plus long terme de créer une « norme » de sécurité transparente pour l’écosystème à poids ouvert. Hugging Face, une grande plateforme d’hébergement pour les modèles open source et à poids ouverts, participe à l’effort, tandis que Goodfire AI apporte son expertise en interprétabilité des modèles.
Les entreprises n’ont pas divulgué la conception technique du partenariat. Cela laisse ouvertes des questions fondamentales sur la nature des livrables : benchmarks d’évaluation, outils de déploiement, méthodes d’entraînement, systèmes de surveillance, ou combinaison de ces éléments.
L’accent mis par Goodfire sur la compréhension du comportement des modèles suggère que l’interprétabilité pourrait faire partie du cadre proposé. En réponse à l’annonce de Baseten, Goodfire a déclaré que la sécurité devait être intégrée aux modèles ouverts et fournie par les organisations qui les servent. C’est un objectif large, pas encore une spécification publiée.
Baseten a lancé Base Labs au début de 2026 comme branche de recherche. L’entreprise a également invité les développeurs et d’autres membres de la communauté de recherche à contribuer au cadre, ce qui indique qu’elle souhaite que le projet aille au-delà des trois partenaires fondateurs.
Le contexte immédiat est la préoccupation croissante selon laquelle les garde-fous peuvent être supprimés des modèles téléchargeables. TechCrunch a rapporté qu’une technique appelée « abliteration » est de plus en plus utilisée pour désactiver ou affaiblir les comportements de refus et d’autres contrôles de sécurité. Hugging Face répertorie actuellement plus de 6 000 modèles identifiés comme abliterated, selon le rapport.
Ce chiffre reflète le contenu et le libellé d’un catalogue de plateforme, et non une mesure indépendante de l’ensemble du marché des modèles ouverts. Il illustre néanmoins la difficulté pratique de considérer le comportement de sécurité d’origine d’un modèle comme permanent une fois ses poids rendus publics.
Pour les développeurs de modèles, la question de sécurité devient donc : non plus de savoir si un fournisseur a ajouté des garde-fous, mais de savoir si ces garde-fous restent pertinents après redistribution ou modification. Les outils de surveillance devront peut-être aussi évaluer le comportement d’un modèle face à des prompts modifiés, au fine-tuning, à la quantification ou à d’autres altérations effectuées par des utilisateurs en aval.
Base Labs soutient que l’ouverture peut aider la recherche en sécurité, car des acteurs extérieurs peuvent inspecter le comportement des modèles et développer des contrôles plus transparents. C’est la position de l’entreprise, et non une conclusion démontrée par ce partenariat. L’accès ouvert peut améliorer l’examen, mais il peut aussi faciliter la suppression des protections ou la reproduction de variantes dangereuses.
L’annonce confirmée se limite à la formation du partenariat et à l’intention affichée des entreprises de construire et publier des méthodes de sécurité. Aucune architecture technique, calendrier de publication, résultats d’évaluation, liste de modèles ou processus de gouvernance n’a été fourni dans les informations disponibles.
Le signal de marché le plus concret est le catalogue de Hugging Face de plus de 6 000 modèles abliterated, tel que rapporté par TechCrunch. Ce catalogue indique l’ampleur du défi auquel est confronté tout effort visant à maintenir des propriétés de sécurité à travers un réseau de distribution ouvert, mais il n’établit pas combien de ces modèles sont largement utilisés ni s’ils représentent un risque réel mesurable.
Les ressources financières des participants apportent aussi un contexte, mais pas une preuve de progrès technique. Baseten a levé 1,5 milliard de dollars lors d’un tour de série F en juin, atteignant une valorisation rapportée de 13 milliards de dollars. Goodfire AI a levé 150 millions de dollars lors d’un tour de série B mené par B Capital plus tôt cette année. Ces montants peuvent donner au projet accès à des capacités d’ingénierie et de recherche, mais ils ne valident ni la norme proposée ni son adoption probable.
Comme les détails disponibles proviennent principalement de l’annonce des entreprises et de la couverture médiatique, les affirmations concernant la transparence, la participation de l’écosystème et les futures améliorations de sécurité doivent être considérées comme des objectifs déclarés. Il n’existe pas encore de résultats indépendants de benchmark montrant que l’approche réduit les sorties nuisibles ou résiste aux modifications de modèle.
Si Base Labs, Hugging Face et Goodfire produisent des outils utilisables, les créateurs de modèles pourraient bénéficier d’un processus commun pour tester le comportement avant publication et surveiller les modèles après déploiement. Cela pourrait aider les équipes à documenter les évaluations de sécurité, comparer les versions de modèles et identifier les changements causés par le fine-tuning ou la distribution en aval.
Pour les acheteurs d’entreprise, la valeur pratique dépendra de la capacité du cadre à produire des éléments de preuve compatibles avec les processus d’achat, d’examen des risques et de conformité. Une model card ou un benchmark ponctuel peut être insuffisant pour les organisations qui déploient des modèles mis à jour, personnalisés ou hébergés par différents fournisseurs. Les acheteurs auront probablement besoin de tests reproductibles, de journaux d’audit, d’un suivi des versions et d’informations claires sur les protections qui restent présentes dans un modèle dérivé.
Le partenariat place également Hugging Face dans une position potentiellement influente. En tant que grande plateforme de distribution et de découverte, elle peut aider à faire en sorte que les métadonnées de sécurité et les résultats d’évaluation soient visibles au moment où les développeurs choisissent des modèles. Mais l’infrastructure d’hébergement seule ne peut garantir qu’un modèle téléchargé conserve ses garde-fous d’origine.
Pour Base Labs et Goodfire, le projet pourrait également établir une position concurrentielle sur un marché où l’inférence de modèles, l’interprétabilité et les outils de sécurité sont de plus en plus liés. Les entreprises devront montrer que leur approche est pratique pour les développeurs open source, et pas seulement pour des équipes de recherche bien financées. Des outils coûteux, lents ou difficiles à intégrer pourraient limiter l’adoption, même si leurs évaluations sont techniquement solides.
Le premier signal sera une publication technique publique : une spécification, une suite de benchmarks, une recette d’entraînement, un outil de surveillance ou une implémentation de référence. Son périmètre révélera si le partenariat est principalement un programme de recherche ou une norme opérationnelle destinée à un usage en production.
Les développeurs devraient également surveiller les évaluations indépendantes de modèles testés dans le cadre, en particulier après un fine-tuning ou la suppression de contrôles de sécurité. Des preuves montrant que les méthodes continuent de détecter des comportements à risque dans des modèles modifiés seraient plus significatives que les seules affirmations de lancement.
D’autres signaux importants incluent la participation de créateurs de modèles extérieurs au groupe fondateur, l’intégration avec les flux de travail de Hugging Face, des coûts et une latence documentés, ainsi qu’un processus de mise à jour des évaluations à mesure que de nouvelles techniques d’attaque apparaissent. La gouvernance comptera aussi : les partenaires n’ont pas encore expliqué qui définira le comportement acceptable, tranchera les litiges ou maintiendra le cadre.
Le partenariat s’attaque à une faiblesse réelle de l’IA à poids ouverts : les contrôles de sécurité sont difficiles à préserver une fois que les modèles peuvent être copiés et modifiés. Sa proposition centrale — la transparence et des outils partagés peuvent améliorer la sécurité — est plausible, mais elle reste non démontrée tant que les entreprises n’auront pas publié des méthodes que d’autres pourront reproduire et remettre en question.
Pour les constructeurs et les équipes d’entreprise, cette annonce doit être considérée avant tout comme une proposition d’infrastructure, et non comme une solution de sécurité achevée. La crédibilité de Base Labs, Hugging Face et Goodfire dépendra moins du partenariat lui-même que de leur capacité à fournir des évaluations ouvertes, des résultats mesurables et des contrôles qui continuent à fonctionner après que les modèles ont quitté leur environnement de développement d’origine.