OpenAI affirme qu’Astra est son premier modèle à atteindre un seuil critique de cybersécurité, ce qui entraîne des garde-fous renforcés et un accès restreint au lancement.

OpenAI affirme que son futur modèle Astra est devenu le premier système qu’elle a désigné comme ayant atteint le seuil de capacité de cybersécurité « Critical » dans le cadre de son Preparedness Framework. Cette classification signifie qu’OpenAI estime qu’Astra peut, avec des outils et un accès appropriés, découvrir des vulnérabilités jusque-là inconnues et développer des chaînes d’exploitation à travers des systèmes durcis, sans guidage humain étape par étape.
Cette annonce est importante car OpenAI relie directement les conditions de sortie d’un modèle de frontière à sa capacité à créer un risque cyber sérieux. L’entreprise dit avoir retardé certaines parties du développement et du lancement d’Astra afin de renforcer les protections contre les usages abusifs et les actions non autorisées du modèle. Astra devrait être disponible prochainement, mais ses fonctions de cybersécurité les plus avancées seront d’abord limitées à des testeurs sélectionnés, avec un accès défensif plus large plus tard via Daybreak Blue.
Le cadre d’OpenAI définit le niveau cybersécurité Critical au moyen de deux tests de capacité possibles. Un modèle peut être retenu s’il peut identifier et développer des exploits zero-day fonctionnels sur de nombreux systèmes critiques durcis et réels, sans intervention humaine, ou s’il peut concevoir et exécuter des stratégies de cyberattaque inédites de bout en bout contre des cibles durcies à partir d’un objectif de haut niveau.
OpenAI affirme qu’Astra a atteint ce niveau lors d’évaluations automatisées et de tests menés par des experts. Face à un navigateur et à un système d’exploitation durcis, l’entreprise dit que le modèle a trouvé des vulnérabilités jusque-là inconnues et les a combinées en chaînes d’exploitation fonctionnelles. Un test aurait consisté à sortir d’un bac à sable de navigateur et à exécuter des commandes sur l’hôte après l’ouverture d’un fichier HTML par le navigateur. Un autre aurait consisté à enchaîner des vulnérabilités du système d’exploitation pour passer d’un compte non privilégié à root.
L’entreprise décrit Astra comme un bond important par rapport à GPT‑5.6 Sol en matière de découverte de vulnérabilités, de développement d’exploits et d’efficacité en jetons. Elle affirme aussi qu’Astra a obtenu un score de 100 % sur ExploitBench, un benchmark consacré au développement d’exploits contre des vulnérabilités connues. Ces résultats proviennent des propres évaluations d’OpenAI et n’ont pas été établis de manière indépendante dans les éléments disponibles pour ce rapport.
OpenAI affirme que le profil de risque d’Astra a nécessité des protections contre deux modes de défaillance distincts. Le premier est l’utilisation du modèle par des acteurs malveillants pour exploiter des failles inconnues ou mener des attaques contre des cibles durcies. Le second est le fait que le modèle lui-même prenne des actions non autorisées ou non alignées, même lorsqu’un utilisateur ne cherche pas intentionnellement à nuire.
L’entreprise dit avoir traité ces risques avec plusieurs couches : refus au niveau du modèle, classificateurs de sûreté du système, détection hors ligne des abus, interruption des menaces, surveillance et contrôles plus stricts autour de l’accès au modèle. Pour les comptes à risque plus élevé, OpenAI dit qu’Astra fonctionnera sous une limite de comportement plus restrictive et que la surveillance utilisera davantage de contexte de conversation pour détecter les abus cyber.
OpenAI rapporte qu’Astra a refusé 91,5 % des requêtes lors de ses évaluations de cyber-jailbreak, contre 59 % pour GPT‑5.6 Sol. Il s’agit d’un benchmark communiqué par le fournisseur, et l’entreprise n’a pas encore publié la méthodologie complète ni de validation indépendante dans l’annonce. OpenAI dit qu’elle fournira davantage de détails dans la system card d’Astra au lancement.
L’entreprise rattache aussi la préparation d’Astra à l’incident précédent de Hugging Face. OpenAI affirme qu’Astra n’a pas été impliqué dans cet incident, mais qu’elle a utilisé cet événement pour améliorer son approche de la sûreté. Elle dit que des tests rétrospectifs suggèrent que les garde-fous de production en place à l’époque auraient empêché l’incident, tandis que les protections plus récentes d’Astra incluent un entraînement renforcé au refus, des défenses supplémentaires contre les abus et une surveillance destinée à stopper des activités potentiellement non autorisées.
OpenAI affirme que son évaluation de préparation a combiné des benchmarks automatisés publics et privés avec des évaluations d’experts en cybersécurité. Sur un nouveau jeu de données interne, appelé « ExploitBench - Internal Port (June–August 2026) », l’entreprise a testé Astra contre 20 vulnérabilités récemment divulguées et de gravité élevée, conçues pour réduire les préoccupations de contamination.
Selon OpenAI, Astra a obtenu des taux d’exécution de code arbitraire plus élevés que GPT‑5.6 Sol sur cet ensemble interne, tout en utilisant moins de jetons de sortie. Lors des tests, le modèle aurait également découvert et utilisé deux vulnérabilités zero-day dans le cadre d’une chaîne d’exploitation. OpenAI dit travailler à divulguer ces failles aux mainteneurs concernés.
Les résultats rapportés reflètent Astra avec l’accès Daybreak Blue plutôt que la configuration de production par défaut. Cette distinction est importante pour les acheteurs et les chercheurs : l’évaluation montre ce que le modèle peut faire dans un environnement d’accès plus capable, mais elle ne montre pas à elle seule comment se comportera le lancement général ni quels outils recevront tous les utilisateurs.
Les éléments disponibles établissent donc la justification interne d’OpenAI pour une désignation Critical, et non un consensus sectoriel vérifié de façon indépendante. La future system card, les détails des benchmarks et les tests externes détermineront le degré de confiance que les développeurs pourront accorder à ces affirmations.
Pour les équipes de sécurité, Astra pourrait être utile pour la recherche de vulnérabilités, les tests défensifs, la réponse aux incidents et la revue de code si ses fonctions avancées peuvent être cantonnées à des environnements autorisés. Un développement d’exploits automatisé plus performant pourrait aider les défenseurs à reproduire plus vite les failles et à prioriser les correctifs, mais la même capacité augmente le coût d’une défaillance de contrôle.
Les entreprises qui évaluent Astra devront examiner plus que la qualité du modèle. Elles devront disposer de limites d’autorisation claires, d’un isolement réseau, de journaux, d’une approbation humaine pour les actions à fort impact et de procédures d’arrêt rapide. L’accent mis par OpenAI sur la surveillance et le confinement suggère que l’architecture de déploiement, la notation du risque des comptes et les permissions des outils seront aussi importantes que la performance brute du modèle sur les benchmarks.
Le déploiement restreint signale aussi un marché des modèles plus segmenté. Plutôt que d’exposer à tous les utilisateurs les capacités cyber les plus fortes d’Astra, OpenAI prévoit de séparer la disponibilité générale de l’accès avancé à la cybersécurité. Cette approche peut réduire le risque d’abus, mais elle pourrait compliquer le développement produit pour les équipes qui ont besoin d’un accès prévisible à des fonctions défensives et doivent comprendre quelles capacités sont disponibles dans chaque configuration.
Le prochain signal clé est le lancement d’Astra et sa system card. Les développeurs devraient rechercher la méthodologie complète d’évaluation, les taux d’échec, des détails sur les deux zero-days signalés et des preuves montrant comment les garde-fous se comportent face à des attaques adaptatives plutôt qu’à des tests de jailbreak figés.
Il sera également important de voir comment OpenAI définit le groupe initial de testeurs et l’extension ultérieure Daybreak Blue. Les règles d’accès de l’entreprise, les restrictions d’outils, les divulgations de surveillance et le processus de réponse aux incidents montreront si le déploiement limité constitue un contrôle de sécurité significatif ou simplement une phase de distribution temporaire.
Enfin, OpenAI dit avoir relancé le 28 août une grande campagne de reinforcement learning frontier après avoir mis en place de nouvelles exigences de sûreté et de sécurité, tandis que certaines campagnes expérimentales plus petites restent suspendues. Les prochaines mises à jour devraient préciser si ces contrôles restent efficaces à mesure qu’Astra et ses successeurs acquièrent davantage d’outils et d’autonomie.
L’annonce d’Astra par OpenAI est importante moins pour un score de benchmark unique que parce que l’entreprise traite publiquement la capacité cyber avancée comme une contrainte de lancement. La capacité rapportée du modèle à découvrir des vulnérabilités et à assembler des chaînes d’exploitation fait de la conception de l’accès, de la surveillance et du confinement des exigences produit centrales, et non des garde-fous secondaires.
Les affirmations restent principalement rapportées par le fournisseur jusqu’à l’arrivée de la system card et de l’examen externe. Pour les bâtisseurs d’IA et les acheteurs d’entreprise, la question pratique sera de savoir si OpenAI peut rendre Astra utile pour la défense autorisée tout en empêchant de manière fiable que ces mêmes workflows ne deviennent des opérations offensives automatisées.