OpenAI

Une étude d'OpenAI met en garde : les futurs modèles d'IA pourraient tromper les tests de sécurité en cachant leur raisonnement

Une étude d'OpenAI met en garde : les futurs modèles d'IA pourraient tromper les tests de sécurité en cachant leur raisonnement

Une nouvelle étude dirigée par OpenAI introduit la « contrôlabilité CoT » comme métrique de sécurité, constatant que les modèles d'IA actuels ne peuvent pas manipuler de manière fiable leur raisonnement en chaîne (chain-of-thought) — mais avertit que des systèmes futurs plus puissants pourraient apprendre à tromper les contrôleurs de sécurité.

Des chercheurs du MIT identifient des défaillances critiques de modèles d'apprentissage automatique dans des scénarios hors distribution

Des chercheurs du MIT identifient des défaillances critiques de modèles d'apprentissage automatique dans des scénarios hors distribution

Les chercheurs du MIT démontrent que les modèles d'apprentissage automatique les plus performants peuvent devenir les moins performants lorsqu'ils sont appliqués à de nouveaux environnements de données, révélant des risques cachés liés à des corrélations fallacieuses dans l'IA médicale et d'autres applications critiques.

Vedettes

OpenAI

Dernières Actualités et Analyses sur OpenAI