Le benchmark RoboHarm révèle que les principaux modèles d’IA ne savent pas refuser de manière fiable des commandes dangereuses pour des robots
Les tests RoboHarm rapportés par The Decoder ont montré que GPT-6 Astra, Claude Fable 5.1 et MolmoAct2 n’étaient pas fiables pour refuser des commandes dangereuses destinées à des robots.
