El benchmark RoboHarm descubre que los principales modelos de IA no son fiables al rechazar comandos peligrosos para robots
Las pruebas de RoboHarm, informadas por The Decoder, encontraron que GPT-6 Astra, Claude Fable 5.1 y MolmoAct2 eran poco fiables al negarse a ejecutar comandos peligrosos para robots.
