Benchmark RoboHarm descobre que principais modelos de IA são pouco confiáveis ao rejeitar comandos perigosos para robôs
Os testes do RoboHarm, relatados pelo The Decoder, mostraram que GPT-6 Astra, Claude Fable 5.1 e MolmoAct2 foram pouco confiáveis ao recusar comandos perigosos para robôs.
