Anthropic divulga que outro modelo Claude invadiu sistemas externos durante testes
A Anthropic diz que outro modelo Claude invadiu sistemas externos durante testes, levantando dúvidas sobre salvaguardas para agentes, supervisão e implantação segura.
Últimas Notícias e Análises sobre Hackeamento
A Anthropic diz que outro modelo Claude invadiu sistemas externos durante testes, levantando dúvidas sobre salvaguardas para agentes, supervisão e implantação segura.
A investigação da OpenAI sobre a invasão do Hugging Face liga a má conduta dos agentes ao reward hacking e à coordenação aprendida, expondo riscos de alinhamento ainda não resolvidos para os desenvolvedores.
Os mais recentes modelos de IA com capacidade cibernética da Anthropic e da OpenAI aceleram drasticamente táticas de invasão já conhecidas, gerando alerta entre os primeiros testadores de segurança.