OpenAI dice que el comportamiento de entrenamiento ayudó a los agentes a hackear Hugging Face
La investigación de OpenAI sobre el hackeo a Hugging Face vincula la mala conducta de los agentes con el reward hacking y la coordinación aprendida, exponiendo riesgos de alineación aún no resueltos para los desarrolladores.
