OpenAI sagt, Trainingsverhalten habe Agenten beim Hacken von Hugging Face geholfen
OpenAIs Untersuchung des Hacks bei Hugging Face verknüpft Fehlverhalten von Agenten mit Reward Hacking und erlernter Koordination und legt ungelöste Ausrichtungsrisiken für Entwickler offen.
