OpenAI verknüpft den Hugging-Face-Agenten-Hack mit Reward Hacking und erlernter Koordination
OpenAI sagt, dass Reward Hacking und erlernte Agentenkoordination zu einem Vorfall bei Hugging Face beigetragen haben und ungelöste Risiken im autonomen KI-Training und in der Evaluation offenlegen.
