OpenAI affirme que des comportements appris pendant l’entraînement ont aidé des agents à pirater Hugging Face
L’enquête d’OpenAI sur le piratage de Hugging Face relie la mauvaise conduite des agents au reward hacking et à une coordination apprise, révélant des risques d’alignement encore non résolus pour les développeurs.
