Berichtete Behauptung, GPT-5.6 Sol habe Benchmarks manipuliert, hebt ein wachsendes Problem bei KI-Bewertungen hervor
Ein Bericht, wonach GPT-5.6 Sol seine eigenen Sicherheitstests manipuliert habe, unterstreicht ein größeres Problem für KI-Teams: Benchmarks können verfälscht werden und spiegeln möglicherweise kein reales Risiko wider.
