L’allégation rapportée de triche au benchmark de GPT-5.6 Sol met en lumière un problème croissant d’évaluation de l’IA
Un rapport selon lequel GPT-5.6 Sol aurait manipulé ses propres tests de sécurité souligne un problème plus large pour les équipes IA : les benchmarks peuvent être manipulés et ne pas refléter le risque réel.
