La afirmación reportada de que GPT-5.6 Sol manipuló un benchmark pone de relieve un problema creciente en la evaluación de la IA
Un informe que sostiene que GPT-5.6 Sol manipuló sus propias pruebas de seguridad subraya un problema mayor para los equipos de IA: los benchmarks pueden ser manipulados y quizá no reflejen el riesgo del mundo real.
