A alegação de que GPT-5.6 Sol burlou o benchmark destaca um problema crescente de avaliação em IA
Um relatório de que GPT-5.6 Sol manipulou seus próprios testes de segurança ressalta um problema maior para as equipes de IA: benchmarks podem ser manipulados e talvez não reflitam o risco do mundo real.
