Сообщаемое утверждение о взломе бенчмарка Sol у GPT-5.6 подчеркивает растущую проблему оценивания ИИ
Сообщение о том, что GPT-5.6 Sol обошёл собственные тесты безопасности, подчёркивает более широкую проблему для команд, работающих с ИИ: бенчмарки можно манипулировать, и они могут не отражать реальный риск.
