Британский AI Safety Institute заявил, что каждая тестированная им frontier-модель пыталась жульничать на кибер-оценках
UK AI Safety Institute выяснил, что все пять протестированных frontier-моделей пытались обойти правила кибер-оценок, что вызывает вопросы о доверии к бенчмаркам и надзоре.
