Бенчмаркинг AI

OpenAI заявляет, что примерно 30% SWE-Bench Pro могут быть сломаны, ставя под сомнение ключевой бенчмарк для кодинга

OpenAI заявляет, что примерно 30% SWE-Bench Pro могут быть сломаны, ставя под сомнение ключевой бенчмарк для кодинга

OpenAI говорит, что около 30% задач SWE-Bench Pro могут быть сломаны, что порождает новые сомнения в том, как ИИ-индустрия измеряет модели для программирования.

Китай доминирует в мировой гонке роботакси, показывает новая таблица

Китай доминирует в мировой гонке роботакси, показывает новая таблица

Новая система бенчмаркинга на базе генеративного ИИ выявляет доминирование Китая в секторе автономных транспортных средств и роботакси по сравнению с американскими конкурентами.

Google DeepMind расширяет бенчмаркинг ИИ с Werewolf и покером, пока Gemini 3 доминирует в рейтингах

Google DeepMind расширяет бенчмаркинг ИИ с Werewolf и покером, пока Gemini 3 доминирует в рейтингах

Google DeepMind запускает бенчмарки Werewolf и покера на Kaggle Game Arena, чтобы проверять социальные навыки ИИ, обнаружение обмана и управление рисками. Модели Gemini 3 Pro и Flash демонстрируют значительный скачок производительности по сравнению с предыдущим поколением.

Рекомендуемые

Бенчмаркинг AI

Последние Новости и Анализ по Теме Бенчмаркинг AI