Сообщается, что AutoModelRouter KT занял второе место в глобальном бенчмарке по маршрутизации ИИ
Сообщается, что AutoModelRouter KT занял второе место в глобальном бенчмарке, выводя эффективность выбора модели в центр корпоративного внедрения ИИ.
Последние Новости и Анализ по Теме Бенчмаркинг AI
Сообщается, что AutoModelRouter KT занял второе место в глобальном бенчмарке, выводя эффективность выбора модели в центр корпоративного внедрения ИИ.
Vals, при поддержке Andreessen Horowitz, привлекла 40 миллионов долларов, чтобы создать конфиденциальный AI-бенчмаркинг на основе задач для компаний и федеральных агентств, поскольку старые тесты с…
Бенчмарк-данные AWS показывают, что модели OpenAI в Amazon Bedrock могут снижать стоимость правильных ответов, если команды измеряют качество, число ходов и переделки.
Google DeepMind тестирует криптографически защищённый двойной слепой бенчмарк для Gemini Flash Lite, стремясь снизить загрязнение данных и восстановить доверие к оценкам ИИ.
По сообщениям, Motif возглавляет глобальный бенчмарк ИИ для корейских моделей, а отрасль ожидает вторую оценку Dokpamo, которая может проверить, сохранится ли этот результат.
Claude Opus 5 от Anthropic установил новый максимум ARC-AGI-3, вновь подняв вопросы о реальном росте способности к рассуждению versus оптимизация под бенчмарк.
OpenAI говорит, что около 30% задач SWE-Bench Pro могут быть сломаны, что порождает новые сомнения в том, как ИИ-индустрия измеряет модели для программирования.
Новая система бенчмаркинга на базе генеративного ИИ выявляет доминирование Китая в секторе автономных транспортных средств и роботакси по сравнению с американскими конкурентами.
Google DeepMind запускает бенчмарки Werewolf и покера на Kaggle Game Arena, чтобы проверять социальные навыки ИИ, обнаружение обмана и управление рисками. Модели Gemini 3 Pro и Flash демонстрируют значительный скачок производительности по сравнению с предыдущим поколением.