Бенчмаркинг AI

Последние Новости и Анализ по Теме Бенчмаркинг AI

Бенчмаркинг AI

Сообщается, что AutoModelRouter KT занял второе место в глобальном бенчмарке по маршрутизации ИИ

Сообщается, что AutoModelRouter KT занял второе место в глобальном бенчмарке по маршрутизации ИИ

Сообщается, что AutoModelRouter KT занял второе место в глобальном бенчмарке, выводя эффективность выбора модели в центр корпоративного внедрения ИИ.

Vals привлекла 40 миллионов долларов, чтобы сделать AI-бенчмарки менее уязвимыми к манипуляциям

Vals привлекла 40 миллионов долларов, чтобы сделать AI-бенчмарки менее уязвимыми к манипуляциям

Vals, при поддержке Andreessen Horowitz, привлекла 40 миллионов долларов, чтобы создать конфиденциальный AI-бенчмаркинг на основе задач для компаний и федеральных агентств, поскольку старые тесты с…

AWS призывает покупателей оценивать модели OpenAI в Bedrock по результатам, а не по цене токенов

AWS призывает покупателей оценивать модели OpenAI в Bedrock по результатам, а не по цене токенов

Бенчмарк-данные AWS показывают, что модели OpenAI в Amazon Bedrock могут снижать стоимость правильных ответов, если команды измеряют качество, число ходов и переделки.

По сообщениям, Motif лидирует в глобальном индексе ИИ, пока Корея ждет второго результата Dokpamo

По сообщениям, Motif лидирует в глобальном индексе ИИ, пока Корея ждет второго результата Dokpamo

По сообщениям, Motif возглавляет глобальный бенчмарк ИИ для корейских моделей, а отрасль ожидает вторую оценку Dokpamo, которая может проверить, сохранится ли этот результат.

OpenAI заявляет, что примерно 30% SWE-Bench Pro могут быть сломаны, ставя под сомнение ключевой бенчмарк для кодинга

OpenAI заявляет, что примерно 30% SWE-Bench Pro могут быть сломаны, ставя под сомнение ключевой бенчмарк для кодинга

OpenAI говорит, что около 30% задач SWE-Bench Pro могут быть сломаны, что порождает новые сомнения в том, как ИИ-индустрия измеряет модели для программирования.

Китай доминирует в мировой гонке роботакси, показывает новая таблица

Китай доминирует в мировой гонке роботакси, показывает новая таблица

Новая система бенчмаркинга на базе генеративного ИИ выявляет доминирование Китая в секторе автономных транспортных средств и роботакси по сравнению с американскими конкурентами.

Google DeepMind расширяет бенчмаркинг ИИ с Werewolf и покером, пока Gemini 3 доминирует в рейтингах

Google DeepMind расширяет бенчмаркинг ИИ с Werewolf и покером, пока Gemini 3 доминирует в рейтингах

Google DeepMind запускает бенчмарки Werewolf и покера на Kaggle Game Arena, чтобы проверять социальные навыки ИИ, обнаружение обмана и управление рисками. Модели Gemini 3 Pro и Flash демонстрируют значительный скачок производительности по сравнению с предыдущим поколением.

Реклама