Бенчмарки ИИ

Последние Новости и Анализ по Теме Бенчмарки ИИ

Бенчмарки ИИ

AWS призывает покупателей оценивать модели OpenAI в Bedrock по результатам, а не по цене токенов

AWS призывает покупателей оценивать модели OpenAI в Bedrock по результатам, а не по цене токенов

Бенчмарк-данные AWS показывают, что модели OpenAI в Amazon Bedrock могут снижать стоимость правильных ответов, если команды измеряют качество, число ходов и переделки.

Сообщается, что локальная модель StartLux 27B обошла DeepSeek V4 Flash в китайском бенчмарке

Сообщается, что локальная модель StartLux 27B обошла DeepSeek V4 Flash в китайском бенчмарке

Сообщается, что локальная модель StartLux 27B набрала больше баллов, чем DeepSeek V4 Flash, в китайском бенчмарке, что поднимает вопросы о производительности edge AI и подтверждаемости результата.

Aikido Security заявляет, что потратила 11,7 млрд токенов на поиск кибер-модели ИИ

Aikido Security заявляет, что потратила 11,7 млрд токенов на поиск кибер-модели ИИ

Aikido Security сообщает, что потратила 11,7 млрд токенов на сравнение кибер-моделей ИИ, что вызывает вопросы к дизайну бенчмарков, затратам и доказательной базе для покупателей.

Kimi K3 от Moonshot показал неоднозначный результат в бенчмарках: лучший score по frontend-кодингу и слабое выступление на FrontierMath Tier 4

Kimi K3 от Moonshot показал неоднозначный результат в бенчмарках: лучший score по frontend-кодингу и слабое выступление на FrontierMath Tier 4

Kimi K3 от Moonshot возглавил Code Arena: Frontend, но уступает ведущим моделям OpenAI и Anthropic на FrontierMath Tier 4, что подчеркивает неравномерную силу модели.

Пять AI labs поддержали общую шкалу безопасности jailbreak накануне целевой даты стандартов 1 августа

Пять AI labs поддержали общую шкалу безопасности jailbreak накануне целевой даты стандартов 1 августа

Сообщается, что пять AI labs поддерживают общую шкалу оценки jailbreak к 1 августа — ранний шаг к более сопоставимому тестированию безопасности AI models.

OpenAI запускает GeneBench-Pro, чтобы проверить, может ли ИИ принимать исследовательские решения уровня научной работы в вычислительной биологии

OpenAI запускает GeneBench-Pro, чтобы проверить, может ли ИИ принимать исследовательские решения уровня научной работы в вычислительной биологии

OpenAI представила GeneBench-Pro — геномный бенчмарк, призванный измерять научное мышление более высокого порядка, поскольку ИИ-лаборатории все глубже входят в биологические рабочие процессы.

Arena, лидерборд ИИ, которым пользуются все, достигла бизнес-рубежа в 100 млн долларов

Arena, лидерборд ИИ, которым пользуются все, достигла бизнес-рубежа в 100 млн долларов

Arena, популярный бесплатный стартап с рейтингом моделей ИИ, запустил свой коммерческий сервис в сентябре прошлого года и теперь вырос до бизнеса с оборотом 100 млн долларов.

500 инвестиционных банкиров не нашли ни одного результата ИИ, готового для передачи клиенту, в новом бенчмарке

500 инвестиционных банкиров не нашли ни одного результата ИИ, готового для передачи клиенту, в новом бенчмарке

Новый строгий бенчмарк протестировал ведущие модели ИИ на задачах инвестиционного банкинга; ни один результат не был признан готовым для клиента, хотя половина банкиров сочла их полезной отправной точкой.

Модели ИИ теряют половину своей эффективности при анализе сложных графиков, показал новый бенчмарк

Модели ИИ теряют половину своей эффективности при анализе сложных графиков, показал новый бенчмарк

Новый бенчмарк показывает, что даже лучшие модели ИИ теряют около 50 % точности при анализе сложных графиков, выявляя ключевое ограничение визуального мышления.

Реклама