Бенчмарки ИИ

Kimi K3 от Moonshot показал неоднозначный результат в бенчмарках: лучший score по frontend-кодингу и слабое выступление на FrontierMath Tier 4

Kimi K3 от Moonshot показал неоднозначный результат в бенчмарках: лучший score по frontend-кодингу и слабое выступление на FrontierMath Tier 4

Kimi K3 от Moonshot возглавил Code Arena: Frontend, но уступает ведущим моделям OpenAI и Anthropic на FrontierMath Tier 4, что подчеркивает неравномерную силу модели.

Пять AI labs поддержали общую шкалу безопасности jailbreak накануне целевой даты стандартов 1 августа

Пять AI labs поддержали общую шкалу безопасности jailbreak накануне целевой даты стандартов 1 августа

Сообщается, что пять AI labs поддерживают общую шкалу оценки jailbreak к 1 августа — ранний шаг к более сопоставимому тестированию безопасности AI models.

OpenAI запускает GeneBench-Pro, чтобы проверить, может ли ИИ принимать исследовательские решения уровня научной работы в вычислительной биологии

OpenAI запускает GeneBench-Pro, чтобы проверить, может ли ИИ принимать исследовательские решения уровня научной работы в вычислительной биологии

OpenAI представила GeneBench-Pro — геномный бенчмарк, призванный измерять научное мышление более высокого порядка, поскольку ИИ-лаборатории все глубже входят в биологические рабочие процессы.

Arena, лидерборд ИИ, которым пользуются все, достигла бизнес-рубежа в 100 млн долларов

Arena, лидерборд ИИ, которым пользуются все, достигла бизнес-рубежа в 100 млн долларов

Arena, популярный бесплатный стартап с рейтингом моделей ИИ, запустил свой коммерческий сервис в сентябре прошлого года и теперь вырос до бизнеса с оборотом 100 млн долларов.

500 инвестиционных банкиров не нашли ни одного результата ИИ, готового для передачи клиенту, в новом бенчмарке

500 инвестиционных банкиров не нашли ни одного результата ИИ, готового для передачи клиенту, в новом бенчмарке

Новый строгий бенчмарк протестировал ведущие модели ИИ на задачах инвестиционного банкинга; ни один результат не был признан готовым для клиента, хотя половина банкиров сочла их полезной отправной точкой.

Модели ИИ теряют половину своей эффективности при анализе сложных графиков, показал новый бенчмарк

Модели ИИ теряют половину своей эффективности при анализе сложных графиков, показал новый бенчмарк

Новый бенчмарк показывает, что даже лучшие модели ИИ теряют около 50 % точности при анализе сложных графиков, выявляя ключевое ограничение визуального мышления.

Рекомендуемые

Бенчмарки ИИ

Последние Новости и Анализ по Теме Бенчмарки ИИ