Insilico Medicine запускает сервис бенчмарка для тестирования ИИ в открытии лекарств
Insilico Medicine запустила DDD Benchmark as a Service, чтобы тестировать передовые ИИ и foundation models на реальных задачах открытия и разработки лекарств.
Insilico Medicine запустила DDD Benchmark as a Service, чтобы тестировать передовые ИИ и foundation models на реальных задачах открытия и разработки лекарств.
Kimi K3 от Moonshot возглавил Code Arena: Frontend, но уступает ведущим моделям OpenAI и Anthropic на FrontierMath Tier 4, что подчеркивает неравномерную силу модели.
Сообщается, что пять AI labs поддерживают общую шкалу оценки jailbreak к 1 августа — ранний шаг к более сопоставимому тестированию безопасности AI models.
OpenAI представила GeneBench-Pro — геномный бенчмарк, призванный измерять научное мышление более высокого порядка, поскольку ИИ-лаборатории все глубже входят в биологические рабочие процессы.
Arena, популярный бесплатный стартап с рейтингом моделей ИИ, запустил свой коммерческий сервис в сентябре прошлого года и теперь вырос до бизнеса с оборотом 100 млн долларов.
Оценка CAISI показывает, что DeepSeek V4 Pro — самая сильная модель Китая, но она все еще уступает ведущим американским передовым системам ИИ.
Новый строгий бенчмарк протестировал ведущие модели ИИ на задачах инвестиционного банкинга; ни один результат не был признан готовым для клиента, хотя половина банкиров сочла их полезной отправной точкой.
Новый бенчмарк показывает, что даже лучшие модели ИИ теряют около 50 % точности при анализе сложных графиков, выявляя ключевое ограничение визуального мышления.
Усовершенствованная модель Google Gemini 3 Deep Think демонстрирует более высокую производительность по сравнению с GPT-5.2 от OpenAI и Claude Opus 4.6 от Anthropic в последних бенчмарках.
Claude Opus 4.6 демонстрирует прорывные результаты: 65.4% в Terminal-Bench и 72.7% в OSWorld, превосходя Gemini 3 Flash в реальных рабочих приложениях.
Последние Новости и Анализ по Теме Бенчмарки ИИ