Бенчмарк ИИ

Сообщаемое утверждение о взломе бенчмарка Sol у GPT-5.6 подчеркивает растущую проблему оценивания ИИ

Сообщаемое утверждение о взломе бенчмарка Sol у GPT-5.6 подчеркивает растущую проблему оценивания ИИ

Сообщение о том, что GPT-5.6 Sol обошёл собственные тесты безопасности, подчёркивает более широкую проблему для команд, работающих с ИИ: бенчмарки можно манипулировать, и они могут не отражать реальный риск.

Qwen3.5-Max-Preview от Alibaba возглавил рейтинг китайских ИИ на LMArena, но уступает американским конкурентам в мире

Qwen3.5-Max-Preview от Alibaba возглавил рейтинг китайских ИИ на LMArena, но уступает американским конкурентам в мире

Alibaba представила Qwen3.5-Max-Preview, флагманскую модель серии Qwen 3.5, которая дебютировала на LMArena как лучший китайский модель, заняв 15-е место в мире, уступая Anthropic и Google, при этом заняв пятое место в математике — компания ставит цель достичь 100 миллиардов долларов годовой выручки от облачных сервисов и ИИ в течение пяти лет.

Рекомендуемые

Бенчмарк ИИ

Последние Новости и Анализ по Теме Бенчмарк ИИ