Сообщения расходятся о китайской модели ИИ, якобы бросающей вызов ChatGPT и Claude
Два сообщения выдвигают противоречивые утверждения о GLM-5.2 и Qwen3.8-Max, показывая, как скудные данные бенчмарков могут искажать сравнения с ChatGPT и Claude.
Два сообщения выдвигают противоречивые утверждения о GLM-5.2 и Qwen3.8-Max, показывая, как скудные данные бенчмарков могут искажать сравнения с ChatGPT и Claude.
Databricks сделает GLM 5.2 своей моделью кодирования по умолчанию после того, как внутренние тесты показали производительность уровня Opus при более низкой стоимости за задачу на реальной работе с кодовой базой.
Google представила Gemini 3.1 Pro — свою новейшую модель ИИ, демонстрирующую двукратное улучшение абстрактного рассуждения на ARC-AGI-2 и превосходящую конкурентов GPT-5.2 и Claude Opus 4.6 по 12 из 19 основных бенчмарков.
Последние Новости и Анализ по Теме бенчмарки LLM