AI News

Moonshot AI представила PerceptionBench — бенчмарк, призванный проверить, способны ли мультимодальные модели ИИ корректно интерпретировать изображения до того, как их попросят делать выводы на их основе. Оценка, о которой сообщает The Decoder, показала, что ни одна из 16 протестированных передовых моделей не достигла 60% общей точности, а лучший результат составил 59,7%.

Этот результат важен, потому что многие сбои, которые приписывают плохому рассуждению, могут начинаться раньше: модель могла неверно прочитать изображение, неправильно посчитать, не заметить визуальную связь или придумать объект, которого не было. PerceptionBench пытается отделить этот первый этап от общего знания и многошагового рассуждения, давая разработчикам ИИ более точный способ диагностировать сбои мультимодальности.

Бенчмарк, построенный вокруг базовых визуальных навыков

Исследовательская команда Moonshot AI, которая также разрабатывает ассистента Kimi, заявила, что PerceptionBench оценивает визуальное восприятие независимо от логического рассуждения и внешних знаний. Каждый вопрос предполагается отвечаемым исключительно по изображению.

Бенчмарк делит восприятие на десять областей навыков: визуальные отношения, счёт, атрибуты, понимание глубины и 3D, локализация, сравнение, тонкое распознавание, интеграция контекста, оптическое распознавание символов и галлюцинации. Сообщается, что категории были выведены из наблюдаемых ошибок моделей, а не навязаны как чисто теоретическая таксономия.

Команда проанализировала 42 существующих open-source бенчмарка и обнаружила лишь ограниченное пересечение между измеряемыми ими ошибками. Поэтому Moonshot AI создала внутренний пул из более чем 17 000 проверенных вопросов и выпускает 3 000 заданий. По данным The Decoder, 60% опубликованных вопросов были взяты из документированных ошибок моделей, а остальные были переформулированы с использованием аугментированных изображений.

Публичный датасет и код оценки доступны через проект MoonshotAI/PerceptionBench на GitHub. Этот релиз должен позволить исследователям и разработчикам моделей проверить, воспроизводятся ли заявленные слабые места вне собственных процедур оценки Moonshot AI.

Передовые модели остаются ниже порога бенчмарка

The Decoder сообщил, что GPT-5.6 Sol показала лучший общий результат — 59,7%, за ней следуют Kimi K3 с 58,5%, Claude Fable 5 с 57,2%, Gemini 3.1 Pro с 56,2% и GPT-5.5 с 55,8%. Среди open-source моделей, упомянутых в отчёте, были Qwen3.5-397B-A17B с 47,5% и GLM-4.6V с 32,5%.

Эти цифры следует рассматривать как результаты бенчмарка, опубликованные The Decoder, а не как универсальный рейтинг мультимодальных возможностей. Производительность может меняться в зависимости от промпта, композиции изображения, выбора задач и дизайна оценки. Модели и оценки также представлены в исходном материале без независимого воспроизведения в доказательствах, доступных для этой статьи.

Результаты по категориям выглядят более показательными, чем общая таблица лидеров. Модели с похожими суммарными баллами, как сообщается, заметно расходились по отдельным навыкам. Самой слабой областью в среднем оказались галлюцинации: GPT-5.6 Sol набрала 26,9% в этом подпункте, тогда как Gemini 3.5 Flash, по сообщениям, достигла 50,6%, несмотря на более низкое место в общем рейтинге. Задание проверяет, может ли модель правильно ответить «ноль», когда на изображении нет ни одного объекта, о котором спрашивают, вместо того чтобы выдумывать его.

Такой паттерн указывает на то, что один общий мультимодальный балл может скрывать серьёзные слабости в конкретных рабочих процессах. Модель может надёжно читать текст на изображении, но быть ненадёжной в подсчёте, пространственном сравнении или определении того, существует ли объект вообще.

Почему ошибки восприятия выглядят как ошибки рассуждения

Многие производственные задачи объединяют визуальную интерпретацию с цепочкой решений. Ассистент может изучить панель, выявить предупреждение, сравнить два изображения продукта и затем рекомендовать действие. Если первое визуальное наблюдение ошибочно, последующее рассуждение может оставаться внутренне согласованным, но всё равно привести к неверному ответу.

Подход PerceptionBench разбивает сложные вопросы на подпункты, связанные только с восприятием. Исследователи Moonshot AI утверждают, что это позволяет определить самый ранний сбойный шаг, а не называть весь результат ошибкой рассуждения.

Это наблюдение согласуется с более ранними работами, на которые ссылается The Decoder, хотя в тех исследованиях использовались другие тесты. Сообщается, что бенчмарк WorldVQA показал: лучшая модель набрала 47,4% на заданиях, отделяющих распознавание объектов от рассуждения. Другое исследование с BabyVision сообщило, что Gemini 3 Pro достигла 49,7% на базовых визуальных задачах по сравнению с 94,1% у людей. Источник объясняет этот разрыв бутылочным горлышком вербализации, при котором визуальная информация теряет точность при преобразовании в язык.

Эти сравнения не доказывают, что все мультимодальные системы сбиваются одинаково, но они усиливают более узкий вывод PerceptionBench: сильная генерация текста и высокая общая способность к рассуждению не гарантируют надёжной обработки визуального ввода.

Что означают результаты для продуктовых команд ИИ

Для разработчиков немедленный вывод скорее архитектурный, чем косметический. Мультимодальной модели не следует автоматически доверять подсчёт, инвентарные проверки, извлечение данных из документов, пространственную навигацию или визуальный контроль качества только потому, что она может бегло описывать изображение.

Командам, внедряющим визуальные системы, могут понадобиться специализированные оценки именно тех отказов, которые влияют на их рабочий процесс. Розничной системе следует тестировать наличие объектов и тонкие атрибуты. Документному продукту нужно измерять OCR и интерпретацию макета. Робототехническому или промышленному приложению следует отдельно оценивать локализацию, глубину и пространственные отношения, прежде чем добавлять планирование или использование инструментов.

Бенчмарк также поддерживает использование шагов проверки вокруг визуальных результатов с высокой ставкой. Вторичная модель, обычный инструмент компьютерного зрения, структурированное извлечение или ручная проверка могут быть уместны, когда неверный подсчёт или пропущенное предупреждение влекут финансовые, безопасностные или регуляторные последствия. Эти меры добавляют задержку и стоимость, но оценки PerceptionBench показывают, что беглые ответы сами по себе не являются достаточным доказательством точного восприятия.

Для поставщиков моделей выпуск создаёт давление, побуждающее публиковать результаты на уровне категорий, а не только сводные мультимодальные бенчмарки. Разработчики, сравнивающие GPT-5.6 Sol, Kimi K3, Claude Fable 5 или Gemini 3.1 Pro, могут прийти к разным выводам в зависимости от того, что для них важнее: OCR, устойчивость к галлюцинациям, счёт или пространственное понимание.

На что смотреть дальше

Первый сигнал, за которым стоит следить, — независимое воспроизведение результатов PerceptionBench на разных версиях моделей и настройках инференса. Поскольку бенчмарк и код публичны, внешние оценки могут проверить, сохраняются ли заявленные разрывы за пределами конфигурации Moonshot AI.

Исследователям также следует изучить загрязнение и построение заданий, особенно долю вопросов, полученных из известных ошибок моделей, и влияние аугментированных изображений. Эти детали помогут понять, измеряет ли бенчмарк общую визуальную способность или же сильно нацелен на паттерны отказов, уже замеченные его авторами.

Для покупателей полезный следующий вопрос — не просто какая модель возглавляет общий список. Важно, публикуют ли поставщики надёжные результаты по категориям и переносятся ли улучшения на реальные изображения, меняющиеся макеты, шумные входные данные с камеры и крайние случаи, встречающиеся в продакшене.

Взгляд Creati.ai

PerceptionBench наиболее ценен как диагностический бенчмарк, а не как окончательный вердикт по мультимодальному ИИ. Его главный вклад — отделить видение от рассуждения, различие, которое многие продуктовые оценки размывают. Модель может убедительно объяснять изображение и при этом ошибаться в том, что оно содержит.

Практический вывод для ИИ-команд прост: тестируйте визуальный примитив, от которого зависит рабочий процесс, измеряйте цену ошибок и ставьте проверку там, где ошибки восприятия могут распространяться. Пока мультимодальные системы не станут более надёжными в этих, казалось бы, простых задачах, выбор модели должен основываться на конкретной визуальной работе — а не только на общем балле возможностей.

Рекомендуемые

PerceptionBench показывает, что ведущие ИИ-модели по-прежнему не умеют надёжно читать изображения

PerceptionBench от Moonshot AI показывает, что ведущие мультимодальные модели остаются ниже 60% на базовых визуальных задачах, выявляя ошибки восприятия, стоящие за кажущимися ошибками рассуждения.