AI News

Moonshot AI ha presentado PerceptionBench, un benchmark diseñado para comprobar si los modelos multimodales de IA pueden interpretar correctamente las imágenes antes de que se les pida razonar sobre ellas. La evaluación, informada por The Decoder, encontró que ninguno de los 16 modelos de frontera probados alcanzó una precisión global del 60 %, y el sistema líder obtuvo un 59,7 %.

El resultado importa porque muchos fallos atribuidos a un mal razonamiento pueden comenzar antes: el modelo puede haber leído mal la imagen, contado incorrectamente, pasado por alto una relación visual o imaginado un objeto que no estaba presente. PerceptionBench intenta aislar esa primera etapa del conocimiento general y del razonamiento multietapa, ofreciendo a los desarrolladores de IA una forma más precisa de diagnosticar fallos multimodales.

Un benchmark construido en torno a habilidades visuales básicas

El equipo de investigación de Moonshot AI, que también desarrolla el asistente Kimi, dijo que PerceptionBench evalúa la percepción visual de manera independiente del razonamiento lógico y del conocimiento externo. Cada pregunta está pensada para poder responderse a partir de la imagen misma.

El benchmark divide la percepción en diez áreas de habilidad: relaciones visuales, conteo, atributos, comprensión de profundidad y 3D, localización, comparación, reconocimiento de gran detalle, integración de contexto, reconocimiento óptico de caracteres y alucinación. Según los informes, las categorías se derivaron de errores observados en los modelos y no se impusieron como una taxonomía puramente teórica.

El equipo analizó 42 benchmarks de código abierto existentes y encontró un solapamiento limitado en los errores que medían. Moonshot AI creó así un conjunto interno de más de 17.000 preguntas verificadas y está liberando 3.000 tareas. Según el relato de The Decoder, el 60 % de las preguntas publicadas procedían de errores documentados de modelos, mientras que el resto se reformuló con imágenes aumentadas.

El conjunto de datos público y el código de evaluación están disponibles a través del proyecto MoonshotAI/PerceptionBench en GitHub. Ese lanzamiento debería permitir a investigadores y desarrolladores de modelos comprobar si las debilidades informadas se reproducen fuera del propio proceso de evaluación de Moonshot AI.

Los modelos de frontera siguen por debajo del umbral del benchmark

The Decoder informó que GPT-5.6 Sol obtuvo el mejor resultado global con un 59,7 %, seguido de Kimi K3 con un 58,5 %, Claude Fable 5 con un 57,2 %, Gemini 3.1 Pro con un 56,2 % y GPT-5.5 con un 55,8 %. Entre los modelos de código abierto citados en el informe figuraban Qwen3.5-397B-A17B con un 47,5 % y GLM-4.6V con un 32,5 %.

Estas cifras deben tratarse como resultados de benchmark informados por The Decoder, no como una clasificación universal de la capacidad multimodal. El rendimiento puede variar según la formulación de la instrucción, la composición de la imagen, la selección de tareas y el diseño de la evaluación. Los modelos y las puntuaciones también se presentan en el material de origen sin una replicación independiente en la evidencia disponible para este artículo.

Los resultados por categoría parecen más reveladores que la clasificación general. Según los informes, los modelos con puntuaciones agregadas similares divergían de forma considerable según la habilidad. La alucinación fue el área más débil en promedio: GPT-5.6 Sol obtuvo un 26,9 % en la subprueba, mientras que Gemini 3.5 Flash habría alcanzado un 50,6 % pese a situarse más abajo en la clasificación global. La tarea prueba si un modelo puede responder correctamente “cero” cuando una imagen no contiene ninguno de los objetos preguntados, en lugar de inventarlo.

Ese patrón sugiere que una sola puntuación multimodal puede ocultar debilidades serias en flujos de trabajo concretos. Un modelo puede ser fiable leyendo texto en una imagen, pero no fiable contando, comparando espacialmente o determinando si un objeto existe en absoluto.

Por qué los errores de percepción parecen errores de razonamiento

Muchas tareas de producción combinan interpretación visual con una cadena de decisiones. Un asistente podría inspeccionar un panel, identificar una alerta, comparar dos imágenes de productos y luego recomendar una acción. Si la primera observación visual es incorrecta, el razonamiento posterior puede seguir siendo internamente coherente y aun así producir la respuesta equivocada.

El enfoque de PerceptionBench divide las preguntas complejas en subpreguntas centradas solo en la percepción. Los investigadores de Moonshot AI sostienen que esto permite identificar el primer paso fallido en lugar de etiquetar todo el resultado como un error de razonamiento.

El hallazgo coincide con trabajos anteriores citados por The Decoder, aunque esos estudios utilizaron pruebas diferentes. Según los informes, el benchmark WorldVQA encontró que su modelo con mejor rendimiento obtuvo un 47,4 % en tareas que separan el reconocimiento de objetos del razonamiento. Otro estudio con BabyVision informó que Gemini 3 Pro alcanzó un 49,7 % en tareas visuales básicas, frente al 94,1 % de los humanos. La fuente atribuye esa brecha a un cuello de botella de verbalización en el que la información visual pierde fidelidad al convertirse en lenguaje.

Esas comparaciones no demuestran que todos los sistemas multimodales fallen de la misma manera, pero refuerzan la idea más acotada detrás de PerceptionBench: una generación de lenguaje sólida y un buen rendimiento en razonamiento general no garantizan un procesamiento fiable de la entrada visual.

Qué significan los resultados para los equipos de producto de IA

Para los desarrolladores, la implicación inmediata es arquitectónica más que cosmética. No se debe confiar automáticamente en que un modelo multimodal realice conteos, comprobaciones de inventario, extracción de documentos, navegación espacial o control visual de calidad solo porque puede describir con fluidez una imagen.

Los equipos que despliegan sistemas visuales pueden necesitar evaluaciones específicas para los modos de fallo exactos que afectan a su flujo de trabajo. Un sistema minorista debería probar la presencia de objetos y los atributos de gran detalle. Un producto documental debería medir OCR e interpretación de maquetación. Una aplicación robótica o industrial debería evaluar por separado la localización, la profundidad y las relaciones espaciales antes de añadir planificación o uso de herramientas.

El benchmark también respalda el uso de pasos de verificación en torno a salidas visuales de alto impacto. Un segundo modelo, una herramienta convencional de visión por ordenador, una extracción estructurada o una revisión humana pueden ser apropiados cuando un conteo incorrecto o una alerta omitida tenga consecuencias financieras, de seguridad o de cumplimiento. Estas salvaguardas añaden latencia y coste, pero las puntuaciones de PerceptionBench indican que las respuestas fluidas no bastan como prueba de percepción precisa.

Para los proveedores de modelos, el lanzamiento crea presión para informar resultados a nivel de categoría y no solo benchmarks multimodales agregados. Los desarrolladores que comparen GPT-5.6 Sol, Kimi K3, Claude Fable 5 o Gemini 3.1 Pro pueden llegar a conclusiones distintas según si su prioridad es OCR, resistencia a alucinaciones, conteo o comprensión espacial.

Qué observar a continuación

La primera señal a vigilar es la reproducción independiente de los resultados de PerceptionBench en distintas versiones de modelos y configuraciones de inferencia. Como el benchmark y el código son públicos, evaluaciones externas pueden comprobar si las diferencias informadas persisten más allá de la configuración de Moonshot AI.

Los investigadores también deberían examinar la contaminación y la construcción de tareas, en particular la proporción de preguntas derivadas de errores conocidos del modelo y el efecto de las imágenes aumentadas. Esos detalles ayudarán a determinar si el benchmark mide la capacidad visual general o si se centra de forma contundente en patrones de fallo ya observados por sus autores.

Para los compradores, la siguiente pregunta útil no es simplemente qué modelo encabeza la lista global. Es si los proveedores publican resultados fiables y específicos por categoría, y si las mejoras se trasladan a imágenes reales, diseños cambiantes, entradas de cámara con ruido y los casos extremos que aparecen en producción.

Perspectiva de Creati.ai

PerceptionBench es más valioso como benchmark de diagnóstico que como veredicto definitivo sobre la IA multimodal. Su contribución central es separar ver y razonar, una distinción que muchas evaluaciones de producto difuminan. Un modelo puede explicar una imagen de forma convincente y aun así equivocarse sobre lo que contiene.

La lección práctica para los equipos de IA es sencilla: pruebe el primitivo visual del que depende el flujo de trabajo, mida el coste de los fallos y coloque verificación donde los errores de percepción puedan propagarse. Hasta que los sistemas multimodales sean más fiables en estas tareas supuestamente sencillas, la selección de modelos debería basarse en el trabajo visual específico, no solo en una puntuación general de capacidad.

Destacados

PerceptionBench encuentra que los principales modelos de IA aún tienen dificultades para leer imágenes de forma fiable

PerceptionBench de Moonshot AI encuentra que los principales modelos multimodales se quedan por debajo del 60% en tareas visuales básicas, revelando fallos de percepción detrás de aparentes errores de razonamiento.