AI News

Moonshot AI가 PerceptionBench를 공개했다. 이는 멀티모달 AI 모델이 추론을 요구받기 전에 이미지를 제대로 해석할 수 있는지 시험하기 위한 벤치마크다. The Decoder가 보도한 평가에 따르면, 테스트된 16개 최첨단 모델 중 전체 정확도 60%를 넘은 모델은 없었고, 가장 높은 성능을 보인 시스템도 59.7%에 그쳤다.

이 결과가 중요한 이유는, 추론 능력 부족으로 여겨지는 많은 실패가 더 앞단에서 시작될 수 있기 때문이다. 모델이 이미지를 잘못 읽었거나, 수를 잘못 셌거나, 시각적 관계를 놓쳤거나, 실제로 존재하지 않는 물체를 상상해냈을 수 있다. PerceptionBench는 일반 지식과 다단계 추론으로부터 이 첫 단계를 분리해, AI 개발자가 멀티모달 실패를 더 정확히 진단할 수 있도록 하려 한다.

기본적인 시각 기술을 중심으로 설계된 벤치마크

Kimi 어시스턴트도 개발하는 Moonshot AI의 연구팀은 PerceptionBench가 논리적 추론과 외부 지식과는 독립적으로 시각 인식을 평가한다고 밝혔다. 각 질문은 이미지 자체만으로 답할 수 있도록 구성됐다.

이 벤치마크는 인식을 10개 기술 영역으로 나눈다. 시각적 관계, 개수 세기, 속성, 깊이와 3D 이해, 위치 특정, 비교, 세밀한 인식, 문맥 통합, 광학 문자 인식, 그리고 환각이다. 해당 범주는 순수한 이론적 분류가 아니라 관찰된 모델 오류에서 도출된 것으로 알려졌다.

팀은 기존 오픈소스 벤치마크 42개를 분석했고, 측정하는 오류들 사이의 중복이 제한적이라는 점을 발견했다. 이에 Moonshot AI는 17,000개가 넘는 검증된 질문의 내부 풀을 만들었고, 3,000개 작업을 공개한다. The Decoder의 보도에 따르면 공개된 질문의 60%는 문서화된 모델 오류에서 비롯됐고, 나머지는 증강 이미지를 사용해 재구성됐다.

공개 데이터셋과 평가 코드는 GitHub의 MoonshotAI/PerceptionBench 프로젝트를 통해 이용할 수 있다. 이 공개는 연구자와 모델 개발자가 보고된 약점이 Moonshot AI 자체 평가 과정을 벗어나서도 재현되는지 확인할 수 있게 해줄 것이다.

최첨단 모델은 여전히 벤치마크 기준선 아래에 머문다

The Decoder는 GPT-5.6 Sol이 59.7%로 전체 최고 점수를 기록했고, 그 뒤를 Kimi K3 58.5%, Claude Fable 5 57.2%, Gemini 3.1 Pro 56.2%, GPT-5.5 55.8%가 이었다고 보도했다. 보고서에 포함된 오픈소스 모델로는 Qwen3.5-397B-A17B 47.5%, GLM-4.6V 32.5%가 있었다.

이 수치는 멀티모달 역량의 보편적 순위가 아니라, The Decoder가 보도한 벤치마크 결과로 봐야 한다. 성능은 프롬프트, 이미지 구성, 과제 선택, 평가 설계에 따라 달라질 수 있다. 또한 이 기사에서 확인 가능한 증거에는 독립적인 재현이 없으며, 모델과 점수는 원문 자료 그대로 제시된다.

범주별 결과가 순위표보다 더 많은 것을 보여준다. 비슷한 총점의 모델들도 기술별로 크게 갈렸다고 한다. 평균적으로 가장 약한 영역은 환각이었다. GPT-5.6 Sol은 이 하위 테스트에서 26.9%를 기록했으며, Gemini 3.5 Flash는 전체 순위는 더 낮았음에도 50.6%에 도달했다고 전해진다. 이 과제는 이미지에 묻는 대상 물체가 전혀 없을 때 모델이 이를 새로 만들어내지 않고 정확히 “0”이라고 답할 수 있는지를 시험한다.

이 패턴은 단일 멀티모달 점수가 특정 작업 흐름의 심각한 약점을 가릴 수 있음을 시사한다. 모델은 이미지 속 텍스트를 읽는 데는 믿을 만하지만, 수를 세거나, 공간을 비교하거나, 물체가 실제로 존재하는지를 판단하는 데는 불안정할 수 있다.

지각 오류가 추론 오류처럼 보이는 이유

많은 실무 과제는 시각 해석과 연속적인 판단을 결합한다. 어시스턴트가 대시보드를 살펴보고, 경고를 식별하고, 두 제품 이미지를 비교한 뒤, 조치를 권고할 수 있다. 첫 시각 관찰이 틀리면 이후 추론은 내부적으로 일관되더라도 여전히 잘못된 답을 낼 수 있다.

PerceptionBench의 접근은 복잡한 질문을 인식만을 다루는 하위 질문으로 나눈다. Moonshot AI 연구자들은 이를 통해 전체 결과를 추론 오류로 뭉뚱그리는 대신, 가장 이른 실패 지점을 찾아낼 수 있다고 주장한다.

이 발견은 The Decoder가 인용한 이전 연구들과도 일치하지만, 그 연구들은 다른 테스트를 사용했다. WorldVQA 벤치마크는 최고 성능 모델이 객체 인식과 추론을 분리하는 과제에서 47.4%를 기록했다고 전해진다. BabyVision을 사용한 또 다른 연구에서는 Gemini 3 Pro가 기본 시각 작업에서 49.7%를 기록한 반면, 인간은 94.1%를 보였다고 보고됐다. 출처는 이 격차를 시각 정보가 언어로 변환될 때 충실도가 떨어지는 verbalization bottleneck 때문이라고 설명한다.

이 비교들은 모든 멀티모달 시스템이 같은 방식으로 실패한다는 것을 입증하지는 않지만, PerceptionBench의 핵심 주장, 즉 강력한 언어 생성과 광범위한 추론 성능이 신뢰할 수 있는 시각 입력 처리를 보장하지는 않는다는 점을 뒷받침한다.

이 결과가 AI 제품 팀에 의미하는 것

개발자에게 즉각적인 함의는 외형보다 아키텍처에 가깝다. 멀티모달 모델이 이미지를 유창하게 설명할 수 있다고 해서, 자동으로 개수 세기, 재고 점검, 문서 추출, 공간 탐색, 시각 품질 관리를 맡겨도 되는 것은 아니다.

시각 시스템을 배포하는 팀은 자신의 워크플로에 영향을 주는 정확한 실패 모드에 대해 작업별 평가가 필요할 수 있다. 리테일 시스템은 물체 존재 여부와 세밀한 속성을 시험해야 한다. 문서 제품은 OCR과 레이아웃 해석을 측정해야 한다. 로봇 또는 산업용 애플리케이션은 계획이나 도구 사용을 추가하기 전에 위치 특정, 깊이, 공간 관계를 별도로 평가해야 한다.

이 벤치마크는 영향이 큰 시각 출력 주변에 검증 단계를 두는 것도 지지한다. 잘못된 개수나 놓친 경고가 재무, 안전, 규제 준수상 결과를 낳는다면, 두 번째 모델, 기존 컴퓨터 비전 도구, 구조화 추출, 인간 검토가 적절할 수 있다. 이런 안전장치는 지연과 비용을 늘리지만, PerceptionBench의 점수는 유창한 답변만으로는 정확한 인식을 입증할 수 없음을 보여준다.

모델 공급업체에게는 이번 공개가 총합 멀티모달 벤치마크뿐 아니라 범주별 결과도 보고하라는 압박으로 작용한다. GPT-5.6 Sol, Kimi K3, Claude Fable 5, Gemini 3.1 Pro를 비교하는 개발자들은 OCR, 환각 저항성, 개수 세기, 공간 이해 중 무엇을 우선하느냐에 따라 서로 다른 결론에 도달할 수 있다.

앞으로 주목할 점

가장 먼저 지켜볼 신호는 모델 버전과 추론 설정 전반에서 PerceptionBench 결과가 독립적으로 재현되는지 여부다. 벤치마크와 코드는 공개되어 있으므로 외부 평가는 보고된 격차가 Moonshot AI의 설정 밖에서도 지속되는지 확인할 수 있다.

연구자들은 오염과 과제 구성도 살펴봐야 하며, 특히 알려진 모델 오류에서 유래한 질문의 비율과 증강 이미지의 효과를 검토해야 한다. 이런 세부사항은 이 벤치마크가 일반적인 시각 능력을 측정하는지, 아니면 저자들이 이미 관찰한 실패 패턴을 강하게 겨냥하는지를 판단하는 데 도움이 된다.

구매자에게 유용한 다음 질문은 단순히 전체 1위를 차지한 모델이 무엇인지가 아니다. 공급업체가 신뢰할 수 있는 범주별 결과를 공개하는지, 그리고 개선이 실제 이미지, 변화하는 레이아웃, 노이즈가 많은 카메라 입력, 실무에서 마주치는 예외 사례로도 이어지는지 여부다.

Creati.ai 관점

PerceptionBench의 가치는 멀티모달 AI에 대한 최종 판결이라기보다 진단용 벤치마크로서 가장 크다. 이 벤치마크의 핵심 기여는 보는 것과 추론하는 것을 분리한 데 있으며, 많은 제품 평가는 이 구분을 흐리게 만든다. 모델이 이미지를 설득력 있게 설명할 수 있어도, 그 이미지에 무엇이 들어 있는지에 대해서는 틀릴 수 있다.

AI 팀을 위한 실질적 교훈은 분명하다. 워크플로가 의존하는 시각적 기본 요소를 시험하고, 실패 비용을 측정하며, 지각 오류가 퍼질 수 있는 지점에 검증을 배치하라. 멀티모달 시스템이 이런 겉보기에 단순한 과제에서 더 신뢰할 수 있게 되기 전까지는, 모델 선택은 일반 역량 점수가 아니라 구체적인 시각 작업에 기반해야 한다.

추천

PerceptionBench, 선도적 AI 모델도 이미지를 안정적으로 읽지 못한다는 점을 보여주다

Moonshot AI의 PerceptionBench는 주요 멀티모달 모델이 기본 시각 작업에서 60% 미만에 머무르며, 겉보기의 추론 오류 뒤에 있는 지각 실패를 드러낸다.