Motif, 글로벌 AI 인덱스 선두로 보도… 한국은 두 번째 Dokpamo 결과 대기
Motif가 한국 모델 대상 글로벌 AI 벤치마크에서 선두를 차지한 것으로 보도된 가운데, 업계는 그 결과가 유지되는지 시험할 수 있는 두 번째 Dokpamo 평가를 기다리고 있다.
Motif가 한국 모델 대상 글로벌 AI 벤치마크에서 선두를 차지한 것으로 보도된 가운데, 업계는 그 결과가 유지되는지 시험할 수 있는 두 번째 Dokpamo 평가를 기다리고 있다.
Anthropic의 Claude Opus 5가 ARC-AGI-3에서 새로운 최고 점수를 기록하며, 실제 추론 능력 향상인지 벤치마크 대응인지에 대한 질문이 다시 불거졌다.
OpenAI는 SWE-Bench Pro 작업의 약 30%가 깨졌을 수 있다고 말하며, AI 업계가 코딩 모델을 측정하는 방식에 대한 새로운 의문을 제기했습니다.
새로운 생성형 AI 기반 벤치마킹 시스템은 자율주행차와 로보택시 부문에서 미국 경쟁사들에 대한 중국의 우위를 보여준다.
Google DeepMind는 Kaggle Game Arena에 Werewolf와 포커 벤치마크를 공개해 AI의 사회적 기술, 기만 탐지 및 위험 관리 능력을 테스트합니다. Gemini 3 Pro와 Flash 모델은 이전 세대에 비해 상당한 성능 향상을 보여주고 있습니다.
AI 벤치마킹에 대한 최신 뉴스 및 분석