ChatGPT와 Claude에 도전한다는 중국 AI 모델을 둘러싼 보도 엇갈려
GLM-5.2와 Qwen3.8-Max에 대한 두 보도가 상충된 주장을 내놓으며, 빈약한 벤치마크 증거가 ChatGPT와 Claude 비교를 어떻게 왜곡할 수 있는지 보여준다.
GLM-5.2와 Qwen3.8-Max에 대한 두 보도가 상충된 주장을 내놓으며, 빈약한 벤치마크 증거가 ChatGPT와 Claude 비교를 어떻게 왜곡할 수 있는지 보여준다.
Databricks는 실제 코드베이스 작업에서 작업당 비용은 더 낮으면서 Opus와 유사한 성능이 확인되자 GLM 5.2를 기본 코딩 모델로 삼을 예정이다.
구글은 최신 AI 모델인 Gemini 3.1 Pro를 공개했다. 이 모델은 ARC-AGI-2에서 추상적 추론 성능이 두 배로 향상되었으며, 19개의 주요 벤치마크 중 12개에서 경쟁 제품인 GPT-5.2와 Claude Opus 4.6을 능가했다.
LLM 벤치마크에 대한 최신 뉴스 및 분석