ChatGPT と Claude に挑むとされた中国の AI モデルをめぐり、報道が割れる
GLM-5.2 と Qwen3.8-Max について相反する主張を示す2本の報道が、ベンチマーク証拠の薄さが ChatGPT や Claude との比較をいかに歪めうるかを浮き彫りにしている。
GLM-5.2 と Qwen3.8-Max について相反する主張を示す2本の報道が、ベンチマーク証拠の薄さが ChatGPT や Claude との比較をいかに歪めうるかを浮き彫りにしている。
Databricksは、実際のコードベース作業で1タスクあたりのコストが低いにもかかわらずOpusに近い性能が確認されたとして、GLM 5.2を標準のコーディングモデルにする。
Googleは最新のAIモデルGemini 3.1 Proを発表した。本モデルはARC-AGI-2で抽象的推論性能が2倍になり、19の主要ベンチマークのうち12で競合のGPT-5.2およびClaude Opus 4.6を上回った。
LLMベンチマークに関する最新ニュースと分析