AnthropicのClaude Opus 5がARC-AGI-3で大きく前進したが、ベンチマークをめぐる議論はむしろ激化している
AnthropicのClaude Opus 5がARC-AGI-3で新たな最高スコアを記録し、真の推論力向上なのかベンチマーク対策なのかという新たな疑問を呼んでいる。
AnthropicのClaude Opus 5がARC-AGI-3で新たな最高スコアを記録し、真の推論力向上なのかベンチマーク対策なのかという新たな疑問を呼んでいる。
OpenAIはSWE-Bench Proの課題の約30%が壊れている可能性があるとし、AI業界がコーディングモデルをどう測定するかについて新たな疑問を投げかけています。
新しい生成AIを活用したベンチマークシステムにより、自動運転車およびロボタクシー分野で中国が米国の競合を上回っていることが明らかになった。
Google DeepMindはKaggle Game ArenaでWerewolfとポーカーのベンチマークを開始し、AIの社会的スキル、詐欺検出、リスク管理を検証します。Gemini 3 ProおよびFlashモデルは前世代に比べて大幅な性能向上を示しています。
AIベンチマーキングに関する最新ニュースと分析