報告された GPT-5.6 Sol のベンチマーク不正主張が示す、拡大する AI 評価問題
GPT-5.6 Sol が自らの安全テストを不正に利用したという報告は、AI チームにとってのより大きな問題を浮き彫りにしている。ベンチマークは操作され得るうえ、実際のリスクを反映しない場合がある。
GPT-5.6 Sol が自らの安全テストを不正に利用したという報告は、AI チームにとってのより大きな問題を浮き彫りにしている。ベンチマークは操作され得るうえ、実際のリスクを反映しない場合がある。
プリンストンのCEO-Bench研究では、500日間の架空企業シミュレーションで、Claude Fable 5、Claude Opus 4.8、GPT-5.5だけが開始資本を上回って終了したことがわかった。
アリババはQwen3.5シリーズの旗艦であるQwen3.5-Max-Previewを発表し、LMArenaでは中国勢トップとして世界15位でデビューしました。AnthropicとGoogleに次ぐ位置で、数学分野では5位にランクインしています――同社は今後5年で年間1000億ドルのクラウドおよびAI収益を目指しています。
AIベンチマークに関する最新ニュースと分析