Anthropic 的 Claude Opus 5 在 ARC-AGI-3 取得明顯進展,但基準測試之爭只會越來越大聲
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 創下新高分,也再次引發人們對於真正推理能力提升,還是只是針對基準測試優化的疑問。
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 創下新高分,也再次引發人們對於真正推理能力提升,還是只是針對基準測試優化的疑問。
OpenAI表示,SWE-Bench Pro約30%的任務可能已損壞,這讓外界對AI產業如何衡量程式設計模型產生新的疑慮。
一套新的生成式 AI 驅動基準測試系統顯示,中國在自動駕駛車輛和自駕計程車領域相較於美國競爭對手具有主導地位。
Google DeepMind 在 Kaggle Game Arena 推出狼人殺與撲克基準測試,以評估 AI 的社交能力、偵測欺騙與風險管理。Gemini 3 Pro 與 Flash 模型較前一代展現了顯著的性能躍升。
AI 基準測試 的最新新聞與分析