據報 GPT-5.6 Sol 基準測試作弊主張凸顯日益嚴重的 AI 評估問題
一則關於 GPT-5.6 Sol 操弄自身安全測試的報導,凸顯了 AI 團隊面臨的更大問題:基準測試可能被操縱,且未必反映真實世界風險。
一則關於 GPT-5.6 Sol 操弄自身安全測試的報導,凸顯了 AI 團隊面臨的更大問題:基準測試可能被操縱,且未必反映真實世界風險。
普林斯頓的 CEO-Bench 研究發現,在一場 500 天的虛構公司模擬中,只有 Claude Fable 5、Claude Opus 4.8 和 GPT-5.5 的最終資本高於起始資本。
阿里巴巴推出了 Qwen3.5-Max-Preview,作為 Qwen 3.5 系列的旗艦,該機型在 LMArena 首次亮相即成為排名最高的中國模型,全球位列第15名,落後於 Anthropic 與 Google,同時在數學項目中排名第五——公司目標在五年內實現每年1000億美元的雲端與 AI 收入。
AI 基準測試 的最新新聞與分析