KT 的 AutoModelRouter 據報在全球 AI 路由基準中排名第二
KT 的 AutoModelRouter 據報在全球基準中拿下第二名,將模型選擇效率推到企業 AI 部署的核心位置。
AI 基準測試 的最新新聞與分析
KT 的 AutoModelRouter 據報在全球基準中拿下第二名,將模型選擇效率推到企業 AI 部署的核心位置。
在 Andreessen Horowitz 的支持下,Vals 募得 4,000 萬美元,為企業與聯邦機構打造保密、以任務為基礎的 AI 基準測試,而較舊的測試 s…
AWS 的基準資料顯示,當團隊衡量品質、回合數與重工成本時,Amazon Bedrock 上的 OpenAI 模型可降低正確答案的成本。
Google DeepMind 正在為 Gemini Flash Lite 測試一項經密碼學保護的雙盲基準測試,目標是減少污染並重建對 AI 評估的信任。
據報導,Motif 在針對韓國模型的全球 AI 基準中領先,而產業正在等待第二次 Dokpamo 評估,以檢驗該結果是否能維持。
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 創下新高分,也再次引發人們對於真正推理能力提升,還是只是針對基準測試優化的疑問。
OpenAI表示,SWE-Bench Pro約30%的任務可能已損壞,這讓外界對AI產業如何衡量程式設計模型產生新的疑慮。
一套新的生成式 AI 驅動基準測試系統顯示,中國在自動駕駛車輛和自駕計程車領域相較於美國競爭對手具有主導地位。
Google DeepMind 在 Kaggle Game Arena 推出狼人殺與撲克基準測試,以評估 AI 的社交能力、偵測欺騙與風險管理。Gemini 3 Pro 與 Flash 模型較前一代展現了顯著的性能躍升。