Argo-Bench報告:頂尖AI代理人僅完成210項任務的34.8%
一項據報的Argo-Bench結果顯示,領先的AI代理人完成了210項任務中的34.8%,凸顯自主系統仍存在尚未解決的可靠性限制。
AI效能 的最新新聞與分析
一項據報的Argo-Bench結果顯示,領先的AI代理人完成了210項任務中的34.8%,凸顯自主系統仍存在尚未解決的可靠性限制。
Anthropic 推出 Opus 5.5,具備更低的 token 價格、更快的輸出,以及宣稱達到 Fable 級的結果,將高效率企業 AI 的門檻再度拉高。
NVIDIA 表示,Vera Rubin NVL72 相較於 GB300,每百萬瓦可提供高達 30 倍的 agentic 推論吞吐量,但仍待獨立基準審查。
Meta 的 Muse Spark 1.3 提升了代理式與程式碼能力分數,但它每項任務的低成本,可能比它尚未完成的前沿挑戰更重要。
NVIDIA 表示,Vera Rubin NVL72 每兆瓦可提供高達 GB300 30 倍的代理式 AI 吞吐量,目標是長上下文推論成本。
Meta 推出了 Muse Spark 1.3,並以更好的程式撰寫與代理式任務表現來與 OpenAI 和 Anthropic 競爭。
NVIDIA 表示,Vera Rubin NVL72 每兆瓦可提供的代理式 AI 吞吐量最高可達 GB300 的 30 倍,正在重塑推理經濟。
OpenAI 表示,Jalapeño 晶片可提升多種模型的 AI 推論速度與能效,但目前結果仍屬於供應商自述,且尚未正式部署。
OpenAI 公布的 Jalapeño 推論基準在速度與效率上超越 Nvidia 系統,但受限於部署規模與供應商提供的數據,這項說法仍需保留。
NVIDIA 表示,Vera Rubin NVL72 每兆瓦可提供高達比 GB300 多 30 倍的代理式吞吐量,正在重塑 AI 建構者的推論經濟。
普林斯頓與 UC San Diego 的研究發現,AI agents 的 skills 比知識更能提升執行表現,但隨著資料庫擴大,檢索能力會崩潰。
NVIDIA表示,其AVO代理在ARC-AGI-3取得滿分,突顯記憶、監督與工具如何擴展模型效能。
NVIDIA 發布了 SkillEvaluator,這是一個開源框架,用來測試代理技能是否能在真實執行中改善任務結果、安全性與效率。
OpenAI 正在預覽 Ultrafast,這是一個可讓 GPT-5.6 Sol 最高快 14 倍的 API 等級,並與 Cerebras 一起鎖定即時企業工作流程。
Nvidia 的 Nemotron 3.5 Lightning 透過稀疏啟用與量化提供快速的開放權重推理,鎖定高流量 AI 代理,而非追求最高分數。
牛津已發布一個針對 AI 資訊作戰風險的即時基準,為模型製作者與購買者提供一個可隨時間追蹤的新安全訊號。
OpenAI 表示,兩項 API 設定讓 GPT-5.6 在 ARC-AGI-3 上的分數翻了三倍,凸顯推理設定如何重塑模型效能。
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 創下新高分,也再次引發人們對於真正推理能力提升,還是只是針對基準測試優化的疑問。
德國的開放模型 Soofi S 宣稱在完全開放的英文與德文基準測試中名列前茅,同時其創作者也揭露並修正了一次測試資料外洩。
NVIDIA 表示,經 LangChain 調校的 Nemotron 3 Ultra 在開放模型代理人基準測試中達到頂尖成果,凸顯更低成本的企業 AI stack。