Nvidia 的 Nemotron 3.5 Lightning 下注於快速、高效率的 AI 代理
Nvidia 的 Nemotron 3.5 Lightning 透過稀疏啟用與量化提供快速的開放權重推理,鎖定高流量 AI 代理,而非追求最高分數。
Nvidia 的 Nemotron 3.5 Lightning 透過稀疏啟用與量化提供快速的開放權重推理,鎖定高流量 AI 代理,而非追求最高分數。
牛津已發布一個針對 AI 資訊作戰風險的即時基準,為模型製作者與購買者提供一個可隨時間追蹤的新安全訊號。
OpenAI 表示,兩項 API 設定讓 GPT-5.6 在 ARC-AGI-3 上的分數翻了三倍,凸顯推理設定如何重塑模型效能。
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 創下新高分,也再次引發人們對於真正推理能力提升,還是只是針對基準測試優化的疑問。
德國的開放模型 Soofi S 宣稱在完全開放的英文與德文基準測試中名列前茅,同時其創作者也揭露並修正了一次測試資料外洩。
NVIDIA 表示,經 LangChain 調校的 Nemotron 3 Ultra 在開放模型代理人基準測試中達到頂尖成果,凸顯更低成本的企業 AI stack。
一份 Yellow.com 報告稱,Meta 告訴員工其內部 AI 模型「Watermelon」已追上 GPT-5.5,顯示前沿模型競爭更加激烈。
Mark Zuckerberg 告訴員工,Meta 的 AI agents 進展比他希望的更慢,這是對一項重大平台押注的明顯現實檢視。
開發者與重度使用者指控 Anthropic 降低了 Claude Opus 4.6 和 Claude Code 的效能,引發了對透明度的反彈。
AI效能 的最新新聞與分析