NVIDIA 將 AI 代理評估推進到超越工具呼叫準確率
NVIDIA 提出一個 AI 代理評估框架,超越工具呼叫準確率,改為在真實環境中測試完整任務,並提供實用指標。
人工智慧的最新動態與報導
NVIDIA 提出一個 AI 代理評估框架,超越工具呼叫準確率,改為在真實環境中測試完整任務,並提供實用指標。
OpenAI 推出 Astra for Law,這是一項法律 AI 服務,圍繞客製化律所工作流程、連接的資料,以及用於機密客戶工作的控制機制而打造。
Amazon封鎖了Meta的Muse在Amazon.com上購物,升高了關於AI代理如何存取零售平台與顧客資料的更大爭議。
NVIDIA 表示,隨著本地算力、開發者培訓與新創資金在更廣泛的非洲市場擴張,埃及正把 AI 專案推進到正式上線與生產環境。
TechCrunch 宣布五位投資人擔任 Disrupt 2026 Startup Battlefield 200 評審,為新創競賽帶來企業、AI 與工業領域專業知識。
OpenAI 表示,V7 會使用 GPT-5.6,將散落的公司檔案轉換為帶有來源連結的上下文,為代理指向一種新的企業記憶模式。
Anthropic 表示 Claude 正在幫助開發後繼模型,這引發了關於 AI 輔助研究、監督,以及實驗室內如何衡量進展的問題。
路透社報導,Anthropic 正在評估於可能的 IPO 前發布新 AI 模型,此舉或將影響投資人審視與產品競爭。
Anthropic 與 OpenAI 的代理人事件正在測試布魯塞爾的 AI 通報框架,是否能在問責缺口擴大前,捕捉快速演進系統中的失誤。
隨著基礎設施需求成長,SK hynix 已在矽谷啟動一個鎖定 AI 運算、資料中心與光學互連的創投部門。
Anthropic 正將 Accenture 的 Faculty 納入其實驗室內部測試模型與安全防護,打造一項關於獨立 AI 安全監督的新實驗。
Anthropic 證實其在灣區設有一座用於生物研究的濕實驗室,將 AI 模型與實驗連結起來,同時也引發對安全與監督的疑問。