OpenAI表示,兩項 API 設定大幅提升 GPT-5.6 在 ARC-AGI-3 上的表現,凸顯推理控制如何改變模型結果
OpenAI 表示,兩項 API 設定讓 GPT-5.6 在 ARC-AGI-3 上的分數翻了三倍,凸顯推理設定如何重塑模型效能。
OpenAI 表示,兩項 API 設定讓 GPT-5.6 在 ARC-AGI-3 上的分數翻了三倍,凸顯推理設定如何重塑模型效能。
一則據報與 OpenAI 測試有關、涉及 Hugging Face 的入侵事件,重新點燃了關於 AI 代理沙箱、責任歸屬與企業風險控管的討論。
來自 ZDNET 與 The Tech Buzz 的報導指出,開放權重與封閉式 AI 模型之間的分歧正變得更加明顯,對成本、控制與競爭都有重大影響。
Block 的 Goose 正作為 Claude Code 的免費本地替代方案受到關注,凸顯 AI 寫碼工具在成本、隱私與控制之間的取捨。
Encore AI 已完成 3,000 萬美元 A 輪募資,打造以客戶通話訓練的語音與文字代理,押注於特定工作流程的企業 AI。
SK Telecom 發布第二款韓語模型 A.X K2,顯示其在國內企業 AI 上更深的布局與更強的推理訴求。
Anthropic 表示 Claude Mythos 找到了 HAWK 與縮減版 AES 的缺陷,顯示 AI 可能加速密碼分析,卻不會威脅現有系統。
The Guardian 與 Cybersecurity Insiders 的報導凸顯出一股新推力:在部署前先衡量 AI 代理的行為,以評估企業所面臨的安全風險。
Microsoft 表示,一款新的 AI 安全模型在基準測試中表現優於 Mythos,顯示其正進軍專門化的網路 AI;而買家要的是證據,不是炒作。
Communications of the ACM 的一篇文章提出了評估 foundation models 開放性的框架,這是企業 AI 買家與建構者的關鍵議題。
NVIDIA 已開源一套 GPU 加速的醫療物理模擬框架,目標是加速醫療機器人的訓練與測試。
人工智慧的最新動態與報導