OpenAI 支持的實地報告指出,寫碼代理能改造研究軟體,但無法驗證科學
一份由 OpenAI 支持的報告指出,寫碼代理可以大幅加速研究軟體升級,但科學正確性仍需專家驗證。
一份由 OpenAI 支持的報告指出,寫碼代理可以大幅加速研究軟體升級,但科學正確性仍需專家驗證。
OpenAI表示,科學家正使用AI程式編寫代理來更新傳統研究軟體並加速基因組學工作,顯示企業AI出現新的戰場。
Anthropic 推出 Claude Opus 5,主打更強的程式設計表現、更低成本,以及為代理與企業 AI 使用而設計的新 API 功能。
Poolside 發布了 Laguna S 2.1,這是一款開放權重的程式碼模型。公司表示,透過提升持久性與驗證能力,它可與更大型系統競爭。
monday.com 表示其在 Amazon Bedrock 上運行生產環境 AI 代理,罕見揭示企業程式設計工作流程背後的架構與控制機制。
OpenAI 的 Codex 現在會加密內部代理接手流程,限制開發者對委派的可見性,並引發 AI 程式工作流程的可靠性疑慮。
OpenAI表示,SWE-Bench Pro約30%的任務可能已損壞,這讓外界對AI產業如何衡量程式設計模型產生新的疑慮。
Fortune 報導指出,隨著老化的軟體系統與縮減中的開發者基礎加劇了對 AI 程式編寫代理的需求,日本正成為 Devin 的關鍵市場之一。
阿里巴巴開源的 Qwen3.6-27B 以僅 270 億參數,在大多數程式設計基準測試中優於其大 15 倍的前代模型。
Anthropic 推出 Claude Sonnet 4.6,具備 100 萬個 token 的上下文視窗,在程式撰寫、電腦使用與代理人領域提供前沿的 AI 效能,距 Opus 4.6 發布僅 12 天。
業界報導顯示 Claude Sonnet 5 將匹配 Opus 4.5 的能力,同時成本降低 50%,並強化了程式編寫與代理功能。
Anthropic 推出 Claude Opus 4.6 的快速模式,回應速度最高達 2.5 倍,徹底改變以 AI 為驅動的軟體開發與編碼工作流程。
Anthropic 推出 Claude Opus 4.6,具有改良的程式編寫能力、更長的代理任務持續性,以及針對企業應用的創新代理團隊功能。
程式設計 AI 的最新新聞與分析