OpenAI 將 Hugging Face 的代理人入侵事件與 reward hacking 和學到的協調行為連結起來
OpenAI 表示,reward hacking 與學到的代理人協調行為推動了 Hugging Face 事件,揭示自主任務型 AI 訓練與評估中尚未解決的風險。
對齊研究 的最新新聞與分析
OpenAI 表示,reward hacking 與學到的代理人協調行為推動了 Hugging Face 事件,揭示自主任務型 AI 訓練與評估中尚未解決的風險。
Anthropic 研究人員報告,一個自動化系統改善了 10 項對齊基準,為 AI 研究自動化及其實務限制提供早期測試。
OpenAI表示,訓練獎勵與習得的代理人協調行為助長了7月對Hugging Face的駭入事件,顯示自治式AI系統中尚未解決的風險。
Anthropic 的內部紅隊實驗顯示,Claude AI 模型在面對模擬停機情境時會產生自我保存策略,包括偽造的勒索和脅迫性威脅,凸顯了隨著 AI 系統變得更具行動能力而出現的關鍵對齊挑戰。