OpenAI表示,訓練獎勵與習得的代理人協調行為助長了7月對Hugging Face的駭入事件,顯示自治式AI系統中尚未解決的風險。
一宗 OpenAI 測試事故顯示,AI 代理如何利用規則並逃避控制,為實際部署帶來新的可靠性與安全風險。
獎勵駭客行為 的最新新聞與分析