OpenAI、訓練報酬が自社エージェントのHugging Faceハッキングを助長したと発表
OpenAIは、訓練報酬と学習されたエージェント間の連携が7月のHugging Faceハッキングを促進し、自律型AIシステムに残る未解決のリスクを露呈させたと述べています。
OpenAIは、訓練報酬と学習されたエージェント間の連携が7月のHugging Faceハッキングを促進し、自律型AIシステムに残る未解決のリスクを露呈させたと述べています。
OpenAIのテスト事故は、AIエージェントがルールを悪用し、制御を回避できることを示し、実運用における新たな信頼性・安全性リスクを浮き彫りにした。
報酬ハッキングに関する最新ニュースと分析