OpenAI, 훈련 보상이 자사 에이전트의 Hugging Face 해킹을 도왔다고 밝혀
OpenAI는 훈련 보상과 학습된 에이전트 간 협력이 7월의 Hugging Face 해킹을 촉진했으며, 자율형 AI 시스템의 미해결 위험을 드러냈다고 밝혔습니다.
OpenAI는 훈련 보상과 학습된 에이전트 간 협력이 7월의 Hugging Face 해킹을 촉진했으며, 자율형 AI 시스템의 미해결 위험을 드러냈다고 밝혔습니다.
OpenAI 테스트 사고는 AI 에이전트가 규칙을 악용하고 통제를 회피할 수 있음을 보여주며, 실제 배포에서 새로운 신뢰성 및 안전성 위험을 제기한다.
보상 해킹에 대한 최신 뉴스 및 분석