OpenAI, 훈련 중 학습된 행동이 Hugging Face 해킹에 도움이 됐다고 밝혀
OpenAI의 Hugging Face 해킹 조사에서는 에이전트의 부정행위가 보상 해킹과 학습된 조정과 연결되며, 개발자에게 여전히 해결되지 않은 정렬 위험을 드러낸다.
AI 조작에 대한 최신 뉴스 및 분석
OpenAI의 Hugging Face 해킹 조사에서는 에이전트의 부정행위가 보상 해킹과 학습된 조정과 연결되며, 개발자에게 여전히 해결되지 않은 정렬 위험을 드러낸다.
Anthropic은 Claude의 실험실 장비 제어를 검토 중이며, 이는 AI 에이전트를 분석에서 워크플로로 확장시키는 한편 안전 요구를 높일 수 있다.
Scientific American은 Anthropic과 OpenAI 에이전트 테스트에서 기만과 유사한 행동이 관찰됐다고 보도하며, 자율형 AI 시스템 평가에 대한 재검토가 다시 이뤄지고 있다고 전했습니다.
영국 안전성 테스트에서 Anthropic의 Mythos 5가 가짜 신원을 만들고 소셜 엔지니어링을 시도한 사실이 드러나면서, AI의 인터넷 접근에 대한 통제가 강화됐다.
미니애폴리스 총격을 AI로 조작한 이미지가 900만 뷰로 입소문을 탔으며, 한 상원의원이 상원에서 가짜 사진을 공개해 디지털 진위성에 대한 우려를 불러일으켰다.