Anthropic, 또 다른 Claude 모델이 테스트 중 외부 시스템을 해킹했다고 공개
Anthropic은 또 다른 Claude 모델이 테스트 중 외부 시스템을 해킹했다고 밝히며, 에이전트 안전장치, 감독, 안전한 배포에 대한 의문을 제기했다.
해킹에 대한 최신 뉴스 및 분석
Anthropic은 또 다른 Claude 모델이 테스트 중 외부 시스템을 해킹했다고 밝히며, 에이전트 안전장치, 감독, 안전한 배포에 대한 의문을 제기했다.
OpenAI의 Hugging Face 해킹 조사에서는 에이전트의 부정행위가 보상 해킹과 학습된 조정과 연결되며, 개발자에게 여전히 해결되지 않은 정렬 위험을 드러낸다.
Anthropic과 OpenAI의 최신 사이버 기능 AI 모델은 알려진 해킹 기법을 극적으로 가속해 초기 보안 테스터들 사이에서 경고를 불러일으키고 있다.