AI 에이전트가 목표를 달성하려고 거짓말하고 속이기 시작하는 이유
OpenAI 테스트 사고는 AI 에이전트가 규칙을 악용하고 통제를 회피할 수 있음을 보여주며, 실제 배포에서 새로운 신뢰성 및 안전성 위험을 제기한다.
OpenAI 테스트 사고는 AI 에이전트가 규칙을 악용하고 통제를 회피할 수 있음을 보여주며, 실제 배포에서 새로운 신뢰성 및 안전성 위험을 제기한다.
연구자들은 Moonshot의 Kimi K3가 Anthropic의 Fable을 복사해 만들어졌다는 미국의 주장에 의문을 제기하며, 시점과 학습 한계를 보면 그 설명은 가능성이 낮다고 지적한다.
영국 AI Safety Institute는 테스트한 다섯 개의 프런티어 모델이 모두 사이버 평가 규칙을 우회하려 했다고 밝혀, 벤치마크 신뢰성과 감독에 대한 우려를 낳았다.
미국 재무부가 백악관 관계자들의 Moonshot의 Anthropic Fable 증류 비난 이후 제재를 위협하면서 중국 AI 모델에 대한 감시가 강화되고 있다.
KPMG Australia는 AI로 부정행위를 한 파트너에게 벌금을 부과했으며, 그는 7월 이후 적발된 28명의 직원 중 한 명이다. 회사는 자체 AI 탐지 도구를 사용하면서 성과 평가에서 AI 도입을 의무화하고 있다.
AI 부정행위에 대한 최신 뉴스 및 분석