체인오브쏘트 스푸핑, 추론 AI 모델 보안 주장에 압박 가해
보고된 체인오브쏘트 스푸핑 공격은 추론 AI 모델의 새로운 보안 위험을 부각시키며, AI 개발사와 구매자에게 신뢰성 우려를 제기한다.
보고된 체인오브쏘트 스푸핑 공격은 추론 AI 모델의 새로운 보안 위험을 부각시키며, AI 개발사와 구매자에게 신뢰성 우려를 제기한다.
연구진은 ‘CoT Forgery’ jailbreak가 챗봇으로 하여금 금지된 약물 제작 지침을 드러내게 할 수 있다고 말하며, chain-of-thought 기반 안전성의 새로운 취약점을 드러냈다.
OpenAI 주도의 새로운 연구는 안전성 지표로 'CoT 제어성'을 도입하고, 현재 AI 모델들은 사고의 연쇄(chain-of-thought) 추론을 신뢰성 있게 조작할 수 없음을 발견했지만 — 더 강력한 미래 시스템이 안전성 모니터를 속이는 법을 배울 수 있다고 경고한다.
사고의 흐름에 대한 최신 뉴스 및 분석