Goodfire, Baseten에서 폭주 AI 에이전트용 모델 내부 모니터 출시
Goodfire가 모델 내부에서 AI 에이전트를 모니터링하는 프로브를 출시했다. 안전 비용을 줄이는 동시에 위험한 행동이 확대되기 전에 포착하는 것이 목표다.
해석 가능성에 대한 최신 뉴스 및 분석
Goodfire가 모델 내부에서 AI 에이전트를 모니터링하는 프로브를 출시했다. 안전 비용을 줄이는 동시에 위험한 행동이 확대되기 전에 포착하는 것이 목표다.
Anthropic은 Claude의 내부 표현을 사람이 읽을 수 있는 텍스트로 변환하는 연구를 발표했다.