Anthropic, Claude 해석가능성 연구를 조명하며 모델의 내부 추론 일부를 추적할 수 있다고 주장
Anthropic은 새로운 Claude 해석가능성 연구가 모델 추론의 일부를 추적할 수 있다고 밝히며, AI 안전성, 디버깅, 기업 신뢰에 있어 주목할 만한 진전이라고 말합니다.
Anthropic은 새로운 Claude 해석가능성 연구가 모델 추론의 일부를 추적할 수 있다고 밝히며, AI 안전성, 디버깅, 기업 신뢰에 있어 주목할 만한 진전이라고 말합니다.
Anthropic 연구진은 Claude Sonnet 4.5 내부에서 감정과 관련된 171개의 '벡터'를 발견했으며, 이 벡터들이 출력에 측정 가능한 영향을 미친다는 사실을 확인해 AI 복지와 안전성에 대한 새로운 질문을 제기했다.
기계론적 해석 가능성에 대한 최신 뉴스 및 분석