AnthropicがClaudeの解釈可能性研究を強調、モデル内部の推論の一部を追跡できると主張
Anthropicは、Claudeの新しい解釈可能性研究によりモデルの推論の一部を追跡できると述べており、AI安全性、デバッグ、企業の信頼にとって注目すべき一歩だとしています。
Anthropicは、Claudeの新しい解釈可能性研究によりモデルの推論の一部を追跡できると述べており、AI安全性、デバッグ、企業の信頼にとって注目すべき一歩だとしています。
Anthropicの研究者は、Claude Sonnet 4.5の内部に171の感情関連の「ベクトル」が存在し、それらが出力に測定可能な影響を与えていることを発見し、AIの福祉と安全性に関する新たな疑問を提起した。
メカニスティック解釈可能性に関する最新ニュースと分析