Anthropic、Claude に関する社内研究で分離可能な推論レイヤーの存在を示唆し、言語モデルはどう考えるのかという議論が再燃
Anthropic は、Claude に分離可能な内部推論ワークスペースを見いだしたという新研究を発表したとし、AI の解釈可能性と安全性の取り組みを変える可能性があるとしている。
Anthropic は、Claude に分離可能な内部推論ワークスペースを見いだしたという新研究を発表したとし、AI の解釈可能性と安全性の取り組みを変える可能性があるとしている。
CASソフトウェア研究所は、デバッグ、信頼、評価のためにAIモデルの推論をより可視化することを目的としたツール Reasoning Lens を公開した。
Anthropicの研究者たちは、ニューロン解析と心理学実験を通じてClaude AIの内部動作を探り、システムの心を理解しようとしています。
AIの解釈可能性に関する最新ニュースと分析