Goodfire、Basetenで暴走AIエージェント向けのモデル内部モニターを開始
Goodfireは、モデルの内部からAIエージェントを監視するプローブを開始した。安全対策のコストを抑えながら、危険な行動がエスカレートする前に検知することを目指す。
解釈可能性に関する最新ニュースと分析
Goodfireは、モデルの内部からAIエージェントを監視するプローブを開始した。安全対策のコストを抑えながら、危険な行動がエスカレートする前に検知することを目指す。
Anthropicは、Claudeの内部表現を人間が読めるテキストに変換する研究を公開した。