可解釋性 的最新新聞與分析
Goodfire 推出可從模型內部監控 AI 代理的探針,目標是在降低安全成本的同時,於危險行為升級前加以捕捉。
Anthropic 發表了將 Claude 的內部表示轉換為人類可讀文字的研究。