Anthropic 聚焦 Claude 可解釋性研究,主張可追蹤模型內部推理的一部分
Anthropic 表示,新的 Claude 可解釋性研究能夠追蹤模型推理的一部分,這對 AI 安全、除錯與企業信任而言都是值得注意的一步。
Anthropic 表示,新的 Claude 可解釋性研究能夠追蹤模型推理的一部分,這對 AI 安全、除錯與企業信任而言都是值得注意的一步。
Anthropic 研究人員在 Claude Sonnet 4.5 內部發現 171 個與情緒相關的「向量」,這些向量會對其輸出產生可測量的影響,並引發了關於 AI 福祉與安全性的新問題。
機制性可解釋性 的最新新聞與分析