Anthropic met en avant la recherche d’interprétabilité sur Claude, affirmant qu’elle peut retracer une partie du raisonnement interne d’un modèle
Anthropic affirme que de nouvelles recherches sur l’interprétabilité de Claude peuvent retracer une partie du raisonnement du modèle, une avancée notable pour la sécurité de l’IA, le débogage et la confiance des entreprises.
