Google DeepMind teste des benchmarks d’IA en double aveugle pour résoudre les problèmes de confiance liés à l’évaluation
Google DeepMind teste un benchmark cryptographiquement protégé en double aveugle pour Gemini Flash Lite, afin de réduire la contamination et de restaurer la confiance dans les évaluations d’IA.
