Google DeepMind a annoncé le pilotage d'évaluations d'IA en double aveugle — une approche qualifiée de premier au monde dans le titre de la publication. La description du projet est liée à la vérification de références de modèles fermés dans des environnements cryptographiquement sécurisés.

Selon la description disponible, l'objectif de l'initiative est d'accroître la confiance dans de tels tests comparatifs. Les détails sur le design des essais, les participants et les résultats dans la source présentée ne sont pas divulgués.

La valeur pratique du projet dépendra de la mesure dans laquelle les évaluations seront indépendantes et si le processus proposé peut rendre la comparaison des modèles vérifiable pour les parties externes. Pour l'instant, cela reste une question en attendant la publication des données.