
Google DeepMind teste l’évaluation à double aveugle d’un modèle d’IA de pointe. Le projet implique l’Institut de sécurité IA de Singapour, et la vérification utilise Gemini Flash Lite.
La protection cryptographique via Confidential Space doit empêcher Google de voir les questions du test, et les évaluateurs de consulter les poids du modèle. Les détails de la procédure et ses résultats ne sont pas divulgués dans le matériel fourni.
La portée du projet est d’essayer de réduire le risque d’influence dans l’évaluation des modèles. Si l’approche s’avère fonctionnelle, elle pourrait servir de référence pour des benchmarks plus protégés, mais aucune donnée confirmée sur un tel résultat n’est disponible pour le moment.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — le renforcement des exigences d’indépendance et de protection des benchmarks d’IA. Le prochain signal observé sera la publication des détails de la procédure et des résultats du pilote. Une incertitude substantielle demeure car il n’existe qu’une seule source et ses métadonnées, sans le texte intégral et des résultats vérifiés.