Google DeepMind anunció la realización de un piloto de evaluaciones de IA de doble ciego, un enfoque que en el título de la publicación se presenta como el primero en el mundo. La descripción del proyecto está relacionada con la verificación de estándares cerrados de modelos en entornos criptográficamente protegidos.

Según la descripción disponible, el objetivo de la iniciativa es aumentar la confianza en este tipo de pruebas comparativas. No se revelan en la fuente proporcionada detalles sobre el diseño de las pruebas, los participantes o los resultados.

El valor práctico del proyecto dependerá de cuán independientes resulten las evaluaciones y de si el proceso propuesto puede hacer que la comparación de modelos sea verificable para participantes externos. Por ahora, esto sigue siendo una cuestión para la publicación de datos futura.