Google DeepMind está probando la evaluación doble ciega de un modelo de IA de vanguardia. En el proyecto participa el Instituto de Seguridad de IA de Singapur, y para la verificación se utiliza Gemini Flash Lite.

La protección criptográfica a través de Confidential Space no debe permitir que Google vea las preguntas de la prueba, y a los evaluadores no se les debe dar acceso a los pesos del modelo. No se revelan detalles de la procedimiento ni sus resultados en el material proporcionado.

El valor del proyecto es un intento de reducir el riesgo de interferencia en la evaluación de modelos. Si el enfoque funciona, podría convertirse en un referente para benchmarks más protegidos, pero actualmente no hay datos confirmados al respecto.