
Google DeepMind está probando la evaluación doble ciega de un modelo de IA de vanguardia. En el proyecto participa el Instituto de Seguridad de IA de Singapur, y para la verificación se utiliza Gemini Flash Lite.
La protección criptográfica a través de Confidential Space no debe permitir que Google vea las preguntas de la prueba, y a los evaluadores no se les debe dar acceso a los pesos del modelo. No se revelan detalles de la procedimiento ni sus resultados en el material proporcionado.
El valor del proyecto es un intento de reducir el riesgo de interferencia en la evaluación de modelos. Si el enfoque funciona, podría convertirse en un referente para benchmarks más protegidos, pero actualmente no hay datos confirmados al respecto.
comentario editorial
Por qué importa
Consecuencia probable: un aumento de los requerimientos de independencia y protección de los benchmarks de IA. La próxima señal observable serán los detalles publicados del procedimiento y los resultados del piloto. Una incertidumbre sustancial se debe a que actualmente solo hay una fuente y sus metadatos, sin el texto completo ni resultados confirmados de las pruebas.