
Google DeepMind anunció la realización de un piloto de evaluaciones de IA de doble ciego, un enfoque que en el título de la publicación se presenta como el primero en el mundo. La descripción del proyecto está relacionada con la verificación de estándares cerrados de modelos en entornos criptográficamente protegidos.
Según la descripción disponible, el objetivo de la iniciativa es aumentar la confianza en este tipo de pruebas comparativas. No se revelan en la fuente proporcionada detalles sobre el diseño de las pruebas, los participantes o los resultados.
El valor práctico del proyecto dependerá de cuán independientes resulten las evaluaciones y de si el proceso propuesto puede hacer que la comparación de modelos sea verificable para participantes externos. Por ahora, esto sigue siendo una cuestión para la publicación de datos futura.
comentario editorial
Por qué importa
Consecuencia probable: un aumento de la atención a métodos verificables de comparación de modelos cerrados, si Google DeepMind presenta los detalles y los resultados del piloto. La siguiente señal observada será la publicación de la metodología o de los resultados de las pruebas. Una gran incertidumbre está relacionada con que actualmente solo se dispone de una meta-descripción sin texto completo y sin verificación independiente.