Google DeepMind testa avaliação dupla cega de modelo de IA de ponta. No projeto piloto participa o Instituto de Segurança de IA de Singapura, e para verificação é utilizado o Gemini Flash Lite.

A proteção criptográfica através do Confidential Space não deve permitir que o Google veja as perguntas do teste, nem que os avaliadores tenham acesso aos pesos do modelo. Detalhes da procedure e seus resultados no material fornecido não são divulgados.

O significado do projeto é a tentativa de reduzir o risco de interferência na avaliação de modelos. Se a abordagem funcionar, ela pode tornar-se um modelo para benchmarks mais protegidos, mas ainda não há dados confirmados sobre esse resultado.