
Google DeepMind testa avaliação dupla cega de modelo de IA de ponta. No projeto piloto participa o Instituto de Segurança de IA de Singapura, e para verificação é utilizado o Gemini Flash Lite.
A proteção criptográfica através do Confidential Space não deve permitir que o Google veja as perguntas do teste, nem que os avaliadores tenham acesso aos pesos do modelo. Detalhes da procedure e seus resultados no material fornecido não são divulgados.
O significado do projeto é a tentativa de reduzir o risco de interferência na avaliação de modelos. Se a abordagem funcionar, ela pode tornar-se um modelo para benchmarks mais protegidos, mas ainda não há dados confirmados sobre esse resultado.
comentário editorial
Por que importa
Provável consequência — reforço das exigências de independência e proteção de benchmarks de IA. O próximo sinal observado serão os detalhes publicados do procedimento e os resultados do piloto. Uma incerteza significativa está associada ao fato de que hoje há apenas uma fonte e seus metadados, sem o texto completo e resultados confirmados do teste.