Google DeepMind testet die doppelte Blindbewertung eines fortgeschrittenen KI-Modells. Im Pilotprojekt nimmt der Singapore Institute for AI Safety teil, und für die Prüfung wird Gemini Flash Lite verwendet.

Der kryptografische Schutz über Confidential Space soll verhindern, dass Google die Testfragen sieht, und den Gutachtern den Zugriff auf die Modellgewichte ermöglichen. Details zum Verfahren und dessen Ergebnisse werden im bereitgestellten Material nicht offengelegt.

Der Wert des Projekts liegt darin, das Risiko von Beeinflussungen bei der Bewertung von Modellen zu verringern. Wenn der Ansatz funktioniert, könnte er als Orientierung für stärker geschützte Benchmarks dienen; bestätigte Ergebnisse liegen jedoch noch nicht vor.