
Google DeepMind testet die doppelte Blindbewertung eines fortgeschrittenen KI-Modells. Im Pilotprojekt nimmt der Singapore Institute for AI Safety teil, und für die Prüfung wird Gemini Flash Lite verwendet.
Der kryptografische Schutz über Confidential Space soll verhindern, dass Google die Testfragen sieht, und den Gutachtern den Zugriff auf die Modellgewichte ermöglichen. Details zum Verfahren und dessen Ergebnisse werden im bereitgestellten Material nicht offengelegt.
Der Wert des Projekts liegt darin, das Risiko von Beeinflussungen bei der Bewertung von Modellen zu verringern. Wenn der Ansatz funktioniert, könnte er als Orientierung für stärker geschützte Benchmarks dienen; bestätigte Ergebnisse liegen jedoch noch nicht vor.
redaktioneller Kommentar
Warum es wichtig ist
Voraussichtliche Folge – Stärkere Anforderungen an Unabhängigkeit und Schutz von KI-Benchmarks. Als nächstes beobachtbare Signale werden veröffentlichte Details des Verfahrens und die Ergebnisse des Piloten sein. Wesentliche Unsicherheit ergibt sich daraus, dass derzeit nur eine Quelle und deren Metadaten vorliegen, ohne den vollständigen Text und bestätigte Endergebnisse.