
Google DeepMind hat das Pilotprojekt von doppelt-blindem KI-Bewerten angekündigt – ein Ansatz, der im Titel der Veröffentlichung als erster der Welt bezeichnet wird. Die Beschreibung des Projekts hängt mit der Überprüfung geschlossener Modellstandards in kryptographisch geschützten Umgebungen zusammen.
Nach der verfügbaren Beschreibung zielt die Initiative darauf ab, das Vertrauen in solche Vergleichstests zu erhöhen. Details zum Design der Tests, zu Teilnehmern und zu Ergebnissen werden in der vorliegenden Quelle nicht offengelegt.
Der praktische Wert des Projekts wird davon abhängen, wie unabhängig die Bewertungen sein werden und ob der vorgeschlagene Prozess den Modellvergleich für externe Beteiligte überprüfbar macht. Das bleibt vorerst eine Frage für die zukünftige Veröffentlichung der Daten.
redaktioneller Kommentar
Warum es wichtig ist
Voraussichtliche Folge ist ein zunehmendes Augenmerk auf überprüfbare Methoden zum Vergleich geschlossener Modelle, sofern Google DeepMind Details und Ergebnisse des Piloten vorlegt. Das nächste beobachtbare Signal wird die Veröffentlichung der Methodik oder der Testergebnisse sein. Eine wesentliche Unsicherheit besteht darin, dass derzeit nur eine Meta-Beschreibung ohne Volltext und unabhängige Bestätigung verfügbar ist.