Google DeepMind тестирует двойное слепое оценивание передовой модели ИИ. В пилотном проекте участвует Сингапурский институт безопасности ИИ, а для проверки используется Gemini Flash Lite.

Криптографическая защита через Confidential Space должна не позволять Google видеть вопросы теста, а оценщикам — получать доступ к весам модели. Подробности процедуры и ее результаты в предоставленном материале не раскрыты.

Значение проекта — в попытке снизить риск вмешательства в оценку моделей. Если подход окажется рабочим, он может стать ориентиром для более защищенных бенчмарков, но подтвержденных данных о таком результате пока нет.