
Google DeepMind тестирует двойное слепое оценивание передовой модели ИИ. В пилотном проекте участвует Сингапурский институт безопасности ИИ, а для проверки используется Gemini Flash Lite.
Криптографическая защита через Confidential Space должна не позволять Google видеть вопросы теста, а оценщикам — получать доступ к весам модели. Подробности процедуры и ее результаты в предоставленном материале не раскрыты.
Значение проекта — в попытке снизить риск вмешательства в оценку моделей. Если подход окажется рабочим, он может стать ориентиром для более защищенных бенчмарков, но подтвержденных данных о таком результате пока нет.
комментарий редакции
Что это значит
Вероятное последствие — усиление требований к независимости и защищенности бенчмарков ИИ. Следующим наблюдаемым сигналом станут опубликованные детали процедуры и результаты пилота. Существенная неопределенность связана с тем, что сейчас доступен только один источник и его метаданные, без полного текста и подтвержденных итогов испытания.