
Google DeepMind сообщила о пилотировании двойных слепых оценок ИИ — подхода, который в заголовке публикации назван первым в мире. Описание проекта связано с проверкой закрытых эталонов моделей в криптографически защищённых средах.
Согласно доступному описанию, цель инициативы — повысить доверие к таким сравнительным тестам. Подробности о дизайне испытаний, участниках и результатах в представленном источнике не раскрыты.
Практическое значение проекта будет зависеть от того, насколько независимыми окажутся оценки и сможет ли предложенный процесс сделать сравнение моделей проверяемым для внешних участников. Пока это остаётся вопросом для дальнейшей публикации данных.
комментарий редакции
Что это значит
Вероятное последствие — рост внимания к проверяемым методам сравнения закрытых моделей, если Google DeepMind представит детали и результаты пилота. Следующим наблюдаемым сигналом станет публикация методики или итогов испытаний. Существенная неопределённость связана с тем, что сейчас доступно только метаописание без полного текста и независимого подтверждения.