Специалисты подразделения Apple Machine Learning Research опубликовали работу, посвященную изучению методов кодирования позиций в трансформерах, обрабатывающих токены из набора изображений с известными параметрами съемки. Авторы отмечают, что существующие схемы абсолютного или относительного кодирования не отвечают ключевым требованиям: уникальности кодирования патчей, инвариантности внимания к преобразованиям SE(3) с многомасштабным сходством и адаптивности к геометрии сцены.

Для решения выявленных проблем исследователи представили новый подход под названием RayRoPE (Projective Ray Positional Encoding). Этот механизм разработан специально для заполнения пробела в технологиях многовидового внимания, позволяя моделям эффективнее учитывать пространственные взаимосвязи между различными ракурсами одной сцены.

Разработка направлена на создание системы, которая может уникально кодировать фрагменты изображения и гибко реагировать на изменения геометрии окружающего пространства. Предложенное решение позиционируется как ответ на ограничения предыдущих методов, которые не смогли одновременно обеспечить все необходимые свойства для качественной обработки многовидовых данных.