Les spécialistes de la division Apple Machine Learning Research ont publié un travail consacré à l'étude des méthodes de codage positionnel dans les transformateurs traitant des jetons issus d'un ensemble d'images avec des paramètres de capture connus. Les auteurs soulignent que les schémas existants de codage absolu ou relatif ne répondent pas aux exigences clés : l'unicité du codage des patchs, l'invariance de l'attention aux transformations SE(3) avec une similarité multi-échelle et l'adaptabilité à la géométrie de la scène.

Pour résoudre les problèmes identifiés, les chercheurs ont présenté une nouvelle approche appelée RayRoPE (Projective Ray Positional Encoding). Ce mécanisme a été conçu spécifiquement pour combler une lacune dans les technologies d'attention multi-vues, permettant aux modèles de prendre plus efficacement en compte les relations spatiales entre les différents angles de vue d'une même scène.

Le développement vise à créer un système capable de coder de manière unique les fragments d'image et de réagir avec souplesse aux changements de géométrie de l'espace environnant. La solution proposée est présentée comme une réponse aux limitations des méthodes précédentes, qui n'ont pas réussi à assurer simultanément toutes les propriétés nécessaires pour un traitement de qualité des données multi-vues.