Especialistas de la división Apple Machine Learning Research han publicado un trabajo dedicado al estudio de métodos de codificación posicional en transformadores que procesan tokens provenientes de un conjunto de imágenes con parámetros de captura conocidos. Los autores señalan que los esquemas existentes de codificación absoluta o relativa no cumplen con los requisitos clave: unicidad en la codificación de parches, invariancia de la atención ante transformaciones SE(3) con similitud multiescala y adaptabilidad a la geometría de la escena.

Para abordar los problemas identificados, los investigadores presentaron un nuevo enfoque llamado RayRoPE (Projective Ray Positional Encoding). Este mecanismo ha sido diseñado específicamente para llenar el vacío en las tecnologías de atención multivista, permitiendo a los modelos tener en cuenta de manera más eficaz las relaciones espaciales entre diferentes perspectivas de una misma escena.

El desarrollo está orientado a crear un sistema capaz de codificar únicamente fragmentos de imagen y responder con flexibilidad a los cambios en la geometría del espacio circundante. La solución propuesta se posiciona como una respuesta a las limitaciones de los métodos anteriores, que no lograron asegurar simultáneamente todas las propiedades necesarias para un procesamiento de calidad de datos multivista.