Especialistas da divisão Apple Machine Learning Research publicaram um trabalho dedicado ao estudo de métodos de codificação posicional em transformadores que processam tokens de um conjunto de imagens com parâmetros de captura conhecidos. Os autores observam que os esquemas existentes de codificação absoluta ou relativa não atendem aos requisitos fundamentais: unicidade da codificação de patches, invariância de atenção a transformações SE(3) com similaridade multiescala e adaptabilidade à geometria da cena.

Para resolver os problemas identificados, os pesquisadores apresentaram uma nova abordagem chamada RayRoPE (Projective Ray Positional Encoding). Este mecanismo foi desenvolvido especificamente para preencher a lacuna nas tecnologias de atenção multivisão, permitindo que os modelos considerem de forma mais eficaz as relações espaciais entre diferentes perspectivas de uma mesma cena.

O desenvolvimento visa criar um sistema capaz de codificar exclusivamente fragmentos de imagem e responder flexivelmente a mudanças na geometria do espaço circundante. A solução proposta é posicionada como uma resposta às limitações dos métodos anteriores, que não conseguiram garantir simultaneamente todas as propriedades necessárias para o processamento de qualidade de dados multivisão.