Spezialisten der Abteilung Apple Machine Learning Research haben eine Arbeit veröffentlicht, die sich mit Methoden zur Positionscodierung in Transformern befasst, welche Token aus einer Reihe von Bildern mit bekannten Aufnahmeparametern verarbeiten. Die Autoren stellen fest, dass bestehende Schemata für absolute oder relative Codierung nicht den Schlüsselanforderungen entsprechen: Einzigartigkeit der Patch-Codierung, Invarianz der Aufmerksamkeit gegenüber SE(3)-Transformationen mit mehrskaliger Ähnlichkeit und Anpassungsfähigkeit an die Geometrie der Szene.

Um die identifizierten Probleme zu lösen, haben die Forscher einen neuen Ansatz namens RayRoPE (Projective Ray Positional Encoding) vorgestellt. Dieser Mechanismus wurde speziell entwickelt, um die Lücke in Technologien für Multi-View-Aufmerksamkeit zu schließen, indem er Modellen ermöglicht, räumliche Beziehungen zwischen verschiedenen Blickwinkeln derselben Szene effektiver zu berücksichtigen.

Die Entwicklung zielt darauf ab, ein System zu schaffen, das Bildfragmente eindeutig codieren und flexibel auf Veränderungen in der Geometrie des umgebenden Raums reagieren kann. Die vorgeschlagene Lösung positioniert sich als Antwort auf die Einschränkungen früherer Methoden, die nicht in der Lage waren, gleichzeitig alle notwendigen Eigenschaften für eine hochwertige Verarbeitung von Multi-View-Daten zu gewährleisten.