Apple Machine Learning Research の専門家らは、既知の撮影パラメータを持つ画像セットからトークンを処理するトランスフォーマーにおける位置エンコーディング手法に関する研究論文を発表した。著者らは、既存の絶対的または相対的エンコーディング方式が、パッチエンコーディングの一意性、SE(3) 変換およびマルチスケール類似性に対するアテンションの不変性、そしてシーン幾何学への適応性という主要な要件を満たしていないと指摘している。

特定された課題を解決するため、研究者らは RayRoPE(Projective Ray Positional Encoding)と呼ばれる新しいアプローチを提示した。この機構は、モデルが同一シーンの異なる視点間の空間的関係をより効果的に考慮できるよう、マルチビュー・アテンション技術のギャップを埋めるために特別に設計されている。

本開発は、画像断片を一意にエンコードし、周囲空間の幾何学的変化に柔軟に対応できるシステムの構築を目指している。提案されたソリューションは、マルチビューデータの質の高い処理に必要なすべての特性を同時に確保できなかった従来手法の限界に対する回答として位置づけられている。