最近の拡散モデルは高品質な動画の生成を可能にしますが、処理速度が遅いという課題に直面しています。主な原因は、時空間アテンションに関連する計算により速度が低下する大規模なトランスフォーマーモデルの使用にあります。

研究によると、これらのモデルにおけるトークン間の結合の相当部分は結果にほとんど寄与せず、かつこれらのパターンは頻繁に繰り返されることが示されました。これにより、最終的な結果に実質的な影響を与えることなく、一部のアテンション計算を省略することが可能になります。

この観察結果はローカルなトークンブロック間の結合にも適用可能であり、動画生成のさらなる最適化と高速化の可能性を開くものです。