Les récents modèles de diffusion permettent de générer des vidéos de haute qualité, mais se heurtent au problème d'une exécution lente. La cause principale réside dans l'utilisation de grands modèles de transformeurs, qui sont ralentis par les calculs liés à l'attention spatio-temporelle.

L'étude a montré qu'une part importante des connexions entre les jetons dans ces modèles produit des résultats négligeables, et que ces motifs se répètent souvent. Cela permet de sauter certains calculs d'attention sans affecter sensiblement le résultat final.

Cette observation s'applique également aux connexions entre les blocs locaux de jetons, ce qui ouvre la voie à une optimisation et une accélération supplémentaires de la génération de vidéo.