Недавние диффузионные модели позволяют генерировать высококачественное видео, но сталкиваются с проблемой медленной работы. Основной причиной является использование крупных трансформерных моделей, которые замедляются из-за вычислений, связанных с пространственно-временным вниманием.

Исследование показало, что значительная часть соединений между токенами в этих моделях даёт незначительные результаты, и эти паттерны часто повторяются. Это позволяет пропускать некоторые вычисления внимания без существенного влияния на итоговый результат.

Это наблюдение также применимо к соединениям между локальными блоками токенов, что открывает возможность для дальнейшей оптимизации и ускорения генерации видео.