Los recientes modelos de difusión permiten generar video de alta calidad, pero se enfrentan al problema de una ejecución lenta. La causa principal es el uso de grandes modelos transformadores, que se ralentizan debido a los cálculos asociados con la atención espacio-temporal.

La investigación mostró que una parte significativa de las conexiones entre tokens en estos modelos produce resultados insignificantes, y estos patrones se repiten con frecuencia. Esto permite omitir algunos cálculos de atención sin afectar sustancialmente el resultado final.

Esta observación también se aplica a las conexiones entre bloques locales de tokens, lo que abre la posibilidad de una mayor optimización y aceleración en la generación de video.