Modelos de difusão recentes permitem gerar vídeo de alta qualidade, mas enfrentam o problema de funcionamento lento. A causa principal é o uso de grandes modelos transformadores, que se tornam lentos devido aos cálculos associados à atenção espaço-temporal.

A pesquisa mostrou que uma parte significativa das conexões entre tokens nesses modelos produz resultados insignificantes, e esses padrões frequentemente se repetem. Isso permite pular alguns cálculos de atenção sem influenciar substancialmente o resultado final.

Essa observação também se aplica às conexões entre blocos locais de tokens, o que abre a possibilidade para maior otimização e aceleração da geração de vídeo.