Nunchux AI a publié VC-Attention — un noyau d’attention à faible bit sans entraînement pour les Vidéo Diffusion Transformers (DiTs). Selon MarkTechPost, le développement vise à la fois à corriger l’erreur de quantification et à la phase lente du softmax.

Dans les DiT vidéo, le clip est transformé en une seule séquence de tokens spatiaux-Temporelles, puis l’auto-attention complète est exécutée à chaque couche. Ce mécanisme est décrit comme la source d’un goulot d’étranglement computationnel pour les modèles vidéo.

L’avantage pratique de VC-Attention ne peut pas être évalué à partir des documents fournis: ils ne contiennent pas d indicateurs d’accélération, de données sur la qualité des vidéos, de liste de modèles compatibles ou de vérification indépendante.