Nunchux AI hat VC-Attention eingeführt — ein trainingsfreies Low-Bit Attention Kernel für Video Diffusion Transformers (DiTs). Laut MarkTechPost zielt die Entwicklung darauf ab, sowohl die Quantisierungsfehler als auch den Softmax-Inferenzteil zu beschleunigen, ohne zusätzliches Training.

In Video-DiT wird das Video in eine Sequenz räumlich-zeitlicher Token transformiert, woraufhin die vollständige Selbstaufmerksamkeit in jeder Schicht ausgeführt wird. Dieser Mechanismus wird als Engpass bei der Berechnung für Video-Modelle beschrieben.

Der praktische Vorteil von VC-Attention lässt sich aus den vorliegenden Materialien derzeit nicht beurteilen: Es fehlen numerische Beschleunigungskennzahlen, Daten zur Videoqualität, eine Liste unterstützter Modelle oder eine unabhängige Prüfung.