Nunchux AI lanzó VC-Attention, un kernel de atención de bajo bit sin entrenamiento adicional para Video Diffusion Transformers (DiTs). Según MarkTechPost, el desarrollo está dirigido simultáneamente a minimizar el error de cuantización de valores y la etapa lenta de softmax.

En video-DiT, el clip se transforma en una única secuencia de tokens espaciales-temporales, tras lo cual la autoatención completa se realiza en cada capa. Este mecanismo se cita como fuente de cuello de botella computacional para los modelos de video.

La ventaja práctica de VC-Attention no puede evaluarse aún con el material proporcionado: no hay indicadores numéricos de aceleración, datos sobre la calidad del video, lista de modelos compatibles ni verificación independiente.