Nunchux AI выпустила VC-Attention — низкобитное ядро внимания без дополнительного обучения для видео Diffusion Transformers (DiTs). По данным MarkTechPost, разработка нацелена одновременно на ошибку квантования значений и медленную стадию softmax.

В видео-DiT видеоклип преобразуется в одну последовательность пространственно-временных токенов, после чего полное самовнимание выполняется на каждом слое. Такой механизм назван источником вычислительного узкого места для видео-моделей.

Практическое преимущество VC-Attention пока нельзя оценить по предоставленным материалам: в них нет численных показателей ускорения, данных о качестве видео, списка поддерживаемых моделей или независимой проверки.