
Nunchux AI lançou o VC-Attention — um kernel de atenção de baixa precisão sem treinamento para Video Diffusion Transformers (DiTs). Segundo o MarkTechPost, o desenvolvimento visa simultaneamente abordar o erro de quantização de valores e a fase lenta do softmax.
No video-DiT, o clipe é transformado em uma sequência de tokens espaço-temporais; em seguida, a atenção completa é executada em cada camada. Esse mecanismo é apontado como a fonte de gargalo computacional para modelos de vídeo.
A vantagem prática do VC-Attention ainda não pode ser avaliada com o material fornecido: não há métricas numéricas de aceleração, dados sobre a qualidade do vídeo, lista de modelos suportados ou verificação independente.
comentário editorial
Por que importa
Conseqência provável — maior interesse em componentes de baixa precisão em video-DiT, se as vantagens alegadas forem confirmadas. O próximo sinal observado serão testes publicados com comparações numéricas de velocidade e qualidade. A incerteza substancial permanece devido a única fonte e à ausência de dados experimentais.