Nunchux AI は、ビデオ Diffusion Transformers(DiTs)向けに、追加のトレーニングを必要としない低ビット注意カーネル「VC-Attention」を発表した。MarkTechPost の報道によると、この技術は値の量子化誤差と softmax 処理の遅延という両方の課題に対処することを目的としている。

ビデオ DiT では、ビデオクリップが時空間トークンの単一シーケンスに変換され、各レイヤーでフルセルフアテンションが実行される。このメカニズムは、ビデオモデルにおける計算上のボトルネックであると情報源は指摘している。

提供された資料には、加速の数値指標、ビデオ品質のデータ、対応モデルのリスト、あるいは独立した検証が含まれていないため、VC-Attention の実用的な利点は現時点で評価できない。