Apple Machine Learning Research опубликовала материал о STARFlow2 — подходе к унифицированной мультимодальной генерации, который связывает языковые модели с нормализующими потоками.

В описании говорится, что существующие системы для чередующихся последовательностей текста и изображений сталкиваются с разными ограничениями: дискретная токенизация может снижать визуальную точность, сочетание авторегрессионной генерации текста и итеративного диффузионного устранения шума создаёт структурную асимметрию, а адаптация зрительно-языковых моделей для генерации способна ухудшать их исходное понимание.

Практическое значение STARFlow2 и его сравнительные результаты из доступного материала неясны: источник содержит лишь синопсис, без подробностей экспериментов и оценки качества.