A Apple Machine Learning Research publicou um material sobre o STARFlow2, uma abordagem para geração multimodal unificada que conecta modelos de linguagem a fluxos normalizadores.

A descrição indica que os sistemas existentes para sequências alternadas de texto e imagens enfrentam diferentes limitações: a tokenização discreta pode reduzir a precisão visual, a combinação de geração de texto autorregressiva com eliminação iterativa de ruído por difusão cria assimetria estrutural, e a adaptação de modelos visão-linguagem para geração pode prejudicar sua compreensão original.

O significado prático do STARFlow2 e seus resultados comparativos não são claros a partir do material disponível: a fonte contém apenas um sinopse, sem detalhes sobre experimentos ou avaliação de qualidade.