Apple Machine Learning Research a publié un document sur STARFlow2, une approche de génération multimodale unifiée qui relie les modèles de langage aux flux normalisants.

La description indique que les systèmes existants pour les séquences alternant texte et images font face à diverses limitations: la tokénisation discrète peut réduire la précision visuelle, la combinaison de la génération de texte autorégressive et de l'élimination itérative du bruit par diffusion crée une asymétrie structurelle, et l'adaptation des modèles vision-langage à la génération risque de détériorer leur compréhension initiale.

L'importance pratique de STARFlow2 et ses résultats comparatifs restent flous au vu du matériel disponible: la source ne contient qu'un synopsis, sans détails sur les expériences ni évaluation de la qualité.