Apple Machine Learning Research ha publicado un material sobre STARFlow2, un enfoque para la generación multimodal unificada que vincula modelos de lenguaje con flujos de normalización.

La descripción indica que los sistemas existentes para secuencias alternas de texto e imágenes enfrentan diversas limitaciones: la tokenización discreta puede reducir la precisión visual, la combinación de generación de texto autorregresiva y eliminación iterativa de ruido por difusión crea una asimetría estructural, y la adaptación de modelos viso-lingüísticos para la generación puede deteriorar su comprensión original.

El significado práctico de STARFlow2 y sus resultados comparativos no están claros en el material disponible: la fuente contiene solo un sinopsis, sin detalles sobre experimentos ni evaluación de la calidad.