Apple Machine Learning Research presentó el estudio «Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning». En él se examina cómo los modelos de lenguaje grandes multimodales razonan sobre entornos espaciales, temporales y relacionados con acciones.

En el centro del trabajo está la cuestión de si las modelos pueden aprender pensamiento visual durante el entrenamiento y razonar directamente en la fase de salida. Este enfoque se contrapone a Visual CoT, donde la modelo genera imágenes intermedias para la previsión visual.

Los autores vinculan el uso de imágenes intermedias con costos de inferencia sustancialmente mayores, especialmente para el análisis proactivo de video. La fuente no reporta resultados de experimentos, arquitectura específica ni mediciones de rendimiento.