
Apple Machine Learning Research presentó el estudio «Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning». En él se examina cómo los modelos de lenguaje grandes multimodales razonan sobre entornos espaciales, temporales y relacionados con acciones.
En el centro del trabajo está la cuestión de si las modelos pueden aprender pensamiento visual durante el entrenamiento y razonar directamente en la fase de salida. Este enfoque se contrapone a Visual CoT, donde la modelo genera imágenes intermedias para la previsión visual.
Los autores vinculan el uso de imágenes intermedias con costos de inferencia sustancialmente mayores, especialmente para el análisis proactivo de video. La fuente no reporta resultados de experimentos, arquitectura específica ni mediciones de rendimiento.
comentario editorial
Por qué importa
Valor probable del trabajo: un intento de reducir el costo del razonamiento visual manteniendo la capacidad de considerar espacio y tiempo. Las señales comprobables siguientes serán los experimentos publicados en su totalidad y la comparación con Visual CoT. Siguen existiendo incertidumbres sustanciales: en el resumen disponible no hay datos sobre calidad, latencia o ámbito de aplicación.