Especialistas de la división Apple Machine Learning Research publicaron un trabajo en el que constatan la capacidad limitada de los modelos lingüístico-visuales (VLM) actuales para razonar exclusivamente basándose en información visual. A pesar de su habilidad para seguir instrucciones textuales complejas, los sistemas actuales no pueden identificar correctamente conceptos generales a partir de conjuntos de ejemplos de imágenes y aplicarlos a nuevos datos de entrada.

En respuesta a este problema, los investigadores presentaron una nueva tarea de evaluación llamada Visual Concept Inference from Sets (VICIS). La esencia de la metodología consiste en proporcionar al modelo un pequeño conjunto contextual de imágenes unidas por una idea común y una solicitud objetivo. Se requiere que el sistema genere nuevas imágenes que conserven el concepto definido por el conjunto contextual, manteniéndose al mismo tiempo coherentes con la solicitud.

Esta iniciativa tiene como objetivo llenar un vacío en la evaluación de la inteligencia artificial, desplazando el enfoque desde la comprensión textual hacia el razonamiento lógico puramente visual. La implementación de la tarea VICIS permitirá medir con mayor precisión el progreso de los modelos en el área de la generalización visual abstracta sin depender de indicaciones textuales.