
Qué ocurrió
Investigadores de Apple Machine Learning Research identificaron una debilidad en los modelos lingüístico-visuales al trabajar con contexto puramente visual y propusieron un nuevo benchmark.
Por qué importa
El desarrollo es crítico para el avance de sistemas autónomos de visión por computadora, los cuales necesitan comprender patrones ocultos en datos visuales sin instrucciones textuales constantes por parte del ser humano.
Especialistas de la división Apple Machine Learning Research publicaron un trabajo en el que constatan la capacidad limitada de los modelos lingüístico-visuales (VLM) actuales para razonar exclusivamente basándose en información visual. A pesar de su habilidad para seguir instrucciones textuales complejas, los sistemas actuales no pueden identificar correctamente conceptos generales a partir de conjuntos de ejemplos de imágenes y aplicarlos a nuevos datos de entrada.
En respuesta a este problema, los investigadores presentaron una nueva tarea de evaluación llamada Visual Concept Inference from Sets (VICIS). La esencia de la metodología consiste en proporcionar al modelo un pequeño conjunto contextual de imágenes unidas por una idea común y una solicitud objetivo. Se requiere que el sistema genere nuevas imágenes que conserven el concepto definido por el conjunto contextual, manteniéndose al mismo tiempo coherentes con la solicitud.
Esta iniciativa tiene como objetivo llenar un vacío en la evaluación de la inteligencia artificial, desplazando el enfoque desde la comprensión textual hacia el razonamiento lógico puramente visual. La implementación de la tarea VICIS permitirá medir con mayor precisión el progreso de los modelos en el área de la generalización visual abstracta sin depender de indicaciones textuales.
Hechos
- Los modelos lingüístico-visuales tienen un desempeño deficiente al inferir conceptos generales a partir de conjuntos de ejemplos de imágenes.
- La división Apple Machine Learning Research presentó una nueva tarea de evaluación llamada Visual Concept Inference from Sets (VICIS).
- La tarea VICIS requiere que el modelo genere imágenes que conserven el concepto de un conjunto contextual y correspondan a una solicitud.
Contexto
Los avances actuales en el campo de la inteligencia artificial se centran predominantemente en modelos multimodales que dependen en gran medida de prompts textuales para navegar por el contenido visual.
Qué falta por saber
- ¿Qué cambios arquitectónicos específicos requerirán los modelos para superar con éxito la prueba VICIS?
- ¿Con qué rapidez podrán adaptarse los grandes modelos existentes a los requisitos de inferencia puramente visual?
Análisis de IA
La publicación de este trabajo señala un cambio de paradigma en la evaluación de la IA: la industria está pasando de verificar la capacidad de seguir instrucciones a verificar la capacidad de detectar patrones de forma autónoma. Esto indica que el nivel actual de desarrollo de los VLM se considera insuficiente para tareas que requieren una comprensión visual profunda sin apoyo lingüístico.
Conclusión estratégica de IA
Se espera que la tarea VICIS se convierta en un nuevo estándar industrial para probar la inteligencia visual, lo que estimulará el desarrollo de arquitecturas menos dependientes de anclajes textuales. La siguiente señal observable será la aparición de informes sobre los resultados de las pruebas de los modelos líderes en este benchmark. La principal incertidumbre sigue siendo la velocidad a la que los investigadores podrán superar las limitaciones fundamentales de los enfoques actuales de aprendizaje basado en imágenes.