Les spécialistes de la division Apple Machine Learning Research ont publié un travail constatant la capacité limitée des modèles langage-vision (VLM) actuels à raisonner exclusivement sur la base d'informations visuelles. Malgré leur aptitude à suivre des instructions textuelles complexes, les systèmes actuels ne parviennent pas à identifier correctement les concepts communs à partir d'ensembles d'exemples d'images et à les appliquer à de nouvelles données d'entrée.

En réponse à ce problème, les chercheurs ont présenté une nouvelle tâche d'évaluation intitulée Visual Concept Inference from Sets (VICIS). Le principe de la méthode consiste à fournir au modèle un petit ensemble contextuel d'images partageant une idée commune, ainsi qu'une requête cible. Le système doit générer de nouvelles images qui préservent le concept défini par l'ensemble contextuel tout en restant cohérentes avec la requête.

Cette initiative vise à combler une lacune dans l'évaluation de l'intelligence artificielle, en déplaçant l'accent de la compréhension textuelle vers le raisonnement logique purement visuel. La mise en œuvre de la tâche VICIS permettra de mesurer plus précisément les progrès des modèles dans le domaine de la généralisation visuelle abstraite, sans s'appuyer sur des indices textuels.