
Ce qui s’est passé
Les chercheurs d'Apple Machine Learning Research ont identifié une faiblesse des modèles langage-vision dans le traitement de contextes purement visuels et ont proposé un nouveau benchmark.
Pourquoi c’est important
Ce développement est crucial pour l'évolution des systèmes autonomes de vision par ordinateur, qui doivent comprendre les motifs cachés dans les données visuelles sans instructions textuelles constantes de la part de l'homme.
Les spécialistes de la division Apple Machine Learning Research ont publié un travail constatant la capacité limitée des modèles langage-vision (VLM) actuels à raisonner exclusivement sur la base d'informations visuelles. Malgré leur aptitude à suivre des instructions textuelles complexes, les systèmes actuels ne parviennent pas à identifier correctement les concepts communs à partir d'ensembles d'exemples d'images et à les appliquer à de nouvelles données d'entrée.
En réponse à ce problème, les chercheurs ont présenté une nouvelle tâche d'évaluation intitulée Visual Concept Inference from Sets (VICIS). Le principe de la méthode consiste à fournir au modèle un petit ensemble contextuel d'images partageant une idée commune, ainsi qu'une requête cible. Le système doit générer de nouvelles images qui préservent le concept défini par l'ensemble contextuel tout en restant cohérentes avec la requête.
Cette initiative vise à combler une lacune dans l'évaluation de l'intelligence artificielle, en déplaçant l'accent de la compréhension textuelle vers le raisonnement logique purement visuel. La mise en œuvre de la tâche VICIS permettra de mesurer plus précisément les progrès des modèles dans le domaine de la généralisation visuelle abstraite, sans s'appuyer sur des indices textuels.
Faits
- Les modèles langage-vision éprouvent des difficultés à déduire des concepts généraux à partir d'ensembles d'exemples d'images.
- La division Apple Machine Learning Research a présenté une nouvelle tâche d'évaluation appelée Visual Concept Inference from Sets (VICIS).
- La tâche VICIS exige que le modèle génère des images conservant le concept d'un ensemble contextuel et correspondant à une requête.
Contexte
Les avancées actuelles dans le domaine de l'intelligence artificielle se concentrent principalement sur des modèles multimodaux fortement dépendants de prompts textuels pour naviguer dans le contenu visuel.
Ce qui reste inconnu
- Quels changements architecturaux spécifiques seront nécessaires pour que les modèles réussissent le test VICIS ?
- À quelle vitesse les grands modèles existants pourront-ils s'adapter aux exigences de l'inférence purement visuelle ?
Analyse IA
La publication de ces travaux signale un changement de paradigme dans l'évaluation de l'IA : l'industrie passe de la vérification de la capacité à suivre des instructions à la vérification de la capacité à détecter autonomement des motifs. Cela indique que le niveau actuel de développement des VLM est considéré comme insuffisant pour les tâches nécessitant une compréhension visuelle profonde sans support linguistique.
Conclusion stratégique de l’IA
Il est attendu que la tâche VICIS devienne une nouvelle norme industrielle pour tester l'intelligence visuelle, stimulant ainsi le développement d'architectures moins dépendantes des ancres textuelles. Le prochain signal observable sera l'apparition de rapports sur les résultats des tests des principaux modèles sur ce benchmark. La principale incertitude demeure la vitesse à laquelle les chercheurs pourront surmonter les limitations fondamentales des approches actuelles d'apprentissage sur images.