Apple Machine Learning Research a publié une étude sur l’alignement des grands modèles linguistiques multimodaux, ou MLLM. Dans la description fournie, il est indiqué que l’effet d’un alignement préférentiel sur de tels systèmes est étudié de manière moins approfondie que pour les modèles linguistiques traditionnels.

Selon la description de l’étude, les modèles multimodaux qui travaillent avec des images rencontrent des hallucinations. L’erreur peut se manifester non seulement par un fait incorrect, mais aussi par une réponse qui ne reflète pas le contenu de l’image.

Les auteurs considèrent que l’un des objectifs principaux de l’alignement est de rapprocher les réponses du modèle des informations contenues dans l’image. La source est présentée comme un résumé des métadonnées, et les détails des méthodes, des expériences et des résultats ne sont pas fournis dans les documents disponibles.