Apple Machine Learning Research опубликовала исследование о выравнивании мультимодальных больших языковых моделей, или MLLM. В предоставленном описании говорится, что влияние предпочтительного выравнивания на такие системы изучено слабее, чем на обычные языковые модели.

По данным описания исследования, мультимодальные модели, работающие с изображениями, сталкиваются с галлюцинациями. Ошибка может выражаться не только в неверном факте, но и в ответе, который не соответствует содержанию изображения.

Авторы рассматривают одной из основных целей выравнивания приближение ответов модели к информации, содержащейся на изображении. Источник представлен как синопсис метаданных, поэтому подробности методов, экспериментов и результатов в предоставленных материалах отсутствуют.