
Apple Machine Learning Research опубликовала исследование о выравнивании мультимодальных больших языковых моделей, или MLLM. В предоставленном описании говорится, что влияние предпочтительного выравнивания на такие системы изучено слабее, чем на обычные языковые модели.
По данным описания исследования, мультимодальные модели, работающие с изображениями, сталкиваются с галлюцинациями. Ошибка может выражаться не только в неверном факте, но и в ответе, который не соответствует содержанию изображения.
Авторы рассматривают одной из основных целей выравнивания приближение ответов модели к информации, содержащейся на изображении. Источник представлен как синопсис метаданных, поэтому подробности методов, экспериментов и результатов в предоставленных материалах отсутствуют.
комментарий редакции
Что это значит
Вероятное практическое значение работы связано с оценкой не только фактической точности, но и визуального соответствия ответов. Следующим наблюдаемым сигналом станут опубликованные детали экспериментов и метрики. Существенная неопределённость сохраняется из-за отсутствия полного текста исследования в предоставленных материалах.