A Apple Machine Learning Research publicou pesquisa sobre alinhamento de grandes modelos de linguagem multimodais, ou MLLM. Na descrição fornecida, afirma-se que o impacto do alinhamento preferencial em tais sistemas foi estudado com menos intensidade do que em modelos de linguagem convencionais.

Segundo a descrição da pesquisa, modelos multimodais que trabalham com imagens enfrentam alucinações. O erro pode se manifestar não apenas por um fato incorreto, mas também por uma resposta que não corresponde ao conteúdo da imagem.

Os autores consideram que um dos objetivos principais do alinhamento é aproximar as respostas do modelo das informações contidas na imagem. A fonte é apresentada como sinopse de metadados, portanto detalhes de métodos, experimentos e resultados nos materiais fornecidos não estão disponíveis.