Apple Machine Learning Research publicó un estudio sobre el alineamiento de grandes modelos de lenguaje multimodales, o MLLM. En la descripción proporcionada se dice que la influencia del alineamiento preferencial en tales sistemas ha sido estudiada con menos rigor que en las LLM tradicionales.

Según la descripción del estudio, los modelos multimodales que trabajan con imágenes enfrentan alucinaciones. El error puede expresarse no solo en un hecho incorrecto, sino en una respuesta que no se corresponde con el contenido de la imagen.

Los autores analizan que uno de los objetivos clave del alineamiento es aproximar las respuestas del modelo a la información contenida en la imagen. Dado que la fuente se presenta como un resumen de metadatos, los detalles metodológicos, experimentales y los resultados no están disponibles en el material proporcionado.