Especialistas da divisão Apple Machine Learning Research publicaram um trabalho no qual constatam a capacidade limitada dos modernos modelos de linguagem-visão (VLM) de raciocinar exclusivamente com base em informações visuais. Apesar de serem capazes de seguir instruções textuais complexas, os sistemas atuais não conseguem identificar corretamente conceitos gerais a partir de conjuntos de exemplos de imagens e aplicá-los a novos dados de entrada.

Em resposta a esse problema, os pesquisadores apresentaram uma nova tarefa de avaliação chamada Visual Concept Inference from Sets (VICIS). A essência da metodologia consiste em fornecer ao modelo um pequeno conjunto contextual de imagens, unidas por uma ideia comum, e uma solicitação alvo. O sistema deve gerar novas imagens que preservem o conceito definido pelo conjunto contextual, permanecendo ao mesmo tempo consistentes com a solicitação.

Esta iniciativa visa preencher uma lacuna na avaliação da inteligência artificial, deslocando o foco da compreensão textual para o raciocínio lógico puramente visual. A implementação da tarefa VICIS permitirá medir com maior precisão o progresso dos modelos na área de generalização visual abstrata, sem depender de dicas textuais.