Специалисты подразделения Apple Machine Learning Research опубликовали работу, в которой констатируют ограниченную способность современных языково-визуальных моделей (VLM) рассуждать исключительно на основе визуальной информации. Несмотря на умение следовать сложным текстовым инструкциям, текущие системы не могут корректно выявлять общие концепции из наборов примеров изображений и применять их к новым входным данным.

В ответ на эту проблему исследователи представили новую оценочную задачу под названием Visual Concept Inference from Sets (VICIS). Суть методики заключается в предоставлении модели небольшого контекстного набора изображений, объединенных общей идеей, и целевого запроса. От системы требуется генерация новых изображений, которые сохраняют концепцию, определенную контекстным набором, оставаясь при этом согласованными с запросом.

Данная инициатива направлена на заполнение пробела в оценке искусственного интеллекта, смещая фокус с текстового понимания на纯视觉ное логическое мышление. Внедрение задачи VICIS позволит точнее измерять прогресс моделей в области абстрактного визуального обобщения без опоры на текстовые подсказки.