
Apple Machine Learning Research представила исследование «Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning». В нём рассматривается, как мультимодальные большие языковые модели рассуждают о пространственных, временных и связанных с действиями средах.
В центре работы — вопрос, могут ли модели учиться визуальному мышлению во время обучения, а на этапе вывода рассуждать напрямую. Такой подход противопоставляется Visual CoT, где модель создаёт промежуточные изображения для визуального предвидения.
Авторы связывают использование промежуточных изображений с существенными дополнительными затратами вывода, особенно при проактивном анализе видео. Источник не сообщает о результатах экспериментов, конкретной архитектуре или измерениях производительности.
комментарий редакции
Что это значит
Вероятное значение работы — попытка снизить стоимость визуального рассуждения при сохранении способности учитывать пространство и время. Следующим проверяемым сигналом станут опубликованные в полном тексте эксперименты и сравнение с Visual CoT. Существенная неопределённость сохраняется: в доступном синопсисе нет данных о качестве, задержке и области применимости.