Apple Machine Learning Research представила исследование «Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning». В нём рассматривается, как мультимодальные большие языковые модели рассуждают о пространственных, временных и связанных с действиями средах.

В центре работы — вопрос, могут ли модели учиться визуальному мышлению во время обучения, а на этапе вывода рассуждать напрямую. Такой подход противопоставляется Visual CoT, где модель создаёт промежуточные изображения для визуального предвидения.

Авторы связывают использование промежуточных изображений с существенными дополнительными затратами вывода, особенно при проактивном анализе видео. Источник не сообщает о результатах экспериментов, конкретной архитектуре или измерениях производительности.