Apple Machine Learning Research präsentierte die Studie „Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning“. Darin wird untersucht, wie multimodale Large-Language-Modelle über räumliche, zeitliche und handlungsbezogene Umgebungen reasoning.

Im Mittelpunkt der Arbeit steht die Frage, ob Modelle visuelles Denken während des Trainings erlernen können und auf der Ausgabestufe direkt schlussfolgern können. Dieser Ansatz steht im Gegensatz zu Visual CoT, bei dem das Modell Zwischenbilder zur visuellen Vorhersage erstellt.

Autoren verknüpfen die Nutzung von Zwischenbildern mit erheblichen zusätzlichen Kosten der Ausführung, insbesondere bei proaktiven Video-Analysen. Die Quelle berichtet nicht über Ergebnisse von Experimenten, konkrete Architektur oder Messgrößen der Leistungsfähigkeit.