
Apple Machine Learning Research präsentierte die Studie „Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning“. Darin wird untersucht, wie multimodale Large-Language-Modelle über räumliche, zeitliche und handlungsbezogene Umgebungen reasoning.
Im Mittelpunkt der Arbeit steht die Frage, ob Modelle visuelles Denken während des Trainings erlernen können und auf der Ausgabestufe direkt schlussfolgern können. Dieser Ansatz steht im Gegensatz zu Visual CoT, bei dem das Modell Zwischenbilder zur visuellen Vorhersage erstellt.
Autoren verknüpfen die Nutzung von Zwischenbildern mit erheblichen zusätzlichen Kosten der Ausführung, insbesondere bei proaktiven Video-Analysen. Die Quelle berichtet nicht über Ergebnisse von Experimenten, konkrete Architektur oder Messgrößen der Leistungsfähigkeit.
redaktioneller Kommentar
Warum es wichtig ist
Wahrscheinliche Bedeutung der Arbeit — Der Versuch, die Kosten des visuellen Denkens zu senken, während die Fähigkeit erhalten bleibt, Raum und Zeit zu berücksichtigen. Als nächster überprüfbarer Indikator gelten die im Volltext veröffentlichten Experimente und der Vergleich mit Visual CoT. Wesentliche Unsicherheit bleibt bestehen: Im verfügbaren Abstract fehlen Daten zu Qualität, Verzögerung und Anwendungsbereich.