
Apple Machine Learning Research a présenté l’étude « Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning ». Dans ce travail, il est question de la façon dont les modèles linguistiques multimodaux raisonnent sur des environnements spatiaux, temporels et liés à l’action.
Au centre de ce travail se pose la question de savoir si les modèles peuvent apprendre le raisonnement visuel pendant l’entraînement et raisonner directement à l’étape d’inférence. Cette approche s’oppose au Visual CoT, où le modèle crée des images intermédiaires pour la prévision visuelle.
Les auteurs associent l’utilisation d’images intermédiaires à des coûts de calcul supplémentaires substantiels, notamment pour l’analyse proactive de vidéos. La source ne fournit pas de résultats expérimentaux, d’architecture précise ou de mesures de performance.
commentaire éditorial
Pourquoi c’est important
Valeur probable du travail — tentative de réduire le coût du raisonnement visuel tout en conservant la capacité de prendre en compte l’espace et le temps. Le prochain signal vérifiable sera les expériences publiées dans le texte complet et la comparaison avec Visual CoT. Une incertitude substantielle demeure: dans le résumé disponible, il n’y a pas de données sur la qualité, le retard et le champ d’application.