Apple Machine Learning Research a présenté l’étude « Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning ». Dans ce travail, il est question de la façon dont les modèles linguistiques multimodaux raisonnent sur des environnements spatiaux, temporels et liés à l’action.

Au centre de ce travail se pose la question de savoir si les modèles peuvent apprendre le raisonnement visuel pendant l’entraînement et raisonner directement à l’étape d’inférence. Cette approche s’oppose au Visual CoT, où le modèle crée des images intermédiaires pour la prévision visuelle.

Les auteurs associent l’utilisation d’images intermédiaires à des coûts de calcul supplémentaires substantiels, notamment pour l’analyse proactive de vidéos. La source ne fournit pas de résultats expérimentaux, d’architecture précise ou de mesures de performance.