A Apple Machine Learning Research apresentou o estudo «Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning». Nele é analisado como modelos linguísticos multimodais discutem sobre ambientes espaciais, temporais e acionáveis.

No cerne do trabalho está a questão de se os modelos podem aprender raciocínio visual durante o treinamento e, na fase de inferência, raciocinar diretamente. Essa abordagem se opõe ao Visual CoT, no qual o modelo cria imagens intermediárias para antecipação visual.

Os autores associam o uso de imagens intermediárias a custos de inferência substancialmente adicionais, especialmente para análise pró-ativa de vídeo. A fonte não fornece resultados de experimentos, arquitetura específica ou medições de desempenho.