
A Apple Machine Learning Research apresentou o estudo «Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning». Nele é analisado como modelos linguísticos multimodais discutem sobre ambientes espaciais, temporais e acionáveis.
No cerne do trabalho está a questão de se os modelos podem aprender raciocínio visual durante o treinamento e, na fase de inferência, raciocinar diretamente. Essa abordagem se opõe ao Visual CoT, no qual o modelo cria imagens intermediárias para antecipação visual.
Os autores associam o uso de imagens intermediárias a custos de inferência substancialmente adicionais, especialmente para análise pró-ativa de vídeo. A fonte não fornece resultados de experimentos, arquitetura específica ou medições de desempenho.
comentário editorial
Por que importa
O significado provável do trabalho é uma tentativa de reduzir o custo do raciocínio visual mantendo a capacidade de considerar espaço e tempo. O próximo conjunto de sinais verificáveis serão os experimentos publicados no texto completo e a comparação com Visual CoT. Uma incerteza substancial permanece: no resumo disponível não há dados sobre qualidade, atraso e aplicação.