
DeepSeek lançou o modelo multimodal experimental V4-Flash-Vision-Exp. Segundo a The Decoder, ele adiciona compreensão de imagens às capacidades de texto do V4-Flash.
Em testes multimodais próprios para tarefas de agentes, o V4-Flash-Vision-Exp aproximou-se do Opus 4.8 e, em alguns casos, o superou. Esses resultados são apresentados por meio de metadados da publicação The Decoder, portanto não devem ser considerados confirmação independente ou avaliação completa da qualidade.
comentário editorial
Por que importa
Provável consequência — aumento da competição entre modelos multimodais, especialmente em tarefas que exigem trabalhar simultaneamente com texto e imagens. O próximo sinal observado serão testes independentes, detalhes metodológicos e condições de acesso. Uma incerteza substancial está relacionada ao fato de que neste momento disponível apenas o resumo de uma fonte e os resultados de testes internos da DeepSeek.