DeepSeek a publié le modèle multimodal expérimental V4-Flash-Vision-Exp. Selon The Decoder, il ajoute la compréhension des images aux capacités textuelles de V4-Flash.

Lors des tests multimodaux internes pour des tâches d’agents, le modèle s’est rapproché d’Opus 4.8 et, dans certains cas, l’a même dépassé. Ces résultats sont présentés via les métadonnées de la publication The Decoder, et ne peuvent donc pas être considérés comme une vérification indépendante ou une évaluation complète de la qualité.