
DeepSeek a publié le modèle multimodal expérimental V4-Flash-Vision-Exp. Selon The Decoder, il ajoute la compréhension des images aux capacités textuelles de V4-Flash.
Lors des tests multimodaux internes pour des tâches d’agents, le modèle s’est rapproché d’Opus 4.8 et, dans certains cas, l’a même dépassé. Ces résultats sont présentés via les métadonnées de la publication The Decoder, et ne peuvent donc pas être considérés comme une vérification indépendante ou une évaluation complète de la qualité.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — un renforcement de la concurrence entre les modèles multimodaux, en particulier dans les tâches nécessitant de travailler simultanément avec du texte et des images. Le signal observé suivant sera des tests indépendants, des détails sur la méthodologie et les conditions d’accès. Une incertitude majeure est liée au fait qu’un seul résumé d’une source est actuellement disponible et que les résultats des tests internes de DeepSeek.