
DeepSeek lanzó la modelo multimodal experimental V4-Flash-Vision-Exp. Según The Decoder, añade comprensión de imágenes a las capacidades textuales de V4-Flash.
En pruebas multimodales propias para tareas de agentes, la modelo se acercó a Opus 4.8 y, en algunos casos, lo superó. Estos resultados se presentan a través de los metadatos de la publicación de The Decoder, por lo que no deben considerarse una confirmación independiente ni una evaluación completa de la calidad.
comentario editorial
Por qué importa
La consecuencia probable es el fortalecimiento de la competencia entre modelos multimodales, especialmente en tareas que requieren trabajar simultáneamente con texto e imágenes. La siguiente señal observable serán pruebas independientes, detalles de la metodología y condiciones de acceso. Una incertidumbre sustancial está relacionada con el hecho de que actualmente solo hay un resumen de una fuente y resultados de pruebas internas de DeepSeek.