DeepSeek AI lanzó DeepSeek-V4.1-Flash, un modelo multimodal de tipo Mixture-of-Experts con 552 mil millones de parámetros en su arquitectura principal, 196 mil millones de parámetros adicionales Engram y un contexto de hasta 1 millones de tokens.

Según MarkTechPost, el lanzamiento también está asociado con la compresión FP4 del caché KV y la reutilización de la atención entre capas. La publicación describe el desarrollo como una respuesta a la carga generada por el reprocesamiento de datos de entrada largos y el almacenamiento de cachés KV.

La importancia práctica depende de si las características declaradas se confirman en pruebas independientes. El paquete disponible no contiene resultados de dichas pruebas, información sobre la disponibilidad del modelo ni comparaciones con alternativas.