DeepSeek AI a lancé DeepSeek-V4.1-Flash, un modèle multimodal de type Mixture-of-Experts doté de 552 milliards de paramètres pour l'architecture principale, de 196 milliards de paramètres supplémentaires Engram et d'un contexte allant jusqu'à 1 millions de jetons.

Selon MarkTechPost, cette version est également associée à une compression FP4 du cache KV et à une réutilisation de l'attention entre les couches. La publication décrit ce développement comme une réponse à la charge générée par le retraitement de longues données d'entrée et le stockage des caches KV.

La portée pratique dépend de la confirmation des caractéristiques annoncées lors de tests indépendants. Le dossier disponible ne contient ni résultats de tels tests, ni informations sur la disponibilité du modèle, ni comparaisons avec des solutions alternatives.