
DeepSeek AI a lancé DeepSeek-V4.1-Flash, un modèle multimodal de type Mixture-of-Experts doté de 552 milliards de paramètres pour l'architecture principale, de 196 milliards de paramètres supplémentaires Engram et d'un contexte allant jusqu'à 1 millions de jetons.
Selon MarkTechPost, cette version est également associée à une compression FP4 du cache KV et à une réutilisation de l'attention entre les couches. La publication décrit ce développement comme une réponse à la charge générée par le retraitement de longues données d'entrée et le stockage des caches KV.
La portée pratique dépend de la confirmation des caractéristiques annoncées lors de tests indépendants. Le dossier disponible ne contient ni résultats de tels tests, ni informations sur la disponibilité du modèle, ni comparaisons avec des solutions alternatives.
commentaire éditorial
Pourquoi c’est important
Une conséquence probable est un intérêt accru pour les approches réduisant la charge lors du travail avec de longs contextes. Le prochain signal observable sera constitué de mesures indépendantes de la qualité, de la vitesse et de la consommation de mémoire. Une incertitude substantielle subsiste en raison de l'absence, dans le package, d'une déclaration primaire et de résultats de tests.