DeepSeek a lancé le modèle multimodal V4.1-Flash doté de 552 milliards de paramètres. Selon The Decoder, il utilise quatre fois moins de mémoire de cache KV que son prédécesseur et active 16 milliards de paramètres par token.

Le résumé de The Decoder affirme également que V4.1-Flash a légèrement dépassé Opus 5 et GPT-5.6 Sol lors du test de programmation DeepSWE. Le modèle est diffusé sous licence MIT et vise à réduire le coût des agents IA.

La portée pratique de cette nouvelle réside dans des exigences de mémoire potentiellement plus faibles pour les systèmes d'agents fonctionnant avec un contexte long. Cependant, le dossier ne contient qu'un résumé des métadonnées d'une seule publication indépendante, et non le texte intégral ou une confirmation primaire; par conséquent, les résultats et l'impact économique nécessitent une vérification supplémentaire.