A DeepSeek AI lançou a DeepSeek-V4.1-Flash — um modelo multimodal Mixture-of-Experts com 552 bilhões de parâmetros na arquitetura principal, 196 bilhões de parâmetros adicionais Engram e contexto de até 1 milhões de tokens.

Segundo dados do MarkTechPost, o lançamento também está associado à compressão FP4 do cache KV e ao reuso de atenção entre camadas. A publicação descreve o desenvolvimento como uma resposta à sobrecarga gerada pelo reprocesseamento de longas entradas de dados e pelo armazenamento de caches KV.

O significado prático depende de se as características declaradas serão confirmadas em testes independentes. O pacote disponível não contém resultados de tais testes, informações sobre a disponibilidade do modelo ou comparações com alternativas.