
A DeepSeek AI lançou a DeepSeek-V4.1-Flash — um modelo multimodal Mixture-of-Experts com 552 bilhões de parâmetros na arquitetura principal, 196 bilhões de parâmetros adicionais Engram e contexto de até 1 milhões de tokens.
Segundo dados do MarkTechPost, o lançamento também está associado à compressão FP4 do cache KV e ao reuso de atenção entre camadas. A publicação descreve o desenvolvimento como uma resposta à sobrecarga gerada pelo reprocesseamento de longas entradas de dados e pelo armazenamento de caches KV.
O significado prático depende de se as características declaradas serão confirmadas em testes independentes. O pacote disponível não contém resultados de tais testes, informações sobre a disponibilidade do modelo ou comparações com alternativas.
comentário editorial
Por que importa
A provável consequência é o interesse em abordagens que reduzem a carga ao trabalhar com contextos longos. O próximo sinal observável serão medições independentes de qualidade, velocidade e consumo de memória. Incerteza substancial permanece devido à ausência de declaração primária e resultados de testes no pacote.