DeepSeek AI выпустила DeepSeek-V4.1-Flash — мультимодальную модель Mixture-of-Experts с 552 млрд параметров основной архитектуры, 196 млрд дополнительных параметров Engram и контекстом до 1 млн токенов.

По данным MarkTechPost, релиз также связан с FP4-сжатием KV-кэша и повторным использованием внимания между слоями. Издание описывает разработку как ответ на нагрузку от повторной обработки длинных входных данных и хранения KV-кэшей.

Практическое значение зависит от того, подтвердятся ли заявленные характеристики в независимых тестах. В доступном пакете нет результатов таких тестов, сведений о доступности модели или сравнения с альтернативами.