Компания DeepSeek выпустила четвертую версию своих языковых моделей, представив два новых чекпоинта архитектуры MoE на платформе Hugging Face. Модель DeepSeek-V4-Pro обладает общим количеством параметров 1,6 триллиона, из которых активны 49 миллиардов, а версия DeepSeek-V4-Flash имеет 284 миллиарда общих и 13 миллиардов активных параметров. Ключевой особенностью обеих разработок стало наличие окна контекста размером в один миллион токенов.

Согласно опубликованным данным, показатели новых моделей в стандартных тестах являются конкурентоспособными, но не достигают уровня лучших мировых аналогов (SOTA). Однако разработчики подчеркивают, что это не является недостатком, так как главная инновация заключается в архитектуре, оптимизированной для эффективной поддержки большой длины контекста.

Такой подход позиционирует DeepSeek V4 как одного из наиболее подходящих кандидатов для выполнения агентных задач, где способность обрабатывать и удерживать в памяти обширные объемы информации важнее скоростных показателей в узкоспециализированных бенчмарках.