
DeepSeek выпустила мультимодальную модель V4.1-Flash с 552 млрд параметров. По данным The Decoder, она использует в четыре раза меньше памяти KV-кэша, чем предшественница, а на каждом токене активирует 16 млрд параметров.
В пересказе The Decoder также утверждается, что V4.1-Flash немного обошла Opus 5 и GPT-5.6 Sol на тесте программирования DeepSWE. Модель распространяется по лицензии MIT и ориентирована на удешевление ИИ-агентов.
Практический смысл новости — потенциально более низкие требования к памяти при работе агентных систем с длинным контекстом. Однако пакет содержит только синопсис метаданных одного независимого издания, а не полный текст или первичное подтверждение, поэтому результаты и экономический эффект требуют дополнительной проверки.
комментарий редакции
Что это значит
Если заявленные характеристики подтвердятся, следующим наблюдаемым сигналом станет появление воспроизводимых тестов памяти, стоимости и качества агентных задач. Главная неопределённость — отсутствие в пакете первичного подтверждения и подробностей методики сравнения.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Заявленное сокращение KV-кэша вчетверо при 552 млрд параметров и активации 16 млрд на токен — потенциально значимый сигнал для агентных систем с длинным контекстом, поскольку память часто становится узким местом при многошаговых задачах. Лицензия MIT усиливает возможное влияние: она снижает барьер для внедрения и кастомизации. Однако весь пакет опирается на единственный синопсис The Decoder без первичного подтверждения DeepSeek, что делает количественные утверждения предварительными. Следующим наблюдаемым сигналом станет публикация воспроизводимых тестов памяти, стоимости инференса и качества на агентных бенчмарках от независимых сторон.
В чём оценки сходятся- Сокращение KV-кэша может снизить инфраструктурные требования к длительным агентным задачам — это обоснованная интерпретация заявленных характеристик.
- Пакет содержит только синопсис одного независимого издания, поэтому результаты и экономический эффект требуют дополнительной проверки.
- Архитектурная оптимизация с активацией 16 млрд параметров на токен при 552 млрд общего объёма указывает на потенциально важный шаг для удешевления агентов.
- Превосходство над Opus 5 и GPT-5.6 Sol на DeepSWE описано как «небольшое», но без методики сравнения это практически неинтерпретируемо — разница может быть в пределах погрешности.
- Заявление о «намного более дешёвых ИИ-агентах» не подкреплено данными о стоимости инференса; меньший KV-кэш не гарантирует пропорционального снижения общих затрат.
- Мультодальность упомянута как характеристика, но в пакете нет свидетельств её тестирования или применимости к агентным сценариям — связь с целевым назначением не доказана.
Ollama Cloud
Kimi K2.6
Снижение KV-кэша вчетверо при сохранении конкурентоспособности на кодовых бенчмарках — ключевой архитектурный сдвиг для агентных сценариев с длинным контекстом. Следующим сигналом станут воспроизводимые тесты сторонних исследователей на реальных агентных задачах и сравнение стоимости инференса. Главная неопределённость — отсутствие первичного подтверждения от DeepSeek и неясность методологии измерения экономии памяти, что делает заявленные цифры преждевременной основой для стратегических решений.
В чём оценки сходятся- Сокращение KV-кэша критично для агентов с длинным контекстом и многократными вызовами.
- Отсутствие первичных источников и независимой верификации ослабляет достоверность заявлений.
- Лицензия MIT потенциально ускорит коммерциализацию, но не гарантирует качество агентных применений.
- Узкий лидерство на DeepSWE может не транслироваться в общие агентные способности; бенчмарк специфичен.
- 16 млрд активных параметров — это всё ещё масштаб, требующий значительных вычислительных ресурсов, а не революция доступности.
- Фокус на памяти KV-кэша игнорирует другие узкие места агентов: латентность планирования, надёжность инструментов, стоимость ошибок.