
DeepSeek AIは4.1-Flashを発表しました。これは552十億のパラメータを持つ主要アーキテクチャと196十億のEngramパラメータ、および最大1百万トークンのコンテキストを特徴とするMixture-of-Expertsタイプのモルチメディアモデルです。
MarkTechPostによると、リリースはKVキャッシュのFP4圧縮と層間アテンションの再利用にも関連しており、長い入力データの再処理とKVキャッシュの保管による負荷軽減への対応として説明されています。
実用的な意味は、独立したテストで公称スペックが検証されるかどうか次第です。利用可能性や他の代替ソリューションとの比較に関する情報は、現状の公開パッケージには含まれていません。
編集部コメント
なぜ重要か
おそらく長いコンテキストの負荷を低減するアプローチへの関心が高まると予測されます。今後の観測指標は、品質・速度・メモリ消費の独立した測定値となるでしょう。初期の声明と試験結果が欠如しているため、重要な不確実性が残ります。