
DeepSeek は実験的なマルチモーダルモデル V4-Flash-Vision-Exp を公開した。The Decoder のデータによれば、これは V4-Flash のテキスト機能に画像理解を追加する。
エージェントタスク向けの独自のマルチモーダルテストでは、モデルは Opus 4.8 に近づき、場合によってはそれを上回った。これらの結果は The Decoder のメタデータ公開を通じて提示されており、独立した検証や品質の正式な評価とはみなせない。
編集部コメント
なぜ重要か
おそらくの結論は、テキストと画像を同時に扱うタスクで特に、マルチモーダルモデル間の競争が激化すること。次に観測されるサインは、独立したテスト、方法論の詳細、アクセス条件。重大な不確実性は、現時点での情報は The Decoder のサマリーと内部テストのみであることから生じる。