
DeepSeek hat das experimentelle multimodale Modell V4-Flash-Vision-Exp veröffentlicht. Laut The Decoder ergänzt es das Textverständnis der V4-Flash-Modelle um die Verarbeitung von Bildern.
Bei eigenen multimodalen Tests für Aufgaben von Agenten kam V4-Flash-Vision-Exp Opus 4.8 nahe und übertraf ihn in einigen Fällen. Diese Ergebnisse werden über die Metadaten der Veröffentlichung The Decoder kommuniziert und sollten nicht als unabhängige Bestätigung oder vollständige Qualitätsbewertung angesehen werden.
redaktioneller Kommentar
Warum es wichtig ist
Vermutliche Folge – eine Zunahme des Wettbewerbs zwischen multimodalen Modellen, insbesondere in Aufgaben, die sowohl Text als auch Bilder erfordern. Als nächstes beobachtete Signal werden unabhängige Tests, Details zur Methodik und Zugangsbedingungen sein. Wesentliche Unsicherheit besteht darin, dass derzeit nur die Synopsis einer Quelle und die Ergebnisse interner Tests von DeepSeek verfügbar sind.