
DeepSeek выпустила экспериментальную мультимодальную модель V4-Flash-Vision-Exp. По данным The Decoder, она добавляет понимание изображений к текстовым возможностям V4-Flash.
На собственных мультимодальных тестах для задач агентов модель приблизилась к Opus 4.8 и в отдельных случаях превзошла его. Эти результаты представлены через метаданные публикации The Decoder, поэтому их нельзя считать независимым подтверждением или полноценной оценкой качества.
комментарий редакции
Что это значит
Вероятное следствие — усиление конкуренции между мультимодальными моделями, особенно в задачах, где нужно работать одновременно с текстом и изображениями. Следующим наблюдаемым сигналом станут независимые тесты, подробности методики и условия доступа. Существенная неопределённость связана с тем, что сейчас доступен только синопсис одного источника и результаты внутренних тестов DeepSeek.