Команда Seed компании ByteDance представила SeedRealtime — мультимодальную языковую модель с нативной обработкой аудио и видео в полно-дуплексном режиме. По данным MarkTechPost, модель объединяет аудио, видео и текст в единой архитектуре.

Вместо обмена отдельными запросами и ответами SeedRealtime взаимодействует с непрерывными мультимодальными потоками в реальном времени. Это означает, что модель рассчитана на одновременное восприятие и формирование аудиовизуального ответа.

Практическая значимость разработки пока ограничена заявленным архитектурным подходом: в доступном материале нет данных о тестах, задержке, публичном доступе, интеграциях или превосходстве над другими моделями.