Das Seed-Team von ByteDance hat SeedRealtime vorgestellt – ein Multimodal-LLM mit nativer Audio- und Video-Verarbeitung im Voll-Duplex-Modus. Laut MarkTechPost vereint das Modell Audio, Video und Text in einer einzigen Architektur.

Statt aus getrennten Anfragen und Antworten zu bestehen, interagiert SeedRealtime mit kontinuierlichen multimodalen Streams in Echtzeit. Das bedeutet, dass das Modell auf gleichzeitige Wahrnehmung und Erzeugung audiovisueller Antworten ausgelegt ist.

Die praktische Bedeutsamkeit der Entwicklung ist derzeit durch den beschriebenen Architektur-Ansatz eingeschränkt: In dem verfügbaren Material liegen keine Daten zu Tests, Latenzen, Öffnung des Zugangs, Integrationen oder einer Überlegenheit gegenüber anderen Modellen vor.