L'équipe Seed de ByteDance a présenté SeedRealtime, un modèle linguistique multimodal avec un traitement natif de l'audio et de la vidéo en mode full-duplex. Selon MarkTechPost, le modèle combine l'audio, la vidéo et le texte au sein d'une architecture unique.

Au lieu d'échanger des requêtes et des réponses distinctes, SeedRealtime interagit avec des flux multimodaux continus en temps réel. Cela signifie que le modèle est conçu pour percevoir et générer simultanément des réponses audiovisuelles.

La pertinence pratique de ce développement reste pour l'instant limitée à l'approche architecturale annoncée: le document disponible ne contient aucune donnée sur les tests, la latence, l'accès public, les intégrations ou une supériorité par rapport à d'autres modèles.