
L'équipe Seed de ByteDance a présenté SeedRealtime, un modèle linguistique multimodal avec un traitement natif de l'audio et de la vidéo en mode full-duplex. Selon MarkTechPost, le modèle combine l'audio, la vidéo et le texte au sein d'une architecture unique.
Au lieu d'échanger des requêtes et des réponses distinctes, SeedRealtime interagit avec des flux multimodaux continus en temps réel. Cela signifie que le modèle est conçu pour percevoir et générer simultanément des réponses audiovisuelles.
La pertinence pratique de ce développement reste pour l'instant limitée à l'approche architecturale annoncée: le document disponible ne contient aucune donnée sur les tests, la latence, l'accès public, les intégrations ou une supériorité par rapport à d'autres modèles.
commentaire éditorial
Pourquoi c’est important
Conséquence probable : si l'approche annoncée se confirme dans la pratique, les développeurs obtiendront une base pour des interfaces vocales et visuelles plus continues. Le signal observable le plus proche est la publication de détails techniques, de tests ou de conditions d'accès. Une incertitude substantielle demeure : la description disponible repose sur un bref rapport indépendant unique sans source primaire.