A equipe Seed da ByteDance apresentou o SeedRealtime — um modelo de linguagem multimodal com processamento nativo de áudio e vídeo em modo full-duplex. Segundo dados do MarkTechPost, o modelo combina áudio, vídeo e texto em uma única arquitetura.

Em vez de trocar solicitações e respostas individuais, o SeedRealtime interage com fluxos multimodais contínuos em tempo real. Isso significa que o modelo foi projetado para percepção simultânea e geração de respostas audiovisuais.

A relevância prática do desenvolvimento permanece limitada à abordagem arquitetônica declarada: o material disponível não contém dados sobre testes, latência, acesso público, integrações ou superioridade em relação a outros modelos.