El equipo Seed de ByteDance presentó SeedRealtime, un modelo de lenguaje multimodal con procesamiento nativo de audio y video en modo full-duplex. Según MarkTechPost, el modelo integra audio, video y texto en una única arquitectura.

En lugar de intercambiar solicitudes y respuestas individuales, SeedRealtime interactúa con flujos multimodales continuos en tiempo real. Esto significa que el modelo está diseñado para la percepción simultánea y la generación de respuestas audiovisuales.

La relevancia práctica del desarrollo está actualmente limitada al enfoque arquitectónico declarado: el material disponible no incluye datos sobre pruebas, latencia, acceso público, integraciones o superioridad frente a otros modelos.