
Google presenta dos modelos de síntesis de voz: Gemini 3.8 Flash TTS y Flash-Lite TTS. Según datos de The Decoder, admiten más de 100 idiomas.
Flash TTS permite crear una voz a partir de una descripción textual. Ambos modelos admiten indicaciones escénicas para líneas individuales y la generación de diálogos entre dos voces a partir de un único guion. Una función separada de clonación de voz crea un perfil de voz a partir de una muestra de 30 segundos.
El significado práctico de esta novedad es trasladar parte de la configuración de la locución desde parámetros técnicos a descripciones ordinarias y guiones. Sin embargo, dado que la fuente se limita a una publicación independiente y metadatos, la calidad, las condiciones de acceso y las medidas de protección contra usos indebidos permanecen poco claras.
comentario editorial
Por qué importa
Una consecuencia probable es un lanzamiento más sencillo de materiales de locución multilingüe y dialogados. La siguiente señal verificable será la publicación por parte de Google de las condiciones de acceso, la documentación y las normas sobre clonación de voz. Existe una incertidumbre significativa respecto a la calidad de las funciones y la protección contra usos indebidos.