Google presenta dos modelos de síntesis de voz: Gemini 3.8 Flash TTS y Flash-Lite TTS. Según datos de The Decoder, admiten más de 100 idiomas.

Flash TTS permite crear una voz a partir de una descripción textual. Ambos modelos admiten indicaciones escénicas para líneas individuales y la generación de diálogos entre dos voces a partir de un único guion. Una función separada de clonación de voz crea un perfil de voz a partir de una muestra de 30 segundos.

El significado práctico de esta novedad es trasladar parte de la configuración de la locución desde parámetros técnicos a descripciones ordinarias y guiones. Sin embargo, dado que la fuente se limita a una publicación independiente y metadatos, la calidad, las condiciones de acceso y las medidas de protección contra usos indebidos permanecen poco claras.