O Google apresenta dois modelos de síntese de fala — Gemini 3.8 Flash TTS e Flash-Lite TTS. Segundo dados do The Decoder, eles suportam mais de 100 idiomas.

O Flash TTS permite criar uma voz a partir de uma descrição textual. Ambos os modelos suportam indicações cênicas para falas individuais e a geração de diálogo entre duas vozes a partir de um único roteiro. Uma função separada de clonagem cria um perfil de voz a partir de uma amostra de 30 segundos.

O significado prático dessa inovação é transferir parte da configuração da narração de parâmetros técnicos para descrições comuns e roteiros. No entanto, como a fonte consiste em uma única publicação independente e metadados, a qualidade, as condições de acesso e as medidas de proteção contra abusos permanecem incertas.