A empresa Google DeepMind anunciou o lançamento de seu mais novo modelo de áudio, denominado Gemini 3.1 Flash TTS. De acordo com os desenvolvedores, este sistema representa a próxima geração de tecnologias de síntese de fala, focada em maior expressividade.

Uma característica fundamental do modelo é a introdução de marcadores de áudio granulares. Este mecanismo oferece aos usuários a capacidade de controle preciso sobre o processo de geração, permitindo definir diretamente as características emocionais e entonacionais desejadas do áudio criado.

A tecnologia apresentada é posicionada como uma ferramenta para criar fala artificial mais viva e gerenciável. A implementação de tais marcadores visa eliminar as limitações dos sistemas anteriores, onde o ajuste fino da voz era dificultado.