La empresa Google DeepMind ha anunciado el lanzamiento de su último modelo de audio, denominado Gemini 3.1 Flash TTS. Según el comunicado de los desarrolladores, este sistema representa la siguiente generación de tecnologías de síntesis de voz, orientada a una mayor expresividad.

La característica clave del modelo es la implementación de etiquetas de audio granulares. Este mecanismo ofrece a los usuarios la posibilidad de un control preciso sobre el proceso de generación, permitiendo establecer directamente las características emocionales y entonacionales deseadas en el audio creado.

La tecnología presentada se posiciona como una herramienta para crear una voz artificial más viva y manejable. La incorporación de dichas etiquetas tiene como objetivo eliminar las limitaciones de sistemas anteriores, donde el ajuste fino de la voz resultaba difícil.