La société Google DeepMind a annoncé le lancement de son tout nouveau modèle audio nommé Gemini 3.1 Flash TTS. Selon les développeurs, ce système représente la prochaine génération de technologies de synthèse vocale, axée sur une expressivité accrue.

La caractéristique clé du modèle est l'introduction d'étiquettes audio granulaires. Ce mécanisme offre aux utilisateurs un contrôle précis sur le processus de génération, leur permettant de définir directement les caractéristiques émotionnelles et intonatives souhaitées pour l'audio créé.

La technologie présentée est positionnée comme un outil pour créer une parole artificielle plus vivante et plus contrôlable. L'intégration de telles étiquettes vise à éliminer les limites des systèmes précédents, où le réglage fin de la voix était difficile.