
Google présente deux modèles de synthèse vocale — Gemini 3.8 Flash TTS et Flash-Lite TTS. Selon The Decoder, ils prennent en charge plus de 100 langues.
Flash TTS permet de créer une voix à partir d'une description textuelle. Les deux modèles prennent en charge les indications scéniques pour des répliques individuelles et la génération de dialogues entre deux voix à partir d'un seul scénario. Une fonction distincte de clonage vocal forme un profil vocal à partir d'un échantillon de 30 secondes.
La pertinence pratique de cette innovation réside dans le transfert d'une partie de la configuration de la synthèse vocale des paramètres techniques vers une description ordinaire et un scénario. Toutefois, comme la source se limite à une publication indépendante et à des métadonnées, la qualité, les conditions d'accès et les mesures de protection contre les abus restent incertaines.
commentaire éditorial
Pourquoi c’est important
Une conséquence probable est une publication plus simple de doublages multilingues et de matériaux dialogués. Le prochain signal à vérifier sera la publication par Google des conditions d'accès, de la documentation et des règles de clonage vocal. Une incertitude substantielle subsiste concernant la qualité des fonctions et la protection contre les abus.