Google présente deux modèles de synthèse vocale — Gemini 3.8 Flash TTS et Flash-Lite TTS. Selon The Decoder, ils prennent en charge plus de 100 langues.

Flash TTS permet de créer une voix à partir d'une description textuelle. Les deux modèles prennent en charge les indications scéniques pour des répliques individuelles et la génération de dialogues entre deux voix à partir d'un seul scénario. Une fonction distincte de clonage vocal forme un profil vocal à partir d'un échantillon de 30 secondes.

La pertinence pratique de cette innovation réside dans le transfert d'une partie de la configuration de la synthèse vocale des paramètres techniques vers une description ordinaire et un scénario. Toutefois, comme la source se limite à une publication indépendante et à des métadonnées, la qualité, les conditions d'accès et les mesures de protection contre les abus restent incertaines.