Google stellt zwei Sprachsynthesemodelle vor – Gemini 3.8 Flash TTS und Flash-Lite TTS. Laut The Decoder unterstützen sie mehr als 100 Sprachen.

Flash TTS ermöglicht die Erstellung einer Stimme basierend auf einer textuellen Beschreibung. Beide Modelle unterstützen Regieanweisungen für einzelne Sprechzeilen und die Generierung eines Dialogs zwischen zwei Stimmen aus einem einzigen Skript. Eine separate Funktion zur Stimmklonierung erstellt ein Stimmprofil anhand einer 30-Sekunden-Probe.

Die praktische Bedeutung dieser Neuerung liegt in der Verlagerung eines Teils der Sprachanpassung von technischen Parametern hin zu gewöhnlichen Beschreibungen und Skripten. Da die Quelle jedoch nur aus einer unabhängigen Veröffentlichung und Metadaten besteht, bleiben Qualität, Zugangsbedingungen und Maßnahmen zum Schutz vor Missbrauch unklar.