Google представляет две модели синтеза речи — Gemini 3.8 Flash TTS и Flash-Lite TTS. По данным The Decoder, они поддерживают более 100 языков.

Flash TTS позволяет создавать голос по текстовому описанию. Обе модели поддерживают сценические указания для отдельных реплик и генерацию диалога двух голосов из одного сценария. Отдельная функция клонирования формирует голосовой профиль по 30-секундному образцу.

Практический смысл нововведения — перенос части настройки озвучки из технических параметров в обычное описание и сценарий. При этом источник представлен одной независимой публикацией и метаданными, поэтому качество, условия доступа и меры защиты от злоупотреблений остаются неясными.