
Google представляет две модели синтеза речи — Gemini 3.8 Flash TTS и Flash-Lite TTS. По данным The Decoder, они поддерживают более 100 языков.
Flash TTS позволяет создавать голос по текстовому описанию. Обе модели поддерживают сценические указания для отдельных реплик и генерацию диалога двух голосов из одного сценария. Отдельная функция клонирования формирует голосовой профиль по 30-секундному образцу.
Практический смысл нововведения — перенос части настройки озвучки из технических параметров в обычное описание и сценарий. При этом источник представлен одной независимой публикацией и метаданными, поэтому качество, условия доступа и меры защиты от злоупотреблений остаются неясными.
комментарий редакции
Что это значит
Вероятное последствие — более простой выпуск многоязычной озвучки и диалоговых материалов. Следующим проверяемым сигналом станет публикация Google с условиями доступа, документацией и правилами клонирования голоса. Существенная неопределённость связана с качеством функций и защитой от злоупотреблений.