AWS Machine Learning Blog описал развертывание общедоступной модели синтеза речи Qwen3-TTS-12Hz-1.7B-Base из Amazon SageMaker JumpStart на полностью управляемой конечной точке с обработкой в реальном времени. В том же сценарии голос клонируется по короткому эталонному аудиофрагменту.

По данным публикации, межъязыковое клонирование сохраняет идентичность говорящего при переходе между языками. Практическая значимость подхода связана с возможностью использовать один голосовой профиль в многоязычных сервисах, но источник не приводит измерений качества, задержки, стоимости или ограничений такого применения.