Согласно данным независимого отчета издания The Decoder, модель синтеза речи Qwen Audio 3.0 TTS Plus, разработанная компанией Alibaba, заняла первое место в лидерборде Speech Arena от организации Artificial Analysis. Система поддерживает работу с 16 языками и позволяет пользователям управлять стилем произношения с помощью команд на естественном языке или специальных тегов, таких как [angry].

Несмотря на высокое качество вывода, скорость работы модели составляет всего 16 символов в секунду. Это значительно медленнее показателей основных конкурентов на рынке — систем Sonic 3.5 и Simba 3.2, которые демонстрируют более высокую производительность при генерации аудио.

Данные о лидерстве модели основаны исключительно на мета-описании публикации в The Decoder, без доступа к полному тексту отчета или первичным данным тестирования. Информация подтверждает факт занятия первой строчки рейтинга, но не раскрывает подробностей методологии оценки или конкретных числовых показателей качества голоса.