De acordo com dados de um relatório independente do veículo The Decoder, o modelo de síntese de voz Qwen Audio 3.0 TTS Plus, desenvolvido pela empresa Alibaba, ocupou o primeiro lugar no leaderboard Speech Arena da organização Artificial Analysis. O sistema suporta operação em 16 idiomas e permite aos usuários gerenciar o estilo de pronúncia usando comandos em linguagem natural ou tags especiais, como [angry].

Apesar da alta qualidade da saída, a velocidade de operação do modelo é de apenas 16 caracteres por segundo. Isso é significativamente mais lento do que os indicadores dos principais concorrentes no mercado — os sistemas Sonic 3.5 e Simba 3.2, que demonstram maior desempenho na geração de áudio.

Os dados sobre a liderança do modelo baseiam-se exclusivamente na metadescrição da publicação no The Decoder, sem acesso ao texto completo do relatório ou aos dados primários de teste. A informação confirma o fato de ocupar o primeiro lugar no ranking, mas não revela detalhes da metodologia de avaliação ou indicadores numéricos específicos da qualidade da voz.