Selon les données d'un rapport indépendant du média The Decoder, le modèle de synthèse vocale Qwen Audio 3.0 TTS Plus, développé par Alibaba, a pris la première place du leaderboards Speech Arena de l'organisation Artificial Analysis. Le système prend en charge 16 langues et permet aux utilisateurs de contrôler le style de prononciation via des commandes en langage naturel ou des balises spéciales, telles que [angry].

Malgré une qualité de sortie élevée, la vitesse du modèle n'est que de 16 caractères par seconde. Cela est nettement plus lent que les performances des principaux concurrents sur le marché — les systèmes Sonic 3.5 et Simba 3.2 — qui affichent une productivité supérieure lors de la génération audio.

Les informations concernant la position de leader du modèle reposent exclusivement sur la méta-description de la publication dans The Decoder, sans accès au texte intégral du rapport ou aux données de test primaires. L'information confirme le fait que le modèle occupe la première place du classement, mais ne révèle pas les détails de la méthodologie d'évaluation ni les indicateurs numériques spécifiques de la qualité vocale.