Laut einem unabhängigen Bericht von The Decoder hat das Sprachsynthesemodell Qwen Audio 3.0 TTS Plus von Alibaba den ersten Platz im Speech-Arena-Leaderboard von Artificial Analysis belegt. Das System unterstützt 16 Sprachen und ermöglicht es Nutzern, den Aussprachestil über Befehle in natürlicher Sprache oder spezielle Tags wie [angry] zu steuern.

Trotz der hohen Ausgabequalität liegt die Verarbeitungsgeschwindigkeit des Modells bei nur 16 Zeichen pro Sekunde. Dies ist deutlich langsamer als die Werte der Hauptkonkurrenten auf dem Markt – den Systemen Sonic 3.5 und Simba 3.2 –, die bei der Audiogenerierung eine höhere Leistung demonstrieren.

Die Angaben zur Führungsposition des Modells basieren ausschließlich auf der Metabeschreibung der Veröffentlichung in The Decoder, ohne Zugriff auf den vollständigen Berichtstext oder primäre Testdaten. Die Information bestätigt zwar den Fakt des ersten Platzes in der Rangliste, gibt jedoch keine Details zur Bewertungsmethodik oder spezifischen numerischen Qualitätsindikatoren der Stimme preis.