Según los datos de un informe independiente de la publicación The Decoder, el modelo de síntesis de voz Qwen Audio 3.0 TTS Plus, desarrollado por la empresa Alibaba, ocupó el primer lugar en el líder de Speech Arena de la organización Artificial Analysis. El sistema soporta trabajo con 16 idiomas y permite a los usuarios gestionar el estilo de pronunciación mediante comandos en lenguaje natural o etiquetas especiales, como [angry].

A pesar de la alta calidad de salida, la velocidad de funcionamiento del modelo es de solo 16 caracteres por segundo. Esto es significativamente más lento que las cifras de los principales competidores en el mercado: los sistemas Sonic 3.5 y Simba 3.2, que demuestran un rendimiento superior durante la generación de audio.

Los datos sobre el liderazgo del modelo se basan exclusivamente en la metadescripción de la publicación en The Decoder, sin acceso al texto completo del informe ni a los datos primarios de las pruebas. La información confirma el hecho de ocupar el primer puesto en la clasificación, pero no revela detalles sobre la metodología de evaluación ni indicadores numéricos específicos de la calidad de la voz.