Según la información publicada en el blog de Hugging Face, los benchmarks existentes indican que la inteligencia artificial de voz se está acercando al nivel de rendimiento humano. Sin embargo, las conversaciones reales muestran una imagen diferente. Esto podría significar que las evaluaciones actuales no reflejan completamente las realidades del uso de modelos de voz en la vida cotidiana.

La nueva métrica Real World VoiceEQ, presentada por Hugging Face, tiene como objetivo evaluar con mayor precisión la calidad de la inteligencia artificial de voz desde la perspectiva de la percepción humana. Esto podría ayudar a identificar deficiencias que no se tienen en cuenta en los benchmarks estándar y mejorar la aplicación de los modelos de voz en condiciones reales.