Gradium AI a publié un nouveau modèle de synthèse vocale par défaut. Selon MarkTechPost, il a obtenu un taux de réussite de 81,0% dans l’évaluation de 500 cas difficiles sur cinq langues et a affiché un temps médian jusqu’au premier audio de 216 millisecondes sur Coval.

L’évaluation a été réalisée par des humains, et le jeu de propositions est publié sur Hugging Face sous licence CC BY 4.0. Ces données indiquent une tentative d’évaluer simultanément la qualité vocale sur des exemples difficiles et la vitesse de démarrage.

Intérêt pratique — dans les applications où l’utilisateur souhaite entendre rapidement le résultat plutôt que d’attendre une génération complète. Mais les éléments fournis ne contiennent pas de méthodologie de test, de répartition par langue, d’informations sur la taille du modèle ou de corroboration indépendante.