Gradium AI hat ein neues Standards-Modell für die Sprachsynthese veröffentlicht. Laut MarkTechPost hat es eine Durchlaufquote von 81,0% in der Bewertung von 500 komplexen Sätzen in fünf Sprachen erreicht und zeigte eine mittlere Zeit bis zur ersten Audio-Ausgabe von 216 Millisekunden auf Coval.

Die Bewertung wurde von Menschen durchgeführt, und der Datensatz ist auf Hugging Face unter der Lizenz CC BY 4.0 veröffentlicht. Diese Daten deuten auf den Versuch hin, sowohl die Sprachqualität in schwierigen Beispielen als auch die Geschwindigkeit des Audio-Starts zu messen.

Der praktische Reiz besteht darin, die Modellnutzung dort zu ermöglichen, wo der Benutzer schnell das Ergebnis hören möchte, ohne auf eine vollständige Generierung warten zu müssen. Im bereitgestellten Paket fehlen jedoch die Testmethodik, die Verteilung nach Sprachen, Informationen zur Modellgröße oder eine unabhängige Bestätigung der Indikatoren.