Gradium AI выпустила новую модель синтеза речи по умолчанию. По данным MarkTechPost, она получила показатель прохождения 81,0% в оценке 500 сложных предложений на пяти языках и показала медианное время до первого аудио 216 миллисекунд на Coval.

Оценка проводилась людьми, а набор предложений опубликован на Hugging Face по лицензии CC BY 4.0. Эти данные указывают на попытку одновременно измерить качество речи на трудных примерах и скорость начала воспроизведения.

Практический интерес — в возможном применении модели там, где пользователю важно быстро услышать результат, а не ждать полной генерации. Но в предоставленном пакете нет методики тестирования, разбивки по языкам, сведений о размере модели или независимого подтверждения показателей.