Gradium AI lançou o novo modelo de síntese de fala padrão. De acordo com o MarkTechPost, ele obteve um índice de aprovação de 81,0% na avaliação de 500 frases complexas em cinco idiomas e mostrou um tempo mediano para o primeiro áudio de 216 milissegundos no Coval.

A avaliação foi realizada por pessoas, e o conjunto de frases foi publicado no Hugging Face sob a licença CC BY 4.0. Esses dados indicam uma tentativa de medir simultaneamente a qualidade da fala em exemplos difíceis e a velocidade de início de reprodução.

Interesse prático — na possível aplicação do modelo onde é importante o usuário ouvir rapidamente o resultado, e não esperar pela geração completa. Mas no pacote fornecido não há metodologia de teste, divisão por idiomas, informações sobre o tamanho do modelo ou confirmação independente dos indicadores.