
Kyutai a lancé Voice of Reason — deux modèles avec des poids ouverts pour la conversion de la parole en parole. Selon MarkTechPost, ils sont construits sur GLM-4-Voice-9B et destinés à résoudre les tâches mathématiques orales.
Dans la description, après un entraînement supervisé et un apprentissage par reinforcement, la précision sur la version orale du GSM8K a augmenté de 27,3% à 77,1%. Le schéma revendiqué ne comprend pas d'étape de transcription ni de modèle de langage textuel dans le pipeline.
Les deux points de contrôle sont publiés sur Hugging Face et, selon le même message, fonctionnent sur un seul H100. Ces informations proviennent d'une source indépendante et sont basées sur ses métadonnées, et non sur le texte intégral ici.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — un accroissement de l'intérêt pour les modèles vocaux qui résolvent les tâches directement à partir de l'audio, sans intermédiaire textuel obligatoire. Le prochain signal vérifiable sera la publication primaire de Kyutai avec la méthodologie et des résultats indépendants. L'incertitude substantielle réside dans le fait que seul le synopsis d'une source est actuellement disponible.