
Kyutai hat Voice of Reason veröffentlicht — zwei Modelle mit offenen Gewichten für die Sprach-zu-Sprach-Transformation. Nach Angaben von MarkTechPost basieren sie auf GLM-4-Voice-9B und sollen mündliche mathematische Aufgaben lösen.
In der Beschreibung wird angegeben, dass nach supervised Fine-Tuning und reinforcement learning die Genauigkeit der mündlichen GSM8K von 27,3% auf 77,1% gestiegen ist. In dem angegebenen Schema gibt es keinen Transkriptions- oder textbasierten Sprachmodul im Verarbeitungskontext.
Beide Checkpoints sind auf Hugging Face veröffentlicht und laut derselben Mitteilung laufen sie auf einem H100. Diese Informationen stammen von einer unabhängigen Quelle und basieren auf deren Metadaten, nicht auf dem hier vollständigen Text der Veröffentlichung.
redaktioneller Kommentar
Warum es wichtig ist
Eine wahrscheinliche Folge ist ein verstärktes Interesse an Sprachmodellen, die Aufgaben direkt aus Audio lösen, ohne einen textlichen Vermittler. Das nächste überprüfbare Signal wird die primäre Veröffentlichung von Kyutai mit der Methode und unabhängigen Ergebnissen sein. Große Unsicherheit besteht darin, dass derzeit nur die Sinopsis einer Quelle verfügbar ist.