
Kyutai выпустила Voice of Reason — две модели с открытыми весами для преобразования речи в речь. По данным MarkTechPost, они построены на GLM-4-Voice-9B и предназначены для решения устных математических задач.
説明によると、教師ありファインチューニングと強化学習の後、音声版 GSM8K における精度は 27,3% から 77,1% へと向上したとされる。発表されたスキームには、処理ループ内に文字起こし段階やテキスト言語モデルは存在しない。
両方のチェックポイントは Hugging Face で公開されており、同じ報告によれば、単一の H100 で実行可能である。これらの情報は一つの独立した情報源によって提示されたものであり、ここで利用可能な完全な出版テキストではなく、そのメタデータに基づいている。
編集部コメント
なぜ重要か
考えられる帰結として、テキストを媒介者とせず直接音声によってタスクを解決する音声モデルへの関心が高まることが挙げられる。次の検証可能な信号は、手法と独立した結果を伴う Kyutai による一次公表となるであろう。現時点では一つの情報源の概要のみが利用可能であるという点に、 существенная неопределённость(実質的な不確実性)が存在する。