
Kyutai lanzó Voice of Reason — dos modelos con pesos abiertos para la conversión de voz a voz. Según MarkTechPost, están construidos sobre GLM-4-Voice-9B y están destinados a resolver tareas matemáticas habladas.
Según se indica, después de un entrenamiento con supervisión y de aprendizaje por refuerzo, la precisión en la versión oral del GSM8K aumentó de 27,3% a 77,1%. En el esquema declarado no hay una etapa de transcripción ni de modelo de lenguaje textual en el flujo de procesamiento.
Ambos puntos de control están publicados en Hugging Face y, según el mismo anuncio, se ejecutan en un solo H100. Esta información proviene de una fuente independiente y se basa en sus metadatos, no en el texto completo disponible aquí.
comentario editorial
Por qué importa
Probable consecuencia: un aumento del interés en modelos de voz que resuelven tareas directamente a partir del audio, sin intermediario textual obligatorio. La próxima señal verificable será la publicación inicial de Kyutai con la metodología y resultados independientes. La incertidumbre sustancial está relacionada con el hecho de que actualmente solo está disponible el resumen de una fuente.