
Perplexity Research publicó un estudio de posentrenamiento del sistema dentro de Perplexity Computer. Se utilizaron sesiones reales de usuarios, incluyendo aquellas que resultaron en errores. El método combina aprendizaje adicional a partir de ejemplos seleccionados y distilación guiada por pistas.
En un test A/B en vivo, entre dos versiones entrenadas, la proporción de fallos de llamadas a herramientas disminuyó de 2,24% a 1,77%. La fuente reporta esto como resultado de la comparación entre dos puntos de control.
El significado práctico del enfoque es usar errores reales como material para mejoras posteriores. Sin embargo, el paquete de datos publicado se basa en metadatos y en el resumen de MarkTechPost, y no en el texto completo del estudio original, por lo que los detalles del experimento y la sostenibilidad del resultado siguen sin estar claros.
comentario editorial
Por qué importa
Probable consecuencia — un mayor desarrollo del entrenamiento de sistemas de software con errores reales y la posterior verificación de estos métodos en operación. La siguiente señal observable será la publicación del estudio completo con el tamaño de la muestra, la metodología de prueba y los resultados en nuevos escenarios. Una incertidumbre sustancial está relacionada con que actualmente solo está disponible un resumen de metadatos de una sola fuente.