Perplexity Research publicó un estudio de posentrenamiento del sistema dentro de Perplexity Computer. Se utilizaron sesiones reales de usuarios, incluyendo aquellas que resultaron en errores. El método combina aprendizaje adicional a partir de ejemplos seleccionados y distilación guiada por pistas.

En un test A/B en vivo, entre dos versiones entrenadas, la proporción de fallos de llamadas a herramientas disminuyó de 2,24% a 1,77%. La fuente reporta esto como resultado de la comparación entre dos puntos de control.

El significado práctico del enfoque es usar errores reales como material para mejoras posteriores. Sin embargo, el paquete de datos publicado se basa en metadatos y en el resumen de MarkTechPost, y no en el texto completo del estudio original, por lo que los detalles del experimento y la sostenibilidad del resultado siguen sin estar claros.