Perplexity Research hat eine Nachtrainingsstudie innerhalb von Perplexity Computer veröffentlicht. Für das Training wurden reale Benutzersitzungen verwendet, einschließlich fehlschlagender Sitzungen. Die Methode kombiniert Nachtraining mit der Auswahl erfolgreicher Beispiele und Distillation, die durch Hinweise geleitet wird.

In einem Live-A/B-Test sank der Anteil der Fehler bei Tool-Aufrufen zwischen zwei trainierten Versionen von 2,24% auf 1,77%. Der Quelle zufolge ist dies das Ergebnis eines Vergleichs zweier Kontrollpunkte.

Der praktische Sinn des Ansatzes besteht darin, reale Fehler als Material für die anschließende Verbesserung zu nutzen. Gleichzeitig basiert das veröffentlichte Datensatzpaket auf Metadaten und einer Nacherzählung von MarkTechPost, nicht auf dem vollständigen Text der ursprünglichen Studie, daher bleiben Details des Experiments und die Haltbarkeit der Ergebnisse unklar.