Perplexity Research publicou o estudo de pós-treinamento do sistema dentro da Perplexity Computer. Para o treinamento foram usadas sessões reais de usuários, incluindo falhas. O método combina fine-tuning com seleção de exemplos e destilação guiada por dicas.

No teste A/B ao vivo, entre duas versões treinadas, a taxa de falhas de chamadas de ferramentas caiu de 2,24% para 1,77%. A fonte relata isso como resultado da comparação entre dois pontos de controle.

O significado prático da abordagem é usar erros reais como material para melhoria subsequente. No entanto, o pacote de dados publicado é baseado em metadados e no resumo de MarkTechPost, e não no texto completo do estudo original, portanto os detalhes do experimento e a robustez do resultado permanecem incertos.