
Perplexity Research publicou o estudo de pós-treinamento do sistema dentro da Perplexity Computer. Para o treinamento foram usadas sessões reais de usuários, incluindo falhas. O método combina fine-tuning com seleção de exemplos e destilação guiada por dicas.
No teste A/B ao vivo, entre duas versões treinadas, a taxa de falhas de chamadas de ferramentas caiu de 2,24% para 1,77%. A fonte relata isso como resultado da comparação entre dois pontos de controle.
O significado prático da abordagem é usar erros reais como material para melhoria subsequente. No entanto, o pacote de dados publicado é baseado em metadados e no resumo de MarkTechPost, e não no texto completo do estudo original, portanto os detalhes do experimento e a robustez do resultado permanecem incertos.
comentário editorial
Por que importa
Conclusão provável: um maior desenvolvimento do treinamento de sistemas de software com base em erros reais e a subsequente validação de tais métodos em operação. O próximo sinal observado será a publicação de um estudo completo com o tamanho da amostra, a metodologia do teste e os resultados em novos cenários. Uma incerteza substancial está relacionada ao fato de que hoje está disponível apenas um resumo de metadados de uma única fonte.