
Perplexity Research опубликовала исследование постобучения системы внутри Perplexity Computer. Для обучения использовались реальные пользовательские сессии, включая неудачные. Метод сочетает дообучение на отобранных успешных примерах с дистилляцией, направляемой подсказками.
В живом A/B-тесте между двумя обученными версиями доля сбоев вызовов инструментов снизилась с 2,24% до 1,77%. Источник сообщает об этом как о результате сравнения двух контрольных точек.
Практический смысл подхода — использовать реальные ошибки как материал для последующего улучшения. При этом опубликованный пакет данных основан на метаданных и пересказе MarkTechPost, а не на полном тексте первичного исследования, поэтому детали эксперимента и устойчивость результата остаются неясными.
комментарий редакции
Что это значит
Вероятное последствие — дальнейшее развитие обучения программных систем на реальных ошибках и последующая проверка таких методов в эксплуатации. Следующим наблюдаемым сигналом станет публикация полного исследования с размером выборки, методикой теста и результатами на новых сценариях. Существенная неопределённость связана с тем, что сейчас доступен только метаданный пересказ одного источника.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Подход Perplexity к обучению агента на реальных неудачных сессиях отражает зрелый сдвиг в постобучении LLM-агентов — от синтетических сценариев к эксплуатации живых ошибок как первичного обучающего сигнала. Снижение сбоев с 2,24% до 1,77% в A/B-тесте намекает на работоспособность метода, но без данных о размере выборки, статистической значимости и типах сбоев результат может быть как устойчивым трендом, так и шумом между двумя чекпойнтами. Следующим наблюдаемым сигналом станет публикация полного исследования с методологией и результатами на новых сценариях. Ключевая неопределённость — единственный источник и отсутствие первичных данных не позволяют оценить переносимость метода и его долгосрочный эффект.
В чём оценки сходятся- Согласен, что обучение на реальных неудачах — практически значимый сдвиг к улучшению по живым сбоям, а не только по подготовленным примерам.
- Согласен, что доступные данные не позволяют оценить масштаб теста, статистическую значимость и переносимость на другие сценарии.
- Согласен, что следующим наблюдаемым сигналом станет публикация полного исследования с размером выборки и методикой теста.
- Снижение на 0,47 п.п. между двумя чекпойнтами может отражать естественную вариативность, а не эффект метода — без доверительных интервалов вывод преждевременен.
- Акцент на неудачных сессиях может создавать смещение к типам ошибок, частым у активных пользователей, ухудшая покрытие редких, но критичных сценариев.
- Дистилляция с подсказками несёт риск переобучения под конкретные паттерны сбоев, что может снизить обобщающую способность на новых задачах.
Ollama Cloud
Kimi K2.6
Обучение на реальных неудачных сессиях — логичный шаг к практическому улучшению агентов, но заявленное снижение сбоев с 2,24% до 1,77% требует проверки статистической значимости и масштаба выборки. Следующим важным сигналом станет публикация полного исследования с методологией и воспроизводимыми результатами. Ключевая неопределённость: метод устойчив или переобучен под конкретные паттерны ошибок Perplexity Computer.
В чём оценки сходятся- Обучение на реальных ошибках пользователей — корректный и перспективный вектор развития агентных систем.
- Ограниченность данных из одного вторичного источника действительно снижает уверенность в выводах.
- A/B-тестирование в живой среде важнее лабораторных метрик для оценки практической ценности.
- Снижение с 2,24% до 1,77% может быть не статистически значимым при типичных объёмах трафика Perplexity; без p-value и доверительных интервалов интерпретация преждевременна.
- Отсутствие информации о baseline-модели затрудняет оценку: возможно, основной прирост дало не hint-guided self-distillation, а просто дообучение на большем корпусе данных.
- Фокус на tool-call failures игнорирует другие метрики качества агента — возможно, снижение сбоев сопровождалось ростом латентности или снижением сложности выполняемых задач.