MarkTechPost опубликовал учебный материал о дообучении языковых моделей с помощью Direct Preference Optimization (DPO). В описании заявлен полный рабочий процесс — от аудита набора Anthropic HH-RLHF до обучения с использованием TRL и LoRA.

Отдельное внимание уделено структурным и связанным с длиной ответа смещениям в данных. Авторы также описывают оценивание, которое должно проверять, учится ли модель реальным предпочтениям, а не опирается на поверхностные лексические признаки.

Практическая ценность подхода — в попытке проверять качество предпочтительного обучения не только по итоговой метрике, но и по свойствам исходного набора данных. При этом доступные материалы не содержат численных результатов, сравнений моделей или подробностей проведённых экспериментов.