Le blog AWS Machine Learning a publié la première partie d'une série sur la préparation des données pour le fine-tuning supervisé. Le matériel mentionne des contrôles de qualité, le formatage des dialogues en JSONL, des schémas pour le raisonnement et l'appel d'outils, ainsi que la division des données en ensembles d'entraînement et d'évaluation.

La portée pratique de cette publication réside dans l'accent mis sur la préparation de l'ensemble de données avant le début du fine-tuning. La source ne révèle pas, dans le synopsis accessible, les critères de qualité spécifiques, les formats de schéma ou les proportions recommandées pour les ensembles de données; par conséquent, ils ne peuvent pas être évalués sur la base des documents présentés.