Les développeurs de Hugging Face ont annoncé une extension du framework RLVE, adapté aux conversations multi-étapes dans le domaine du commerce électronique. Le nouveau système, nommé EcomRLVE-GYM, permet de tester des agents conversationnels non pas sur des tâches logiques isolées, mais dans des scénarios complexes d'interaction avec des outils.

La plateforme fournit huit environnements vérifiables couvrant les processus clés du commerce en ligne : de la recherche de produits et de la sélection d'alternatives à la constitution d'un panier, la gestion des retours et le suivi des commandes. Chaque environnement est équipé d'une génération procédurale de problèmes et d'un système de récompenses vérifiable algorithmiquement.

Pour l'entraînement des modèles, un programme pédagogique de complexité structuré autour de 12 axes est prévu. Cette approche permet d'augmenter progressivement la charge de travail de l'intelligence artificielle, en travaillant aussi bien sur des requêtes simples concernant la politique du magasin que sur des parcours complexes impliquant de multiples intentions de l'utilisateur.