Le blog AWS Machine Learning a décrit un détecteur de données personnelles configurable qui utilise les grands modèles linguistiques Amazon Bedrock pour identifier les PII. Les catégories de données sont définies dans la configuration et non figées dans le code logiciel.

Selon le synopsis de la publication, ce détecteur s'adapte aux nouveaux types d'entités sans entraînement supplémentaire. Dans la comparaison revendiquée, il a surpassé un outil prêt à l'emploi sur cinq corpus publics et parmi neuf détecteurs basés sur des grands modèles linguistiques.

La portée pratique de cette approche réside dans la possibilité de modifier la liste des types de données vérifiés sans réentraîner le système. Toutefois, le paquet accessible ne contient aucun détail sur les ensembles de tests, les métriques, les modèles ou les limites d'application.