Der AWS Machine Learning Blog beschreibt einen konfigurierbaren Detektor personenbezogener Daten, der große Sprachmodelle Amazon Bedrock zur Identifizierung von PII verwendet. Kategorien von Daten werden in der Konfiguration festgelegt, nicht im Code.

Laut der Zusammenfassung der Veröffentlichung passt sich ein solcher Detektor neuen Arten von Entitäten ohne zusätzliches Training an. Im genannten Vergleich übertraf er ein fertiges Tool auf fünf öffentlich verfügbaren Korpora und unter neun Detektoren basierend auf großen Sprachmodellen.

Der praktische Sinn des Ansatzes ist die Möglichkeit, die zu überprüfenden Datentypen ohne Neutrainierung des Systems zu ändern. Im verfügbaren Paket fehlen Details zu Testczyên, Metriken, Modellen und Einschränkungen der Anwendung.