
Der AWS Machine Learning Blog beschreibt einen konfigurierbaren Detektor personenbezogener Daten, der große Sprachmodelle Amazon Bedrock zur Identifizierung von PII verwendet. Kategorien von Daten werden in der Konfiguration festgelegt, nicht im Code.
Laut der Zusammenfassung der Veröffentlichung passt sich ein solcher Detektor neuen Arten von Entitäten ohne zusätzliches Training an. Im genannten Vergleich übertraf er ein fertiges Tool auf fünf öffentlich verfügbaren Korpora und unter neun Detektoren basierend auf großen Sprachmodellen.
Der praktische Sinn des Ansatzes ist die Möglichkeit, die zu überprüfenden Datentypen ohne Neutrainierung des Systems zu ändern. Im verfügbaren Paket fehlen Details zu Testczyên, Metriken, Modellen und Einschränkungen der Anwendung.
redaktioneller Kommentar
Warum es wichtig ist
Wahrscheinliche Folge — schnellere Hinzufügung neuer Kategorien personenbezogener Daten zu Prüfsystemen ohne erneutes Training. Als nächstes beobachtbares Signal wird die Veröffentlichung detaillierter Metriken, Test- und Einschränkungen sein. Wesentliche Ungewissheit besteht darin, dass derzeit nur die Zusammenfassung des Herausgebers verfügbar ist.