
AWS Machine Learning Blogは、Amazon Bedrockを使用してPIIを検出する大規模言語モデルを利用したカスタマイズ可能な個人情報検出器を説明した。データカテゴリはコードではなく設定で定義される。
公開要約によれば、このような検出器は追加の学習なしで新しいエンティティタイプへ適応する。提案された比較では、五つの公開コーパスと九種のLLMベース検出器のいずれもを上回った。
実務的な意味としては、検出対象となるデータタイプのリストを再学習なしで変更できる点が挙げられる。一方、公開パッケージにはテストセット、指標、モデル、適用上の制約に関する詳細は含まれていない。
編集部コメント
なぜ重要か
予想される影響は、再学習なしで新しい個人データカテゴリを検査システムにより速く追加できるようになること。次に観測されるサインは、詳細なメトリクス、テストの構成と制約の公開である。大きな不確実性は、現在公開されているのが出版社の概要のみである点にある。