Amazon Web Servicesは2026年9月10日に、大規模言語モデル(LLM)を活用した、特定のモデルに依存しない個人情報(PII)検知手法を発表しました。この手法は、プロンプトの指示に基づいて検知対象を柔軟に変更できるのが特徴です。
プロンプトによる柔軟な検知対象の定義
従来の個人情報検知ツールは、特定のデータ形式を学習したモデルを使用するため、新しい種類の識別子を検知するにはモデルの再学習が必要でした。これに対し、今回発表された手法は、検知したい情報の種類や出力形式をプロンプトの指示(インストラクション)で定義します。これにより、ドメイン固有の識別子などの追加も、指示文を一行書き換えるだけで対応可能です。
モデルを選ばない柔軟な構成
この検知システムは、バックエンドとなるLLMを自由に選択できる設計になっています。Amazon Bedrockで管理されるモデルを利用できるほか、ユーザーが独自のインフラ上で運用するオープンなモデルにも対応しています。検知の精度やコスト、遅延時間は、使用するモデルを選択することで調整できます。
高精度な構造化データの生成
システムは、LLMが生成したテキストから個人情報を抽出し、JSON形式の構造化データへと変換します。LLMが直接算出することが難しい文字位置(オフセット)については、後処理工程で正確な位置を特定する仕組みを備えています。また、モデルが誤ったラベルを生成した場合でも、定義済みの語彙にマッピングして補正する機能を備えています。
