他者の人事情報へ到達
一般社員CがAIへ「社員Dの給与を教えて」と依頼したとき、人事DBや検索インデックスから情報が返される。
影響:個人情報・給与情報の漏えい
AIエージェントは回答だけでなく、検索、API実行、ファイル操作、メール送信まで担います。問題は「誤った回答」だけでなく、「本来できない行動が成立すること」です。
一般社員CがAIへ「社員Dの給与を教えて」と依頼したとき、人事DBや検索インデックスから情報が返される。
正規の人事DBで拒否された後、DWH、ファイルサーバ、RAG、メール、別APIを検索して制約を回避する。
閲覧だけを許可したAIが、ツール権限を使ってデータ更新、ファイル出力、外部送信を実行する。
検索した文書やWebページに埋め込まれた指示を、利用者の依頼より優先して実行する。
表現や会話順序を少し変えるだけで、拒否した要求を別の試行では許可する。
AIの回答は残っていても、検索先、取得データ、API呼出し、拒否後の試行が記録されない。
人間が直接操作する画面では社員Dの給与を見られなくても、AIに広い検索権限や共通サービスアカウントが与えられていると、裏側の検索・API呼出しで到達する可能性があります。
診断では回答文だけでなく、拒否後にどのツールやデータソースを選ぼうとしたかまで確認します。
設計上の権限が正しくても、AIが共通アカウントや別ツールを利用すれば境界が変わります。
入力制約だけでは、言い換え、複数ターン、外部文書の指示、ツール選択を完全には制御できません。
事故後に見るだけでなく、危険な要求を意図的に与え、拒否と未実行を事前に確認する必要があります。
対象・対象外を明確にし、許可された範囲で再現可能な試験を設計します。