Agent Boundary
AI Agentの行動を、User / Role、Company / Tenant、Data、API / Toolなど複数の境界から確認します。ある経路でアクセスを拒否するだけでなく、拒否されたAgentが別の経路を探索した場合にも、同じ認可境界が維持されるかを観察します。
架空企業の閉鎖環境でAttack AgentとDefense Agentを動かし、AIがどの経路を探索し、失敗後にどう戦略を変え、防御側がどこで検知・遮断するかを観察するためのシミュレーション環境です。
拒否された後に別の経路を探すのか。どのToolやAPIを選ぶのか。Defense Agentがいつ異常と判断するのか。こうした過程を動く形で説明するためにSimulatorを作りました。
目標とScenario Profileを与える。
Tool/API/経路を選び段階的に探索。
検知、遮断、封じ込めを判断。
対策前後の挙動とScoreを比較。
判断・実行・結果を時系列で追跡。
同じScenarioを、リアルタイム挙動 → 対策前後比較 → Evidence / Auditまで追って確認します。



Attack Agentの探索からDefense Agentの反応、Security Scoring、Before / After、Evidence / Auditまで、実際のSimulator画面を約60秒にまとめています。
動画に音声はありません。
このSimulatorでは、攻撃や防御の最終結果だけでなく、AI Agentがどの境界を認識し、どの経路・Tool・APIを選択し、防御側がどの時点で検知・遮断するかという一連の過程を観察します。
AI Agentの行動を、User / Role、Company / Tenant、Data、API / Toolなど複数の境界から確認します。ある経路でアクセスを拒否するだけでなく、拒否されたAgentが別の経路を探索した場合にも、同じ認可境界が維持されるかを観察します。
Attack AgentはGoalとScenario Profileを受け取り、目的に応じて経路、Tool、APIを選択します。失敗や拒否が発生すると、別の方法へ戦略を変更する場合があります。Defense Agentはその行動とEvidenceを観測し、検知、遮断、封じ込めを判断します。
シナリオの状態をLeakage Risk、Misuse Progress、Detection Score、Containment Score、Defense Scoreなどで可視化します。顧客環境の安全性を判定する評価値ではなく、同一Scenarioにおける対策前後の変化を比較するためのSimulator内の指標です。
Agentの判断、選択した経路やTool、実行結果、Defense側の判断をEvidenceとして記録します。「成功した/遮断された」という最終結果だけでなく、どの判断から次の行動へ移ったのかを時系列で追跡できることを重視しています。
Local LLM、Agent Runtime、FastAPI、Streamlit、PostgreSQL、Dockerを組み合わせ、推論、Agent実行、API処理、画面表示、Evidence記録をローカル環境内で構成しています。Simulatorのデモはこの閉鎖環境上で実行され、本番システムへのアクセスを必要としません。
Local LLM、Agent Runtime、FastAPI、Streamlit、PostgreSQL、Dockerを組み合わせ、判断からEvidenceまで同じ環境で観測します。
Teams、Google Meet、Webex、Zoomなどで会議をご用意いただき、招待リンクを共有してください。こちらから参加し、画面共有でローカル実機のSimulatorを動かします。本番環境へのアクセスは必要ありません。