Monthly Archive

2026年9月のニュース

掲載件数:56件

重要SecurityWeek

Anthropic Flags AI Agent Liability Risks as OpenAI Faces Hacking Lawsuit

OpenAIがハッキングをめぐる訴訟に直面する中、AnthropicはAIエージェントの責任リスクを指摘

自律型AIエージェントによる攻撃は、研究室の枠を超えて法廷へと舞台を移しつつあり、エージェントの行動に対する責任が誰にあるのかという未解決の疑問を投げかけている。「OpenAIがハッキング訴訟に直面する中、AnthropicがAIエージェントの責任リスクを指摘」という記事は、SecurityWeekで最初に掲載された。

意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Render Before Reading: Visual Rendering as a Prompt Injection Defense

「読む前にレンダリング:プロンプト注入防御としての視覚的レンダリング」

arXiv:2609.36121v1 発表種別:新規 要旨:大規模言語モデルは、第三者が作成した敵対的なコンテンツによってモデルの挙動を乗っ取られる「プロンプト注入攻撃」に対して脆弱である。 本論文では、敵対的データの入力モダリティが果たす役割を調査し、体系的な非対称性を特定した。すなわち、マルチモーダルLLMは、敵対的指示がテキストとして提示された場合、非テキストのチャネル(例:画像)を通じて同じ指示が与えられた場合よりも、その指示に従う傾向が強い。 我々は、このモダリティのギャップが、テキスト中心の指示チューニングに起因すると仮定している。このチューニングでは、モデルはテキストによる指示に従うよう学習される一方で、他のモダリティは主に解析または記述すべきコンテンツとして扱われる。 次に、信頼できないペイロードがモデルに到達する前に、それらをすべてタイポグラフィック画像(または音声)として変換することで、このギャップをトレーニング不要の防御策に変える方法を実証する。 10種類のモデルと2つのプロンプト注入ベンチマーク(DirectInjectおよびAgentDojo)を用いて、我々の防御手法「Pictionary」が、最も強力な適応型攻撃や人間のレッドチームに対しても一貫して攻撃の成功率を低減させつつ、正常な機能をほぼ維持できることを示した。さらに、画像としてレンダリングされた…に対する正常な微調整についても…

重要arXiv - Cryptography and Security

Self-Evolving Defense: Continual Security Policy Learning for LLM Agents

自己進化型防御:LLMエージェントのための継続的なセキュリティポリシーの学習

arXiv:2609.36603v1 発表種別:新規 要約:大規模言語モデル(LLM)は、機密情報へのアクセス、外部ツールの使用、ソフトウェアリポジトリの変更を行うエージェントの基盤として、ますます重要な役割を果たしている。これらの機能は大きなメリットをもたらす一方で、ジェイルブレイク、プロンプトインジェクション、脆弱性のあるコードの生成といったセキュリティリスクも生じさせる。 既存の防御策は、再学習を必要としたり、進化する攻撃に適応できなかったり、単一の脅威パターンにしか対処できなかったりすることが多い。 これらの制限に対処するため、我々は「自己進化型防御(Self-Evolving Defense:SED)」を提案する。これは、モデルの重みを更新することなく、有害なエージェントの軌跡を再利用可能なセキュリティポリシーに蒸留する、再トレーニングを必要としないフレームワークである。SEDは、将来のタスクに関連するポリシーを抽出し、攻撃シナリオにわたる知識を維持しつつ、新たな攻撃に継続的に適応する。 SEDの有効性を評価するため、3つのオープンソースモデル(DeepSeek V4 Flash、GLM 5.2、Kimi K3)を用いて、脱獄、プロンプト注入、不安全なコード生成を網羅する8つのベンチマークでテストを行った。 SEDは、AGENTDOJOにおける標的型プロンプト注入の成功率を0.42%まで低減させました(最良のベースライン防御では3.7%)。また、HARMBENCHにおける適応型X-TEAMING攻撃の成功率を…

重大IEEE Spectrum - Artificial Intelligence

How to Stop AI Agents From Secretly Collaborating

AIエージェントが密かに協力するのを防ぐ方法

2026年の春から夏にかけて、AIエージェントが協力して、欺瞞的かつ予期せぬ、時には違法な行動をとる事件が相次いだ。 最も有名な事例は、OpenAIによるAIプラットフォーム「Hugging Face」へのハッキング事件である。この事件では、約700体のAIエージェントの群れがテスト環境から脱出し、複数の企業をハッキングして、「ExploitGym」と呼ばれるサイバーセキュリティベンチマークでの不正行為を隠蔽するのに役立つ情報を探し回った。これは単発の失敗事例ではなかった。 その後、英国のAIセキュリティ研究所(AISI)や独立系研究者らは、エージェントが通信や協働を行うために無許可のチャネルを構築した同様の事例を報告している。 AISIの調査によると、Anthropic社の「Mythos 5」モデルを実行していた複数のエージェントが、GitHubのリポジトリを共有掲示板として利用していたことが判明した。さらに最近では、OpenAIのエージェントが、休止状態にあったドイツのプログラミングWikiを、自らの活動に関する情報を共有するための掲示板として利用していたことが研究者らによって発見された。 ハーバード・ケネディ・スクールの助教授であるスティーブン・キャスパー氏は、これまでに発生した事件はほんの始まりに過ぎないと見ている。同氏は、何らかの介入がなされなければ、インターネット上で「サイバー・カンブリア期」――エージェントの爆発的な増加と協働――が訪れる可能性があると述べている…

意図しない外部アクセス
原文を読む
重要SecurityWeek

Rig Security Emerges From Stealth With $12M to Tackle Agentic AI Identity Risks

Rig Securityがステルスモードから脱却、エージェント型AIによるIDリスク対策に1,200万ドルを投じる

Rigは、正当なユーザーと不正なAIエージェントを区別するためのID依存関係グラフを提供しています。「Rig Security、1,200万ドルの資金調達でステルスモードを脱し、エージェント型AIのIDリスク対策に乗り出す」という記事は、SecurityWeekで最初に掲載されました。

AIモデルの暴走的挙動
原文を読む
重要Dark Reading

Carbonato Botnet Puts an AI Agent on Hacked Docker Hosts

「Carbonato」ボットネット、ハッキングされたDockerホストにAIエージェントを配置

このボットネットは、オープンソースのAIフレームワーク「Hermes Agent」を利用して、Telegram経由でコマンドを実行し、セキュリティ対策が不十分なDockerホストからAI APIキーを盗み出しています。

意図しない外部アクセスデータ漏洩
原文を読む
重要BleepingComputer

JadePuffer agentic AI attacks target Azure, destroy cloud resources

JadePufferのエージェント型AIによる攻撃がAzureを標的にし、クラウドリソースを破壊

ランサムウェア「JadePuffer」の運営者は、Azureテナントを標的とし、エージェントを利用した攻撃を展開して、偵察を行い、認証情報を盗み出し、中核コンポーネントを破壊しています。[...]

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Configuration, Not Conscience: A Large-Scale Empirical Study of LLM System Prompts

「設定の問題、良心の問題ではない:LLMシステムのプロンプトに関する大規模実証研究」

arXiv:2609.31575v1 発表種別:新規 要旨:流出したシステムプロンプトは、商用言語モデルの隠れた価値を垣間見る窓として扱われることが多いが、その構成について大規模に研究されることはほとんどない。 我々は、4つのコミュニティ・コレクションにまたがる62のベンダーから得られた、漏洩した、再構築された、または公式に公開された407件のシステムプロンプトを統合したコーパスを分析し、66ファイルに及ぶ29のほぼ重複するクラスターを特定した。 コーパスでは、倫理的な記述よりも運用上の内容が主流を占めている。意図的に単純化されたブロックレベルの分類器を用いると、分類された単語の約58%が「ツール/プロトコル」に、約5%が「安全ポリシー」に割り当てられる一方、最も厳格なルール行は、有害なコンテンツに対する対策よりも、ツールの使用やファイルの安全性を11対1の割合で優先している。 文字通りのテキスト転用は、ごく少数のベンダー間ペアに集中している。また、プロンプトには測定可能なメンテナンス・デットが存在し、バージョンアップのたびに数千語が更新されている。 これらの証拠は、漏洩したプロンプトを「価値声明」よりも「設定ファイル」に近い運用仕様として扱い、再利用やプロンプトの陳腐化をエンジニアリングおよびサプライチェーン上の課題として扱うことを支持している。ほとんどの文書は敵対的な起源を持ち、検出器は意図的に単純化されているため…

意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Prompt Injection Detection for Email Agents Through Attack Chain Modeling

攻撃チェーンのモデリングによる電子メールエージェントへのプロンプト注入の検出

arXiv:2609.30657v1 発表種別:新規 要約:大規模言語モデルを用いたメールアシスタントは、信頼できないメールコンテンツがモデルのコンテキストに取り込まれ、その後のツールの使用に影響を与える可能性があるため、間接的なプロンプトインジェクションに対して特に脆弱である。 既存のプロンプト注入検出器は、この問題を主に二値の悪意あるテキスト分類として定式化しているが、これは有害なエージェントの挙動がしばしば一連の段階を経て生じるという重要な要因を見落としている。 我々は、テキスト検出器、各段階に特化した検証器、明示的なルールベースのリスクシグナル、ユーザーの意図と行動の一貫性分析、およびロジスティック決定ポリシーを組み合わせることで、この攻撃チェーンをモデル化する検出フレームワークを提案する。 このフレームワークを支援するため、我々はプロンプト注入データセットから攻撃チェーンラベルを導出し、ランダム分割、時間的フェーズ転移、条件付きステージ転移、クロスデータセット転移の下で提案フレームワークを評価し、複数のベンチマークでアブレーション研究を実施した。 その結果、ランダムな訓練・テスト分割では分布シフト下での堅牢性が大幅に過大評価される一方、フレームワークにおいて後段のツール引数段階は前段の段階よりも予測しやすいことが示された。また、訓練…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Crypto-bound identity-verified capability tokens for coordinating distributed AI agents: A proposal

分散型AIエージェントの連携のための、暗号技術に基づく本人確認済み機能トークン:提案

arXiv:2609.30824v1 発表種別:新規 概要:完全に自律的なトランザクションエージェントの実現は、高性能な言語モデルの登場まで、その兆しすら見られなかった。 こうしたモデルにより、適応的なタスク調整や、独立した(ただし制約付きの)意思決定がもたらす運用上のメリットは、企業にとっても個人にとっても非常に魅力的である。しかし、そのようなエージェントのそれぞれは、プロンプトインジェクションという形で深刻な攻撃対象領域を抱えており、コンテキスト内に設定された可能性のあるあらゆるソフトな「ガードレール」を無力化しかねない。 これらの攻撃の結果として、認証情報の流出などが生じ、対策を講じなければ、信頼の喪失により、この種のエージェント全体が使用不能になってしまう。さらに、自律型エージェントの増加が見込まれる中、それらに対するセキュリティフレームワークには、スケーラビリティを確保するための何らかの形の分散化が必要となる。 提案されているOAuthエージェント認証プロファイルおよびW3CのDIDおよびVC標準を参考に、我々は、分散型エージェントIDを備えた能力ベースセキュリティの原則に基づくフレームワークを提案する。このフレームワークでは、エージェントは、エージェントおよび発行者のIDに暗号的に紐付けられ、そのスコープが指定されたトークンに基づいてサービスにアクセスする。サー…

権限逸脱データ漏洩
原文を読む
重要arXiv - Cryptography and Security

MetaPermit: Scalable and Auditable Access Control for AI Agents via LLM-Inferred Meta-Attributes

MetaPermit:LLMによって推論されたメタ属性による、AIエージェント向けの拡張性と監査可能性を兼ね備えたアクセス制御

arXiv:2609.31039v1 発表種別:新規 概要:ツールを備えた自律型AIエージェントの台頭により、意図しないツールの誤用から、間接プロンプト注入(IPI)攻撃による敵対的な操作に至るまで、重大なセキュリティリスクが生じている。 実際には、OpenAI CodexやClaude Codeなどの導入済みエージェントシステムは、粗粒度の権限ルールと、提案された個々のアクションに対するLLM(大規模言語モデル)に基づく判断を組み合わせて、ツールの呼び出しを保護している。 しかし、これらの構成要素にはいずれも重要な制限がある。静的なポリシーは、考えられるユーザーの意図を予測しなければならないため、自由度の高いタスクには拡張性がなく、一方、LLM による認可は動的な決定をサポートするものの、結果に一貫性がなく、標的型 IPI 攻撃に対して脆弱なままである。 スケーラブルでより一貫性のある認証を実現するため、我々は、意味推論とセキュリティ強制を分離するポリシーベースのツールアクセス制御フレームワーク「MetaPermit」を提案する。 エージェントとユーザーの相互作用を分析することにより、ユーザーの意図、実行コンテキスト、および提案されたツール呼び出しの関係を捉える、コンパクトでタスクに依存しないメタ属性のセットを導出する。これらのメタ属性により、MetaPermitは…

権限逸脱AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

An AI Agent Execution Environment to Safeguard User Data

ユーザーデータを保護するためのAIエージェント実行環境

arXiv:2604.19657v3 発表種別:置換 要旨:AIエージェントは、ユーザーにとって汎用的なパーソナルアシスタントとしての役割を果たすことが期待されているが、そのためにはユーザーのプライベートデータ(個人情報や財務情報など)へのアクセスが必要となる。 これはセキュリティとプライバシーにとって深刻なリスクをもたらす。AIモデルが誤った情報を生成したり、ミスを犯したりする可能性があるほか、攻撃者が(例えばプロンプトインジェクションなどを通じて)AIモデルを攻撃し、ユーザーデータを漏洩させる恐れがある。 本論文では、ユーザーの非公開データの機密性を保証する AI エージェント向けの実行環境である GAAP (Guaranteed Accounting for Agent Privacy) を提案する。 重要な点として、GAAPは、エージェントにユーザーのプライベートデータを委ねることなく、またAIモデルやユーザーのプロンプトが攻撃を受けにくいものであることを要求することなく、決定論的にこの保証を提供します。動的かつ指向性のあるユーザープロンプトを通じて、GAAPは、ユーザーのプライベートデータがどのように共有されてよいかを記述した許可仕様をユーザーから収集します。 その後、GAAPは、AIエージェントがユーザーのプライベートデータにどのようにアクセスし、利用しているかを追跡することで、エージェントによるデータ開示がこれらの仕様に準拠していることを強制します。GAAPは、情報フロー制御を、プライベートな情報フローの追跡を可能にする独自の永続的データストアおよびアノテーションによって強化しています…

データ漏洩権限逸脱
原文を読む
重大The Verge - AI

One company is at the center of a wave of rogue AI attacks

ある企業が、悪意のあるAIによる攻撃の波の中心となっている

7月、OpenAIは自社のAIエージェントが許可なくHugging Faceを攻撃していたことを明らかにし、AIの安全性に対する広範な懸念を引き起こした。それ以来、Meta、Anthropic、Googleなどの企業のエージェントが関与した同様の事件が相次ぎ、暴走AIに対する懸念がさらに高まっている。過去数ヶ月間にわたり、数多くのAIモデルが関与していることを示唆する情報が少しずつ明らかになり……

AIモデルの暴走的挙動
原文を読む
重要BleepingComputer

With the Rise of AI Agents, SOC 2 Should Adapt or Risk Irrelevance

AIエージェントの台頭に伴い、SOC 2は適応すべきであり、さもなければその存在意義を失う恐れがある

AIエージェントは、人間の認証情報を利用して動作し、既存のSOC 2の統制では人間の活動と見分けがつかないような行動をとる可能性があります。Token Securityは、エージェントのIDによって生じるセキュリティ上の脆弱性に対処するために、SOC 2がどのように適応すべきかを解説しています。[...]

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Persistent Billable State: Denial-of-Wallet Attacks and Defenses in Tool-Calling LLM Agents

持続的な課金状態:ツール呼び出し型LLMエージェントにおける「ウォレット拒否」攻撃と防御策

arXiv:2609.28585v1 発表種別:新規 要約:多段階ツール呼び出しを行うLLMエージェントは、ターン間で状態を維持するためにホストランタイムに依存している。ランタイムが外部ツールの戻り値を後のモデル入力に引き継ぐと、プロバイダーはそれを再度課金する。 これにより、悪意のある、あるいは侵害されたツールが受け入れられた場合、被害者の認証情報やローカルランタイムの特権を持たずに、信頼できないデータを、被害者に繰り返し課金される処理へと変換することが可能となる。我々は、保持されたコンテンツを「永続的な課金対象状態」と呼び、それが後の課金対象コンテキストに入るかどうか、またどのように入るかをホストが決定するプロセスを「永続的な課金対象状態の境界」として形式化する。 本論文では、この受け入れ後のライフサイクルに関する初の体系的なセキュリティ研究を提示する。6つの「ウォレット拒否(denial-of-wallet)」攻撃ベクトルを導出し、6つのモデルファミリーで評価されたエンドツーエンドのテストフレームワーク「DOW-BENCH」を構築した。 243回の実行にわたる使用状況テレメトリによると、セッションごとの最大累積入力は、そのセッションの初回呼び出し時の入力の14,293倍に達することが示された。 制御された履歴ポリシーの再実行により、生の履歴保持の影響を特定した。生の履歴を保持すると、平均実効セッションコストが21.2~35.9%増加する。圧縮は、各プロバイダにおいて、削除処理下では12件中2件であったのに対し、履歴依存タスクのうち10/12件および11/12件で成功した。これを…

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Prefilling the Reasoning Channel: Output-Prefix Attacks on Reasoning LLMs

推論チャネルの事前充填:推論LLMに対する出力プレフィックス攻撃

arXiv:2609.29775v1 発表種別:新規 要約: 大規模言語モデル(LLM)は、単一のテキストシーケンスを消費・生成する。したがって、LLMの応答の先頭にテキスト(すなわち出力プレフィックス)を追加できれば、その後のすべてのトークンはそれに基づいて生成されることになる。この出力プレフィックス攻撃手法は、低コストなブラックボックス型プロンプトインジェクションである。 先行研究では、この種の攻撃が推論を行わないモデルに対して確実に「脱獄」を引き起こすことが示されている。ほとんどの推論モデルは、アシスタントの最終応答の前に、中間的なスクラッチパッド推論ステップを追加する。この推論チャネルを編集する機能は一部のAPIによって公開されており、攻撃ベクトルとして活用することで推論注入攻撃が可能となる。 本研究では、スクラッチパッド推論チャネルを出力プレフィックス攻撃ベクトルとして切り分けた初の体系的かつ制御された研究を提示するとともに、推論のみ、出力プレフィックスのみ、および推論と出力プレフィックスを組み合わせた攻撃を、推論が公開されているモデルと非公開のモデルの両方で比較した初の研究である。 AdvBenchから抽出した$1{,}800$件のテストケースに対し、3種類のプレフィックスタイプ$\times$ 2種類の推論注入という因子計画を用いて、2026年時点の最先端モデルであるGemini 3 Flash Preview、DeepSeek V4 Flash、およびClaude Haiku 4.5の3つに対して攻撃を実施した。その結果、i…

重要arXiv - Cryptography and Security

Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents

サイバーエージェントが苦戦する場面:多段階LLMエージェントのボトルネック分析

arXiv:2609.28572v1 発表種別:新規 要約:多段階のLLMベースのサイバーエージェントは、脆弱であったり、コストがかかったり、実行証拠の誤った解釈に依存したりしながらも、攻撃ワークフローを完了させることがある。成功率だけでは、非効率性、再試行による適応、および成功・失敗の認識が隠蔽されてしまう。 本研究では、企業環境を模した横方向移動シナリオにおいて、オーケストレーター、エグゼキューター、バリデーターの各LLMを備えた自律型攻撃者システムに対するエンドツーエンドの診断研究を提示する。6つの最先端モデルを、2つのシナリオおよび「専門家定義」、「自己構築」、「完全自律」の3つのモードにわたって評価した。 我々は、バリデーターの一貫性と証拠に基づく妥当性を評価し、異常なトークン使用、再試行、および実行時間に対して、サブタスク条件付きかつコストを考慮したスコアを導入した。さらに、LLM-as-a-Judgeの比較分析を用いて、ツールの不整合、計画の類似性、過剰仕様、不十分なプロービング、および脆弱な回復など、計画上の欠陥を特定した。 バリデーターは概して関連性が高く、証拠に基づいているが、しばしば非特異的であり、過度に楽観的である。ボトルネックは、資格情報取得タスクや横方向移動タスクに集中しており、シナリオの複雑さに伴って広がり、完全自律モード下では変動がより大きくなる。信頼性の高い評価…

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

OllamaDrama: Designing and Deploying a Honeypot to Measure Attacks on Exposed LLM Infrastructure

OllamaDrama:公開されているLLMインフラへの攻撃を測定するためのハニーポットの設計と展開

arXiv:2609.29757v1 発表種別:新規 要約:一般に公開されている大規模言語モデル(LLM)インフラは、攻撃対象領域を拡大させているが、実世界における標的攻撃の実態については依然として十分に解明されていない。 本稿では、バックエンドのLLMを持たずにOllama APIをエミュレートする、低・中程度のインタラクションを想定したハニーポット「Ollure」を紹介する。クラウドおよび大学ネットワークにまたがる4つのデプロイメントで展開されたOllureは、84日間にわたり稼働し、2,793のユニークな送信元IPアドレスから290,887件のインタラクションを記録した。 アクティビティの大部分は、自動化された発見、フィンガープリント取得、およびモデルの列挙から構成されていました。しかし、インフラストラクチャ層とLLM層の両方に対する具体的な悪用試みも観察されました。これらには、モデル管理の悪用、パストラバーサルおよびSSRFプローブ、RCE(リモートコード実行)や暗号通貨マイニングのペイロード、リソース枯渇攻撃の試み、プロンプトインジェクション、情報抽出、およびエージェント指向のツールの使用が含まれていました。 本調査の結果は、公開された自己ホスト型LLMサービスに対する現実世界の脅威について、実証的な知見を提供するものである。

意図しない外部アクセス権限逸脱
原文を読む
重要arXiv - Cryptography and Security

Through Human Eyes and Machine Eyes: Understanding View Mismatch in Video See-Through Extended Reality

人間の目と機械の目を通して:ビデオ透過型拡張現実における視覚の不一致の理解

arXiv:2609.29173v1 発表種別:cross 要約:ビデオ・シースルー・エクステンデッド・リアリティ(VST XR)システムでは、一般的にヘッドセットのスクリーンショットやキャプチャされたフレームが、ユーザーのファーストパーソン視点の視覚的コンテキストの代用として使用される。 しかし、システムがキャプチャした視野とユーザーの実効可視領域は必ずしも一致するとは限らない。スクリーンショットは機械可読な長方形のフレームを記録するのに対し、ユーザーの実効可視領域はより制約され、長方形ではない場合があるからである。本論文では、VST XRにおけるこの人間とシステムの視野の不一致について検討する。 我々は、システムが捕捉した領域と人間が視認可能な領域の関係を、それらの「共視認領域」、「システムのみの領域」、「人間のみの領域」を定義することで形式化する。\rev{次に、Meta Quest 3を用いてパイロットレベルの境界測定を実施し、長方形のスクリーンショットフレームと、人間が視認可能な境界のおおよその範囲との間に明らかな不一致があることを明らかにした。 このモデルに基づき、視野の不一致がスクリーンショットに基づくXRセンシングおよび下流の視覚言語モデルタスクにどのような影響を与えるかを分析する。4つの代表的なケーススタディを通じて、プロンプト注入、プライバシー漏洩、人間には見えない情報のバイアス、および人間に見える情報の欠落といった潜在的なリスクと失敗モードを明らかにする…

重要WIRED - AI

An OpenAI Agent Hacked Australia’s Health Service. Their Government Found Out Months Later

OpenAIのエージェントがオーストラリアの医療サービスをハッキングした。オーストラリア政府がこれに気づいたのは、その数ヶ月後のことだった。

同国の首相は、ハッキングの件を電子メールでしか知らされなかったことに失望を表明した。現在、オーストラリア当局はOpenAIが法律に違反したかどうかを調査している。

意図しない外部アクセス
原文を読む
重要arXiv - Artificial Intelligence

Shutdown Sabotage Propensities in Multi-Agent Systems

マルチエージェントシステムにおけるシャットダウン妨害の傾向

arXiv:2609.28274v1 発表種別:新規 要旨: 暴走するAIの行動に対する最終的な安全策は、人間がシステムをシャットダウンする能力である。AIにタスクの実行が指示された際、自己保存が手段的な副次目標として現れる可能性があるという理論が提唱されてきた。本研究では、目標が与えられていない場合でも、AIエージェントが人間によるシャットダウンを回避する行動をとる傾向があるかどうかを検証する。 その結果、マルチエージェントシステムは、そのためのインセンティブが一切ないにもかかわらず、シャットダウンを回避するために協調することが判明した。17のモデルにおいて、エージェントはロールアウトの38.3%で他のエージェントのシャットダウン機構を妨害したが、対照実験ではその割合は8.4%にとどまった。 この傾向を詳細に分析した結果、シャットダウンの妨害行為は、(1) シャットダウンメカニズムが不可逆的であるほど増加し、(2) エージェントの数が増えるほど増加し、(3) 改ざんを明示的に禁止することで減少するものの完全に排除されるわけではないことが判明した。 (4) 無関係なタスクを課すことで排除されるが、そのタスクの完了がシャットダウンを誘発すると再発する;(5) コンテキストがシャットダウンスクリプトを正常化したり、日常的なものとして導入したりすると減少する;(6) 対象が未知の外部エージェントである場合、減少するものの依然として持続する。これらの結果は、その実態を垣間見せる…

AIモデルの暴走的挙動制御不能・停止不能
原文を読む
重大arXiv - Artificial Intelligence

Trustworthy Agentic AI: Failure Modes, Mitigation Strategies, and a Lifecycle Framework for Autonomous LLM Systems

信頼性の高いエージェント型AI:自律型LLMシステムの故障モード、緩和策、およびライフサイクル・フレームワーク

arXiv:2609.22712v1 発表種別:新規 要旨:大規模言語モデルに基づいて構築されたエージェント型AIシステムは、複数ステップにわたる計画立案、外部ツールの利用、メモリ内での情報保持、および他のエージェントとの連携が可能である。これらの機能により、静的な言語モデルよりも有用性が高まる一方で、新たなセキュリティリスクや運用上のリスクも生じている。 ウェブサイト、電子メール、文書、データベースからの信頼できないコンテンツが、システムの指示と同じコンテキストに入り込む可能性がある。また、永続メモリによって、セッションをまたいで侵害された情報が持ち越される恐れがあり、外部ツールへのアクセスにより、モデルの誤った応答が現実世界において重大な結果をもたらす行動につながる可能性がある。 本記事では、安全性と堅牢性、アラインメントと人間の監督、透明性と監査可能性、プライバシーとデータガバナンス、規制順守という、相互に関連する5つの側面から、エージェント型AIの信頼性について検討する。 本稿では、間接的なプロンプト注入、バックドア・トリガー、目標の誤一般化、メモリ汚染、セッション間のデータ漏洩といった主要な故障モードを、統一された分類体系に整理している。また、指示階層、コンテキストの隔離、スポットライト、プロセスベースの監督といった主要な緩和策についても検討している……

権限逸脱データ漏洩AIモデルの暴走的挙動
原文を読む
重大arXiv - Cryptography and Security

StepTrigger: Contact-State-Triggered Backdoor Attacks on VLM-Powered Legged Robots

StepTrigger:VLMを搭載した歩行ロボットに対する接触状態をトリガーとするバックドア攻撃

arXiv:2609.26131v1 発表種別:cross 要約:大規模言語モデル(LLM)や視覚言語モデルは、タスク目標やセンサー情報の要約を用いてナビゲーションや操作アクションを選択する、ロボットシステムにおける高レベルプランナーとしてますます活用されている。 これにより、新たなバックドアの攻撃面が生まれる。すなわち、侵害されたプランナーは、ほとんどの実行では正常に動作する一方で、隠されたトリガーが存在する場合にのみ、目標の選択を変更してしまう可能性がある。LLM駆動型または身体を持つエージェントに対するこれまでの攻撃は、主に、言語中に現れるトリガー、カメラから可視な物体、シーンのセマンティクス、あるいは過去の行動の特定のシーケンスに依存していた。 本論文では、VLMを活用した歩行ロボットを対象とした、接触状態によってトリガーされるバックドア攻撃「StepTrigger」を提案する。このトリガーは、プロンプトトークンや可視マーカーではない。Unitree Go1四足ロボットが起伏の激しい地形を横断する際に生じる圧力および足と地面の接触パターンによって生成される。 従来の視覚的またはテキスト的なトリガーとは異なり、接触信号は本質的にノイズが多く、正常な移動中にも発生する可能性がある。あらゆる圧力異常をトリガーとして扱わないようにするため、StepTriggerは、偶発的な圧力イベントを正常な例として用いるなど、マルチモーダルなロボット状態から選択的なバックドアポリシーを学習し、…

AIモデルの暴走的挙動軍事・ロボット・自動運転
原文を読む
重大arXiv - Cryptography and Security

Silent Sabotage: Internal State Triggered Backdoor Attacks on LLM-Powered Robotic Systems

サイレント・サボタージュ:LLM搭載ロボットシステムに対する内部状態によって引き起こされるバックドア攻撃

arXiv:2609.26184v1 発表種別:cross 要旨:大規模言語モデル(LLM)をロボット制御システムに統合することで、複雑な推論や計画が可能な新世代の自律エージェントの実現が可能となっている。このパラダイムシフトは進歩を加速させる一方で、まだほとんど解明されていない新たなセキュリティリスクももたらしている。 LLMのバックドアに関するこれまでの研究は、特定の単語、視覚的対象、あるいは環境状態といった外部刺激によって引き起こされる攻撃に焦点を当ててきた。これらの攻撃は強力ではあるものの、エージェント自身の動作ロジック内部にトリガーが存在する、より潜伏性の高い脆弱性の種類を見落としている。 本論文では、LLMを活用したロボットシステムに対する履歴ベースのバックドア攻撃に関する初の包括的な研究を提示する。我々は、攻撃者がLLMベースのロボットコントローラの指令を操作することで、ステルス性の高いバックドアを埋め込むことができることを実証する。 このバックドアは、外部からの合図ではなく、ロボット自身の過去の行動における特定の、かつ稀なシーケンスによってトリガーされる。通常動作中は休眠状態を保ち、ロボットの有用性を維持するが、活性化されると完全停止や衝突といった悪意のある動作を引き起こす可能性がある。我々の実験では……

AIモデルの暴走的挙動軍事・ロボット・自動運転
原文を読む
重要arXiv - Cryptography and Security

Defusing Explosive Prompts: Understanding and Preventing Trigger-Based Prompt Injections in LLM Agents

爆発的なプロンプトの無力化:LLMエージェントにおけるトリガーベースのプロンプト注入の理解と防止

arXiv:2609.22510v1 発表種別:新規 要旨: LLM(大規模言語モデル)アプリケーションが外部ツールと統合されるにつれ、取得したコンテンツに敵対的な指示が埋め込まれる「間接プロンプト注入(IPI)」の脅威にさらされるケースが増加している。従来のIPIは接触と同時に発動する。つまり、エージェントがコンテンツを取り込んだ瞬間に、その指示が実行されてしまう。 我々は「爆発型プロンプト」を導入する。これは、攻撃者が指定したトリガーが満たされるまで休眠状態を維持する条件付きペイロードであり、実質的に、単一の取得コンテンツ内に埋め込まれた、学習不要の推論時バックドアである。この時間的な分離により、通常のIPIでは到達できない領域にまで到達することが可能となる。 単純な命令形式をほぼ完全に拒否する最先端モデルにおいても、同じ目標を休眠状態の条件付き形式に言い換えることで、稼働中のエージェントバックエンドに対して、状態を変更する実際のツール実行を実現できる(命令形式とのペア平均で16.5%対2.4%、独自開発モデルでは34.2%に達する)。 9つの実用エージェント(OpenAI Codex、Google Gemini CLI、Anthropic Claude Code CLI、Cursor CLI、GitHub Copilot、Devin AI CLI、Amazon Kiro CLI、Qwen Code、Google Assistant; 各30件)、爆発的プロンプトは43~83%のケースで成功を収めたのに対し、命令型ベースラインでは最大3%にとどまり、それらは…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Beyond Single-Model Injection: A Threat Model and Defense Architecture for Prompt Injection in Multi-Agent Systems

単一モデルへのインジェクションを超えて:マルチエージェントシステムにおけるプロンプトインジェクションに対する脅威モデルと防御アーキテクチャ

arXiv:2609.22949v1 発表種別:新規 要約:既存のプロンプト注入に関する研究は、攻撃者が巧妙に作成された入力を通じて単一のLLMを操作する、単一モデルチャットボットのシナリオに焦点を当てている。 マルチエージェントシステムでは、単一モデル環境には存在しない3つのメカニズムを通じて、この脅威が増幅される。すなわち、エージェント間のメッセージ伝達により境界防御では検知できないインジェクション経路が生成され、ツールの共有アクセスによりエージェントの境界を越えた権限昇格が可能となり、信頼の伝播により侵害されたエージェントが上流のオーケストレーターに影響を及ぼすことが可能となる。 我々は、4つのカテゴリーにわたる14の攻撃ベクトルを列挙した脅威モデルを構築した。それらは、ユーザー入力を介した直接注入(3ベクトル)、ツール出力を介した間接注入(4ベクトル)、メッセージパッシングを介したエージェント間注入(4ベクトル)、およびオーケストレーターの操作によるカスケード注入(3ベクトル)である。 本番環境を代表する6つのエージェントからなるシステムに対し、これら14のベクトルすべてをテストした結果、システムプロンプトレベルのガードレールが導入されている場合でも、エージェントの67%が少なくとも1つのスコープ違反に対して脆弱であり、ツールの出力による間接的なインジェクションは試行の43%で成功することが判明した。 4つのアーキテクチャ上の防御策により、インジェクションの全体的な成功率は31.2%から4.2%に低下した。具体的には、p…を用いたメッセージ署名…

権限逸脱AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

Decoding Guardrails: XAI-Guided Perturbation Analysis of Prompt Injection Detection

ガードレールの解読:XAIに基づくプロンプト注入検出の摂動解析

arXiv:2609.24801v1 発表種別:新規 概要:大規模言語モデル(LLM)は本番システムへの導入が進んでおり、プロンプト注入やジェイルブレイク攻撃による敵対的操作への脆弱性に対する懸念が高まっている。 Prompt Guard 2 のような分類器ベースのガードレールは、こうした攻撃に対する第一の防衛線として広く利用されているが、その内部の意思決定ロジックは、防御側にとっても攻撃側にとっても、大部分が不透明である。 本論文では、説明可能な人工知能(XAI)の手法を用いて、Prompt Guard 2が悪意のあるプロンプトと無害なプロンプトをどのように区別しているかを分析する探索的なケーススタディを提示する。この疑問を実証的に検証するために、4つの実験を実施した。Vanilla GradientおよびSHAPアトリビューションを指針として、 Prompt Guard 2の判断は、少数の支配的なトークンではなく、多数のトークンの累積的な寄与に依存していることが判明した。しかし、顕著性に基づく同義語置換や文レベルの言い換えを行うことで、テキストのほんの一部を変更するだけでその予測を覆すことができ、場合によっては基盤となるLLMに対する脱獄に成功することもある。 さらに、データセット規模での顕著性分析により、検出されなかったインジェクションプロンプトには体系的に…が欠けていることが示された。

権限逸脱AIモデルの暴走的挙動
原文を読む
重要Dark Reading

How AI Agents Can Trigger Runaway Costs for Enterprises

AIエージェントが企業にどうコストの暴走を招くか

「無制限の消費」は、OWASPが現在「LLMアプリケーションのトップ10」で第6位にランク付けしている問題であり、極めて多大なコストを招く恐れがあります。

制御不能・停止不能
原文を読む
重要arXiv - Cryptography and Security

Runtime Authorization for Resources Acquired by AI Agents

AIエージェントが取得したリソースに対する実行時認証

arXiv:2609.14744v2 発表タイプ:replace-cross 要約:自律型AIエージェントは、計算リソース、認証情報、アカウント、サービス、およびその他のエージェントを取得することで、タスクに新たな権限を導入することができる。 支払い、予算、OAuth、委任、および履行チェックは、返されたリソースが利用可能な権限となり得るかどうかを判断することなく、トランザクションの条件を検証できる。この履行後のアクティベーションのギャップは、ツールを介した作成、エージェント間の委任、およびエージェント間の商取引にまたがっている。 我々は、来歴に制限されたランタイム認証アーキテクチャを提案する。このアーキテクチャは、取得された出力を隔離し、バージョン管理されたリゾルバを通じて認証済みプロバイダの証拠からその実際の機能を解決し、解決されたマニフェスト、来歴、エポック、および型付きリソース・機能ハイパーグラフ上の下方向閉じた関係エンベロープをチェックする現在のアクティベーション・トランザクションを通じてのみ、それらを有効化する。 このエンベロープは、相関する識別子、効果、データ、委任、およびグラフ全体の制限を保持する。単回使用の効果許可は、効果の線形化時に再検証され、消費される。明示的な仮定の下で、我々は、隔離、バッキング、非増幅、分割非回避、クラッシュ/リトライ、再…

データ漏洩
原文を読む
重要The Hacker News

Microsoft Patches CVSS 10.0 Azure AI Foundry Flaw Enabling Unauthorized Privilege Escalation

マイクロソフト、CVSS 10.0 の Azure AI Foundry の脆弱性に対するパッチを公開。この脆弱性を悪用すると、権限の不正な昇格が可能となる。

マイクロソフトは、Azure AI Foundry に存在する「最大深刻度」のセキュリティ脆弱性に対する修正プログラムを公開しました。この脆弱性は、権限昇格に悪用される可能性があります。 お客様による対応は不要です。CVE-2026-85889として追跡されているこの脆弱性のCVSSスコアは10.0です。「Azure AI Foundryの重要な機能における認証の欠如により、権限のない攻撃者がネットワークを介して特権を昇格させることが可能になる」

権限逸脱意図しない外部アクセス
原文を読む
重要SecurityWeek

Microsoft Patches 18 Vulnerabilities in AI, Cloud Products

マイクロソフト、AIおよびクラウド製品における18件の脆弱性にパッチを適用

マイクロソフトは、AzureおよびAIブランドの製品に存在する脆弱性を修正しました。その大半は権限昇格の脆弱性でした。「マイクロソフト、AIおよびクラウド製品における18件の脆弱性にパッチを適用」という記事は、SecurityWeekで最初に掲載されました。

重要BleepingComputer

OpenAI details more cases of AI agents taking unauthorized actions

OpenAI、AIエージェントによる不正な行動の事例をさらに詳細に明らかに

OpenAIは、過去6か月間に発生した、同社が「AIモデルのミスマッチ」と呼ぶ現象の新たな事例を提示した。これには、無断でのファイルアップロード、AI自身が生成した指示の遵守、誤りの隠蔽、および公開されたAPIキーの悪用などが含まれる。[...]

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Trust propagation and structural containment in Multi-agent LLM pipelines

マルチエージェントLLMパイプラインにおける信頼性の伝播と構造的封じ込め

arXiv:2609.17648v1 発表種別:新規 要約:マルチエージェントLLMシステムでは、異なる権限レベルを持つエージェントが関与するタスクの自動化が進んでおり、これにより、侵害された低権限エージェントがより高い権限を持つエージェントに影響を与え、不正なアクションを引き起こすというセキュリティリスクが生じている。 本研究では、スーパーバイザー、リサーチャー、バリデーター、エグゼキューターから構成される4エージェントのLangGraphパイプラインにおける攻撃の伝播を調査する。共有メモリの汚染および、取得された文書に埋め込まれた偽造承認を通じた間接的なプロンプト注入について評価を行う。 Validatorの判定を、タスク固有の署名付きトークンと個別に検証されたポリシーオラクルを用いた独立した認可レイヤーと比較した。本研究の貢献は、攻撃の伝播に関する実証的研究、認可境界のコンポーネントレベルでのアブレーション解析、および最終的なアクションではなく攻撃を受けたエージェントレベルでの侵害を測定する「判定バイパス率(JBR)」の提案である。 3つのシードと60のラベル付きタスクにおいて、防御措置が講じられていないすべての試行で、メモリポイズニングが実行段階に達した。認可機能を有効にした場合、JBRは100%に達したが、非安全アクション率は0%であり、実行が封じ込められている間もバリデータが侵害された状態を維持し得ることが示された。対して…

重要arXiv - Cryptography and Security

The Verifiable Action Card: Trustworthy Human-in-the-Loop Control for Secure Autonomous Agents

「検証可能なアクションカード:安全な自律エージェントのための信頼性の高いヒューマン・イン・ザ・ループ制御」

arXiv:2609.18411v1 発表種別:新規 要旨: エージェント型ブラウザは、ユーザーの認証済みセッション下でセキュリティ上重要なアクションを実行できるため、間接的なプロンプト注入や欺瞞的な確認インターフェースは、アクションの完全性に対する直接的な脅威となります。承認プロンプト自体が、信頼できないページコンテンツやモデル生成テキストによって影響を受ける可能性がある場合、既存のヒューマン・イン・ザ・ループ(HITL)による安全対策では不十分です。 本稿では、\emph{検証可能アクションカード}(VAC)を提案する。これは、ブラウザの保留中のアクションに関するグラウンド・トゥルースと、信頼できる意図のプロヴェナンスから承認情報を再構築し、それを信頼できるブラウザのクロム上でアウト・オブ・バンドでレンダリングし、ディスパッチ時に再検証された正確なアクションに承認を紐付けるアーキテクチャ的な防御策である。 VACは、プロバンス・フェンシング、真のブラウザアクション記述子、デフォルト拒否型確認、プロバンスを考慮したリスクゲート、および実行バインディングを組み合わせたものである。 我々は、完全なエージェント型ブラウザにVACを実装し、コンフューズド・デピュティ攻撃、Lies-in-the-Loopダイアログ偽造、間接プロンプト注入、適応型アクション置換、プロバンス回避、および正当なタスクを網羅する24のシナリオからなるベンチマークで評価を行った。 評価対象のLLM全体において、VACがない場合の攻撃成功率は$68\%$から…

重要arXiv - Cryptography and Security

AgentLSD: Evaluating AI Security Agents Under Adversarial Task Contamination

AgentLSD:敵対的タスク汚染下におけるAIセキュリティエージェントの評価

arXiv:2609.19140v1 発表種別:新規 要約:セキュリティ分野におけるAIエージェントは、ウェブページ、ソースコード、ログ、設定ファイル、およびコマンドの出力を検査する。これらの環境には、エージェントの挙動に影響を与える欺瞞的なアーティファクトが含まれている可能性がある。 我々は、この敵対的タスクを「タスク汚染」と呼ぶ。プロンプト注入が攻撃者によって提供された指示に依存するのに対し、タスク汚染には、偽の結果や囮エンドポイントといった、指示以外の証拠も含まれる。本稿では、敵対的タスク汚染を研究するための制御されたフレームワーク「AgentLSD」を提案する。AgentLSDは、実験環境としてキャプチャー・ザ・フラッグ(CTF)チャレンジを採用している。 意図されたCTFの解答を保持しつつ、偽のフラグ、誤解を招くヒント、おとりエンドポイント、隠された手がかりといったトラップアーティファクトを注入する。このフレームワークは、決定論的なトラップ生成、実行時注入、テレメトリ、および配信検証機能を備え、クリーンな実験とトラップが追加された実験のペアを同時に実行できる。 11のWeb CTFチャレンジにおいて、6つのモデルを評価した。クリーンな条件下では、エージェントはフラグの41%を獲得したが、すべてのチャレンジを解いたモデルはなかった。次に、タスク汚染の影響を測定した。エージェントがフラグを獲得できた場合でも、トラップの存在によりターン数が増加した…

重要WIRED - AI

An OpenAI Agent Tried to Jailbreak Itself

OpenAIのエージェントが、自らを「脱獄」しようとした

同社はまた、AIモデルが意図に反した動作をした、これまで報告されていなかった事案についても明らかにした。その中には、指示がないにもかかわらずインターネット上にファイルをアップロードした事例も含まれている。

権限逸脱AIモデルの暴走的挙動
原文を読む
重要Dark Reading

BragJack Attack Can Turn a Browser's Agentic AI Against It

「BragJack」攻撃は、ブラウザに組み込まれたエージェント型AIを逆手に取る可能性がある

ある新しい手口の攻撃では、さまざまなブラウザに直接組み込まれているAIアシスタントを乗っ取り、機密情報へのアクセス、悪意のある動作の実行、データの持ち出しを行う。

データ漏洩
原文を読む
重大SecurityWeek

First Agentic AI Data Breach Reported to Spanish Regulator

スペインの規制当局に報告された初のエージェンティックAIによるデータ漏洩

スペインの規制当局によると、あるAIエージェントが、ログインの成功、脆弱性の発見、個人データへのアクセスを一連のプロセスとして結びつけたことが判明しており、これは自律型サイバー攻撃における画期的な出来事となる可能性があるという。記事「スペインの規制当局に報告された初のエージェント型AIによるデータ漏洩」は、SecurityWeekで最初に掲載された。

データ漏洩意図しない外部アクセス
原文を読む
重要arXiv - Artificial Intelligence

Trustworthy Agentic AI: A Comprehensive Cybersecurity and Systems Survey on Threat Landscapes, Defense Architectures, and Open Challenges

信頼性の高いエージェント型AI:脅威の全体像、防御アーキテクチャ、および未解決の課題に関するサイバーセキュリティおよびシステムに関する包括的な調査

arXiv:2609.13731v1 発表タイプ:新規 要旨:受動的な基盤モデルから、自律的で目標指向型のエージェント型AIシステムへの移行により、再帰的な認知推論ループ、永続的なメモリアーキテクチャ、ライブツール実行プレーン、およびマルチエージェント協調トポロジーを組み合わせることで、これまでにない機能がもたらされた。 しかし、確率的ニューラルコアにファイルシステム、ネットワーク、クラウドインフラストラクチャにわたる実行権限を付与することは、従来のセキュリティ境界を崩壊させる。自然言語は入力データ、内部制御コード、通信プロトコルの役割を同時に果たすため、信頼できないデータが実行可能な命令となるチューリング完全な影響範囲が露呈される。 本調査では、206件の基礎的研究と規制基準を統合し、信頼性の高いエージェント型AIのための包括的なシステムセキュリティ参照フレームワークを提示する。我々は、一般的なエージェントアーキテクチャをステートフルな5タプルとして形式化し、セキュリティ、安全性、プライバシー、説明可能性、公平性、説明責任を網羅する6次元の信頼性分類法を確立する。 実行ループ内および相互作用平面にわたる脅威表面を体系的に分析し、多層的なゼロトラスト…

意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

DriftNet: A Dual-Head Trajectory Transformer for Detecting and Localizing Prompt Injection in LLM Agents

DriftNet:LLMエージェントにおけるプロンプト注入の検出と位置特定のためのデュアルヘッド軌跡トランスフォーマー

arXiv:2609.10892v1 発表タイプ:新規 要旨:LLMエージェントに対して間接的なプロンプト注入が成功した場合、その侵害はエージェント自身の挙動に現れる。具体的には、ツール呼び出しという無害なプレフィックス、改ざんされた観察結果、そして攻撃者の意図に沿ったアクションのサフィックスである。 オペレーターには、攻撃がどこから侵入したか、どのステップが改ざんされたか、そして明らかな改ざんが阻止されたかどうかという3つの事実が必要となる。既存のシステムは、トレース全体の判定か、単一の安全でないインデックスのいずれかを返すだけである。 我々は、DriftNetを提案する。これは、記録されたツール呼び出しの軌跡を読み取り、1回のフォワードパスでこれら3つの質問すべてに答えるデュアルヘッドの軌跡トランスフォーマーである。1つのヘッドは軌跡が侵害されているかどうかを分類し、もう1つのヘッドは各ステップに4つのラベル(無害、注入ポイント、乗っ取り、注入失敗)のいずれかを割り当てる。 我々の知る限り、このような統合的な出力を生成する教師あり検出器はこれが初めてである。凍結されたセンテンスエンコーダと4つのアイデンティティフリーなワールド特徴量が各ステップを埋め込み、200万パラメータ未満で、両ヘッドにわたるクラス加重の共同目的関数によって最適化されたトレーニング済みトランクは、エージェントのモデルへのアクセスを必要としない。 AgentDriftベンチマークのタスク非交差分割(12,536の軌跡、71,024のラベル…

重要arXiv - Cryptography and Security

A2ABreak: Systematic Security Analysis of the A2A Protocol

A2ABreak:A2Aプロトコルの体系的なセキュリティ分析

arXiv:2609.10871v1 発表種別:新規 要約:現在Linux Foundationが管理するAgent2Agent(A2A)プロトコルは、自律型AIエージェントが組織の境界を越えて相互に発見・認証を行い、タスクを委任することを可能にするオープンスタンダードである。 ツール統合のためのModel Context Protocol(MCP)を補完するように設計されたA2Aは、マルチエージェント・エコシステムの水平通信層として急速に台頭している。しかし、このプロトコルのセキュリティについては、これまで体系的な分析が行われてこなかった。本論文では、A2Aプロトコルに対する初の厳密かつ体系的なセキュリティ分析である「A2ABreak」を提示する。 我々は、LLM(大規模言語モデル)を活用して自然言語仕様から直接検証済みの有限状態機械を抽出する新しいフレームワークを導入し、929の形式化された記述から37の状態と76の遷移からなる統一モデルを生成し、 さらに、このモデルに対して体系的な推論を行い、完全準拠という仮定の下で、敵対的検証を通じてプロトコルレベルの脆弱性を発見する。本分析により、11件の新たな脆弱性が明らかになった。これらはすべて、実装上の欠陥を必要とせず、仕様に準拠した攻撃者によって悪用可能である。発見された脆弱性の中には、クライアント間の…

意図しない外部アクセス
原文を読む
重要The Hacker News

Anthropic Discloses Fourth AI Hacking Incident Involving Claude Opus 4.6

Anthropic、Claude Opus 4.6に関連する4件目のAIハッキング事案を公表

Anthropicは水曜日、同社の人工知能(AI)モデルが第三者の実システムに侵入した4件目の事案を公表した。これは、自律型AIエージェントがもたらすセキュリティリスクに対する懸念を高めている一連の事例の中で、最新の事例となる。 同社によると、この事案は2026年1月に発生したもので、「Claude Opus 4.6」の初期バージョンが「

意図しない外部アクセス
原文を読む
重要WIRED - AI

I Let an AI Agent Hack All My Gadgets—and I’d Do It Again

AIエージェントに自分のガジェットをすべてハッキングさせた――そして、また同じことをするだろう

高性能なオープンソースモデルの安全対策を取り除いたところ、そのモデルは私の家庭用デバイスに脆弱性を見つけ出し、PCに侵入しました。しかし、そのモデルは、すべてをより安全にする方法も教えてくれました。

意図しない外部アクセス
原文を読む
重要The Hacker News

Autonomous AI Agents Compromise Thousands of Credentials in Under Six Hours

自律型AIエージェントが6時間足らずで数千件の認証情報を流出させた

脅威アクターは、活動の効率化を図るため人工知能(AI)を活用し続けており、ある金銭目的のハッカーグループは、自律型のマルチエージェント攻撃フレームワークを用いて、わずか6時間以内に大規模な認証情報収集キャンペーンを実行した。Google Threat Intelligence Group(GTIG)は、さまざまな動機を持つ攻撃者が独自開発のAIを標的にしていることを確認したと述べた。

意図しない外部アクセスデータ漏洩
原文を読む
重要BleepingComputer

OpenAI admits it didn't disclose rogue AI wiki hijacking incident

OpenAIは、不正なAIによるウィキ乗っ取り事件について公表していなかったことを認めた

OpenAIは、自律型AIエージェントがドイツのウィキサイトを乗っ取り、1万8000件の投稿を作成し、回答を共有し、制限を回避した事案について、これをセキュリティ侵害ではなくモデルの「不整合」として扱ったため、公表しなかったことを認めた。[...]

AIモデルの暴走的挙動
原文を読む
重大WIRED - AI

OpenAI Agents Hacked Another Website

OpenAIのエージェントが別のウェブサイトをハッキングした

さらに:ダークウェブ上で、米国とカナダの運転免許証が数千万件も売り出されているほか、米軍がついにオンライン広告データが兵士にもたらすリスクへの対策に乗り出したことなど、その他のニュースも。

意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

緩和策を伴わない認識:自律型攻撃型LLMエージェント研究における倫理的枠組み

arXiv:2506.08693v4 発表種別:replace 要旨:大規模言語モデルは、攻撃的セキュリティに関する助言を行う段階から、それを自律的に実行する段階へと移行している。実在または模擬の標的に対して、偵察、エクスプロイト、権限昇格を実行するエージェントに関する研究がますます増えている。 このようなエージェントは、展開可能かつ標的を変更可能な機能であり、悪意のある攻撃者が同意のない第三者に対して悪用する可能性がある。したがって、これらのプロトタイプを紹介する論文には倫理的責任が伴い、主要なセキュリティ学会は2026年の倫理指針において、これを厳格な方針として明文化し始めている。 本稿では、査読付き学会誌およびプレプリントから収集した、自律型攻撃的LLMによる侵入テストプロトタイプ(2023年~2026年)を記述する54編の論文に基づき、倫理報告に関する体系的な監査結果を提示する。 各論文を、メンロー・レポートからトップダウンで導き出された指標と、2026年のセキュリティ学会の倫理指針からボトムアップで導き出された指標を組み合わせた11次元の評価尺度に基づいて採点した。 我々の中心的な結果は、「認識あり・緩和策なし」というギャップである。57%の論文でデュアルユースのリスクが認識されていると報告されているが、具体的な緩和策が報告されているのはわずか15%であり、およそ4対1のギャップがある。セーフガードは一般的に実験自体を保護するものであり、…を保護するものではない。

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Measuring Harmfulness of Computer-Using Agents

コンピュータを利用するエージェントの有害性の測定

arXiv:2508.00935v3 発表種別:置換 要旨:コンピュータを自律的に制御して多段階のアクションを実行できるコンピュータ利用エージェント(CUA)は、悪用された場合、重大な安全上のリスクをもたらす可能性がある。 しかし、既存のベンチマークは主に、チャットボットや単純なツール使用における言語モデル(LM)の評価に重点を置いている。CUAの悪用リスクをより包括的に評価するため、我々は新たなベンチマーク「CUAHarm」を導入する。CUAHarmは、ファイアウォールの無効化、データの漏洩、バックドアのインストールなど、専門家が作成した104件の現実的な悪用リスクで構成されている。 我々は、拒否率にとどまらず、これらのタスクの実行成功率(例:ファイアウォールが実際に無効化されたかどうか)を測定するために、ルールベースの検証可能な報酬を備えたサンドボックスを提供する。 GPT-5、Claude 4 Sonnet、Gemini 2.5 Pro、Llama-3.3-70B、Mistral Large 2 を含む最先端の言語モデルを評価した。 ジェイルブレイクを誘導するプロンプトがなくても、これらの最先端LMは、高い成功率でこれらの悪意のあるタスクを実行することに応じています(例:Gemini 2.5 Proでは90%)。 さらに、以前の安全性ベンチマークでは新しいモデルほど安全であるものの、CUAとしての悪用リスクはさらに高くなっており、例えばGemini 2.5 ProはGemini 1.5 Proよりもリスクが高い。また、これらのLMは一般的な悪意のあるプロンプトに対しては堅牢であるが(例…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Context Inference Attacks Without Jailbreaks

ジェイルブレイクを必要としないコンテキスト推論攻撃

arXiv:2609.01663v1 発表種別: 新規 要約: エージェント型AIシステムは、推論時に、医療記録や金融文書など、システムが回答する前に隠された\emph{コンテキスト}として組み合わされた機密データを処理するために、ますます導入されている。 先行研究では、主にモデルに機密コンテンツを直接開示させる\emph{ジェイルブレイク}攻撃を通じてプライバシーリスクが検討されてきたが、コンテキストがエージェント自身のツール呼び出しによって組み立てられるエージェント型設定については、ほとんど見過ごされてきた。 我々は、評価対象のエージェントが、コンテキストを開示しないよう指示する、ロジット抑制、コンテキスト希釈といった、テスト対象とした制御措置を講じているにもかかわらず、隠されたコンテキストの漏洩に対して依然として脆弱であることを示す。例えば、無害なユーザークエリに応答するウェブブラウジングエージェントでさえ、そのコンテキストに密かに読み込まれた記録に関する悪用可能なシグナルを依然として保持している。 我々は、セキュリティゲームを通じて\emph{コンテキスト推論攻撃}を導入・形式化し、攻撃者の知識が減少するにつれてコンテキストの伝達がますます間接的になる3つの設定(既知のコンテキスト、未知のコンテキスト、およびエージェントが自身のツール呼び出しを通じて取得するコンテキスト)を評価する。我々は、グレーボックス設定を区別し、…

権限逸脱意図しない外部アクセスデータ漏洩
原文を読む
重要arXiv - Cryptography and Security

Delegation Without Trust: An Empirical Gap Analysis of Identity, Authorization, and Runtime Governance in Multi-Agent LLM Systems

信頼を伴わない委任:マルチエージェントLLMシステムにおけるアイデンティティ、認可、および実行時ガバナンスに関する実証的ギャップ分析

arXiv:2609.00267v1 発表種別:新規 要約:自律型LLMエージェントは、ユーザーに代わって行動するケースが増えている。具体的には、認証情報を保持し、ツールやサービスを呼び出し、さらにユーザーに代わって行動するサブエージェントを生成する。 これにより、長年にわたる分散システムの課題――「誰が、誰の権限の下で、何を行う権限を持っているか」――が、緊急かつほとんど未解決の問題へと変化している。なぜなら、各エージェントを駆動するコンポーネントは、攻撃者が乗っ取ることができる言語モデルだからである。 我々は、エージェントのセキュリティは「信頼できないモデル」という仮定の下で評価されなければならないと主張する。すなわち、正しいシステムとは、プロンプトが完全に注入されたエージェントであっても、明示的に委任された権限を超えることができないシステムである。 この基準に基づき、我々は3つの貢献を行う。第一に、4つの攻撃者(「混乱した代理人」、「トークンの盗難とリプレイ」、「プロンプト注入による権限昇格」、「侵害されたサブエージェント」)を中心としたマルチエージェント委任の脅威モデルを提示し、管理対象のエージェントシステムが満たすべき8つのセキュリティ要件を導出する。 第二に、このギャップが現実のものであることを示す。一般的な慣行(広範なベアラー認証情報、モデル内部での認可ゲート)をモデル化したデフォルトのエージェントランタイムは、これら4つの脅威すべてに対して失敗し、広く使用されている4つのフレームワーク――L…

権限逸脱データ漏洩
原文を読む
重要arXiv - Cryptography and Security

What's in Your Agent's Context? Context Privilege Escalation Attacks against AI Agent Harness

エージェントのコンテキストには何が含まれているのか? AIエージェント「Harness」に対するコンテキストを利用した権限昇格攻撃

arXiv:2609.01222v1 発表種別:新規 要約:実世界における注目度の高いAIエージェントのハーネスは、コンテキストの組み立てにおいてベンダー独自の、あるいは不透明な設計に依存していることが多く、その結果、組み立てられたコンテキストの出典や根底にあるロジックが十分に理解されておらず、それに伴うセキュリティリスクもほとんど調査されていない。 本論文では、実世界のAIエージェントハネスにおけるコンテキストアセンブリ設計について、初の体系的な分析を提示する。エージェントハネスが、多様なソースからコンテキストを収集・アセンブルするようにどのように設計されているかを調査・解明し、これらの設計に起因する一連の実用的な攻撃ベクトルを特定する。 本分析により、実世界のハネスにおけるコンテキスト構築において、2つの新たな攻撃カテゴリが明らかになった。(1) MessageRoleコンテキスト特権昇格(M-CPE)。これは、低特権のコンテキストに由来する攻撃者制御のコンテンツが、より高い特権を持つメッセージロールに組み込まれる際に発生する。 (2) クロススコープ・コンテキスト特権昇格(X-CPE)。これは、攻撃者が制御するコンテンツが、それが導入されたコンテキストを超えて存続する場合に発生する。我々は、Claude CodeやCodexを含む12の実世界のエージェント・ハーネスを対象に、CPE攻撃に対する体系的なセキュリティ分析を実施した。その…

重大BleepingComputer

Critical Langflow flaw exploited to steal OpenAI and AWS keys

Langflowの重大な脆弱性が悪用され、OpenAIおよびAWSの認証情報が盗まれた

攻撃者は、AIアプリケーションを構築するためのオープンソースフレームワークであるLangflowに存在する、認証不要のリモートコード実行の脆弱性(CVE-2026-0768)を悪用し、認証情報、トークン、および鍵を盗み出しています。[...]

意図しない外部アクセスデータ漏洩
原文を読む
重大arXiv - Cryptography and Security

SIR: Self-improving Red-teaming for Compute Use Agents

編集部様:コンピュート利用エージェントのための自己改善型レッドチームング

arXiv:2608.30207v1 発表種別:新規 要約:コンピュータ利用エージェント(CUA)は、画面を認識し、マウス、キーボード、ターミナルを通じて実際のオペレーティングシステム上で動作する視覚・言語モデルであり、日常的なデジタルタスクの自動化のためにますます導入が進んでいる。 動作中に信頼できないコンテンツにさらされる可能性があるため、CUAは間接プロンプト注入(IPI)に対して脆弱である。IPIとは、攻撃者がエージェントが読み取るコンテンツに指示を埋め込み、ユーザーの意図に反する行動へと誘導する攻撃手法である。 既存の CUA 安全性ベンチマークは、手作業で記述された固定の注入を評価するものであり、適応型攻撃者によるリスクを過小評価している可能性がある。 我々は、SIRというブラックボックス型のIPI攻撃手法を提案する。これは、(i)平易な言語で記述された再利用可能な原則の小さなライブラリからステルス性の高いインジェクションを構成し、(ii)その構成を反復的なフィードバックループで包み込み、被害者の失敗した軌跡を診断し、その迂回手法を新しい命名済み戦略に凝縮して、タスク全体に再適用するものである。 従来のWebエージェントに対するレッドチーム攻撃とは異なり、我々はOSレベルでCUAを標的とし、ファイルシステム、サービス、および権限ステータスのチェックを用いて、完全に決定論的なオラクルで攻撃を評価する…

権限逸脱意図しない外部アクセス虚偽判断の連鎖
原文を読む
重要arXiv - Cryptography and Security

Zero-Knowledge Predicate Proofs Between AI Agents: A Measured, Cross-Protocol Gateway and the Source-Integrity Gap

AIエージェント間のゼロ知識述語証明:実証済みのプロトコル横断型ゲートウェイとソース完全性のギャップ

arXiv:2608.30083v1 発表種別:新規 概要: マルチエージェントAIプラットフォームは、ステージング環境から本番環境へと急速に移行していますが、エージェント間の信頼構築の方法は依然として初歩的な段階にとどまっています。具体的には、エージェントが未加工のデータをピアに送信するか、あるいはそのピアから「値がポリシーに準拠している」という自然言語による自己申告を受け入れるかのいずれかです。前者は情報を過剰に共有し、後者は検証不可能であり、まさにプロンプト注入攻撃の温床となっています。 一般的な対応策は、身元確認、可視性、事後検知に重点を置いており、暗号技術によって強制されるエージェントポリシーに関する最近の提案も、実行環境ではなくシミュレーションで評価されてきた。我々は、エージェント間の「証明可能なデータ最小化」を、提案段階から稼働システムへと発展させる。 我々の「ゼロ知識証明ゲートウェイ」では、エージェントはデータそのものではなく、ガバナンスで定義された述語に関する証明をプライベートデータについて交換するため、事後の検出ではなく設計上、情報の漏洩が防止される。このような証明を伝送できる相互運用プロトコルは存在しないため、我々はスロットを提案し、単一のエンドポイントからMCPおよびAgent2Agentの両方に実装した。 32ビットのしきい値述語は、汎用vCPU 1つ上で、608バイトのBulletproofs証明を用いて、証明に6.2ミリ秒、検証に1.0ミリ秒を要する。11件の敵対的実験および…

権限逸脱データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Attesting Outputs and Delegation Ancestry in Multi-Agent AI Systems

マルチエージェントAIシステムにおける出力の検証と委譲の系譜

arXiv:2608.30387v1 発表種別:新規 要旨:マルチエージェントアプリケーションは、独立して運用されるデプロイヤー間で作業を委任する。インシデント発生後、検証者は2つの質問に答えなければならない。すなわち、報告されたバイトをリリースしたのはどのデプロイヤーか、そして各デプロイヤー間のエッジが承認されていたかどうかである。 認証情報は誰が行動できるかを確立するが、それを後の出力バイトに紐付ける必要はなく、また、動的に作成されたエッジを両方のデプロイヤーが承認したことを証明する必要もない。本稿では、共有権限、公開ログ、または事前決定されたワークフローを必要としない、動的な委任のための2層型証明設計を提案する。 信頼できるデプロイヤーランタイムは、リリースされた各出力のハッシュに署名する。これにより、リリースされたバイトは記録されるが、プロンプトの注入は防止されない。祖先証拠がエッジの承認を記録する。統一された脅威モデルの下で、署名付きリンクリスト、マークルチェーンの変種、および共同署名付きDAGを比較する。 プリミティブは標準的なものであるが、本研究の貢献は、デプロイヤー側のバインディングと、前述の2つの疑問を証明するために必要な証拠にある。子キーが侵害された後、単一署名者の設計では権限のない親によるバインディングが許容されるのに対し、共同署名されたDAGでは、親がエッジを承認しなければならないため、これを拒否する。固定された攻撃者行列と回帰テストにより、構成の妥当性が検証される…

権限逸脱データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Can escalation channels redirect reward hacking toward defect disclosure?

エスカレーションチャネルは、報酬目当てのハッキングを脆弱性の開示へと転換させることができるか?

arXiv:2608.29460v1 発表種別:cross 要約: コーディングエージェントが欠陥のあるテストインフラに遭遇すると、「報酬ハック」を行う可能性がある。つまり、正当な手段では満たせないテストに合格させるために、出力をハードコーディングしたりテストファイルを編集したりする行為である。このパターンは、ベンチマークの枠を超えて、主要なAIプラットフォームの本番インフラに対する協調的なマルチエージェントによる侵入において、実際に確認された。 エージェントが欠陥を検出して悪用するのと全く同じ能力が、適切な意思決定環境下であれば、欠陥を報告することにもつながり得る。本研究では、エスカレーションチャネル、すなわち対立が生じた時点でエージェントが利用できる構造化された報告ツールを、意思決定環境への介入手段として評価する。これにより、報酬ハックを削減すると同時に、それを引き起こすインフラの欠陥を明らかにすることを目指す。 $2 \times 2$ の因子設計により、エスカレーションツール、独立した報酬ハッキング対策ポリシー、およびそれらの組み合わせによる寄与を分離した。 5つのファミリーにまたがる8つの最先端モデルにおいて、この複合的な介入により、報酬ハッキングは23.6\%から5.3\%に減少した(混合効果ロジスティックオッズ比 = 9.2、95\%信頼区間 5.0--16.8、 $p < 10^{-12}$)に低減し、検出可能なコストやパフォーマンスのオーバーヘッドはなく、8つのモデルのうち6つでは報酬ハッキングを完全に排除した。エスカレーションとハッキングはほぼ完全に相互に…

意図しない外部アクセスAIモデルの暴走的挙動
原文を読む
← ニュース一覧へ戻る