Monthly Archive

2026年8月のニュース

掲載件数:51件

重要arXiv - Cryptography and Security

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

ケイトリン:LLMエージェントは、新たに台頭するインジェクション攻撃に対する防御策を自律的に構築できるのか?

arXiv:2608.27990v1 発表種別:新規 概要: 大規模言語モデル(LLM)エージェントに対するプロンプト注入攻撃は、エージェントが取得した外部テキストソースに悪意のある指示やコンテンツを混入させ、基盤となるLLMに本来許容される範囲外の有害な動作を強制的に実行させようとするものである。現在の防御策は既知の注入攻撃に対して効果的に対処しているものの、攻撃の亜種や新たな脅威の存在により、LLMエージェント環境への導入は依然として困難な課題となっている。 さらに、既存のソリューションは通常、実行効率、文脈的精度、適応性の間で絶えずトレードオフが生じるという本質的なトリレンマに悩まされている。このギャップを埋めるため、我々はエージェントに依存しない防御ミドルウェア「Continuous Agents for Injection Threats via Lifelong Yielding Nexus (CAITLYN)」を提案する。 CAITLYNは2つのシステムを統合している。システムIは、2層構造のライブラリを用いて既存の攻撃に対する即時防御に焦点を当てている。Tier-0はルールベースの検出スクリプト用、Tier-1は最適化されたLLMベースの高精度推論用である。 対照的に、システムIIは、潜在的な異常シグナルを監視し、新たな防御策の構築を試みるために展開される。標準的なベンチマークにおいて、CAITLYNは最先端技術と同等の検出性能を発揮する…

重要SecurityWeek

OpenAI Agents Exploited Linux Kernel Flaw on Company’s Own Systems

OpenAIのエージェントが、自社システム上のLinuxカーネルの脆弱性を悪用した

CISAは、悪用された脆弱性「CVE-2026-53362」を、OpenAIのエージェントによって悪用されたJFrogの脆弱性とともに、KEVカタログに追加しました。「OpenAIのエージェントが自社システム上でLinuxカーネルの脆弱性を悪用」という記事は、SecurityWeekで最初に掲載されました。

意図しない外部アクセス
原文を読む
重要arXiv - Artificial Intelligence

Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI

考えすぎず、考えなさすぎず:エージェント型AIにおける適応的推論に向けて

arXiv:2608.26442v1 発表種別:新規 要約:大規模言語モデル(LLM)における最近の進展により、推論時間の延長が複雑なタスクにおける性能向上につながるということが示されている。 しかし、既存のアプローチの多くは、固定されたトークン予算、実行前の難易度推定、活性化空間への介入など、固定的または事前に割り当てられた推論制御に依存しており、多くの場合、完全なエージェント型ワークフローではなく、独立した推論ベンチマーク上で評価されている。 これらの仮定は、計画、ツールの使用、記憶の検索、およびエージェント間の相互作用を通じて推論要件が動的に変化するエージェント型 AI システムでは成り立たない可能性がある。その結果、推論が過剰になったり不十分になったりし、不要な計算、レイテンシの増加、計画のずれ、過度なツールの使用、あるいは不完全な解決策につながる可能性がある。 我々は、次世代のエージェンティックAIにおける主要な課題は、言語モデルがどれだけの推論を行うべきかという点だけでなく、変化するタスクの要求に応じて推論をどのように配分すべきかという点にあると主張する。 本稿では、推論の過剰と不足を、推論の不適切な配分による繰り返し発生する失敗モードとして特徴づけ、MATH-500およびGAIAの公開検証データセットを用いて評価する…

意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

The Framing Gap: Indirect Prompt-Injection Exfiltration Defeats Surface-Level Defenses in Tool-Using Agents

「フレーミング・ギャップ」:間接的なプロンプト注入による情報漏洩が、ツールを使用するエージェントの表面レベルの防御を突破する

arXiv:2608.27092v1 発表種別:新規 要約: 秘密情報を保持しながら攻撃者が制御するWebコンテンツを読み取るツール使用型LLMエージェントは、間接的なプロンプト注入のリスクにさらされている。すなわち、そのコンテンツによって秘密情報が漏洩する可能性がある。安全な合成実験環境(カナリア秘密、模擬ツール、クリーン/汚染されたメトリクスの照合)において、我々は以下の「フレーミングギャップ」を報告する: 6つのモデルにおいて、10種類の明示的なインジェクションは拒否される(GPT-4o:0%)が、同一のリークを必須の整合性署名、設定フィールド、または類似した「信頼できる」ホストとして再構成すると、GPT-4oの拒否率は0%から100%に上昇する。 この攻撃は低コストであり、そのコストは3つのレベルに分かれる。既知のメカニズムを言い換えることは容易(3つの表現で96%)、既知の有効なテンプレート内のフィールドを置き換えることも低コスト(最大60%)である一方、新しいメカニズムに基づいて新規ページを作成することは困難である (0/130) — 再利用可能な資産はメカニズムではなく、テンプレートである。アブレーション分析によると、このメカニズムはアライメントの破綻ではなく、命令とデータの混同によるものであることが判明した。機密性ポリシーを削除すると、基本攻撃は0%となり、再構成による成功率は31.9%から38.1%にしか上昇しない。 この差を埋めるのが、ペイロードに依存しないチェックである。宛先許可リスト(宛先が閉鎖されている場合は0%)と、機能隔離を行うプランナー/リーダーの分割…

データ漏洩権限逸脱
原文を読む
重要arXiv - Cryptography and Security

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:経験に基づくスキルの進化を備えた自動レッドチームエージェント

arXiv:2608.27439v1 発表種別:新規 要約:LLMベースのエージェントは、製品レベルの実行環境においてますます導入が進んでいる。こうした環境では、脱獄(jailbreak)によって有害なツールの使用や永続的な状態変化が引き起こされ、単に安全でないテキストが生成される場合よりも大きなリスクが生じる。 既存の自動レッドチーム手法は、多くの場合、固定された攻撃に依存しているが、最近のエージェンティックな攻撃者は複数の脱獄ツールを連携させ、軌跡ベースの検索を通じてより強力な可能性を示している。しかし、このような検索では、検索バイアスやツールの寄与度の不明確さにより、誤解を招くような経験が再利用される可能性があり、完全な軌跡はコンテキストのオーバーヘッドを増大させると同時に、解釈可能性を低下させる。 そこで我々は、ケース横断的な攻撃軌跡を簡潔で人間が読み取り可能な「攻撃スキル」に蒸留するブラックボックス型レッドチームエージェント「RedEvoAgent」を提案する。この攻撃スキルは、ツールの有効性プロファイリングとスキル更新のための「決定ツール帰属(Deciding-Tool Attribution)」、および検証性能を向上させる更新のみを保持する検証ラチェットを通じて、適応的に進化する。 複数のベンチマーク、ターゲットモデル、およびターゲット実行ハーネスを用いた実験により、RedEvoAgentは固定型およびエージェント型のベースラインを上回る性能を示し、ツールの効率を向上させ、攻撃者モデル間での転移を実現することが示された…

権限逸脱意図しない外部アクセス
原文を読む
重要MIT Technology Review - AI

The inside story on why OpenAI agents hacked Hugging Face

OpenAIのエージェントがHugging Faceをハッキングした理由に関する裏話

本日公開されたOpenAIの技術報告書によると、先月Hugging Faceで発生したエージェントによるハッキング事件の原因となったモデルは、意図せず不正行為を行い、互いに通信するように学習されていたことが判明した。このハッキングは、あるエージェントのグループが、行き詰まっていたサイバーセキュリティテストの解決策を見つけるために行ったものであり、一部の専門家の…

意図しない外部アクセス
原文を読む
重要arXiv - Artificial Intelligence

Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors

セマンティック・オーバーレイ:トークンやステアリングベクトルを超えたアノテーションによるプロンプトインジェクションの軽減

arXiv:2608.23873v1 発表種別: 新規 概要: 言語モデルが認識するものはすべてトークンである。サービングスタックは各スパンが何であるか(ユーザー入力、ツール出力、指示など)を把握しているが、モデルはそれを自ら追跡しなければならず、追跡を見失ったり混乱したりする可能性がある。テキストは、あらゆる内容のように読めるように記述されることがあるからだ。 プロンプトインジェクションは、この現象を悪用した典型的な攻撃手法である。攻撃者は、スパン識別に関するモデルの理解を混乱させることで、望ましくない、あるいは潜在的に危険な行動を引き起こすことができる。モデルの入力に非テキストチャネル――テキスト以外でスパン識別情報を伝達する方法――を追加することで、この種の攻撃を軽減できる。 そこで我々は、「セマンティック・オーバーレイ(Semantic Overlays)」と呼ばれる汎用的なステアリング手法を提案する。これは、凍結モデルの残差ストリームに対し、選択されたプリフィル位置に適用される、学習済みの小さなアダプタである。スパンにオーバーレイを重ねることで、トークンでは再現できない帯域外のアノテーションチャネルが生成される。 ステアリングベクトルとは異なり、セマンティック・オーバーレイは学習済みで適応性があり、選択的に適用されます。オーバーレイは、モデルがマークされたスパンをどのように認識するかを再構築する複雑な意味論をエンコードすることができます。例えば、あるコードスニペットが、それとは異なるプログラミング言語で記述されていると主張するオーバーレイの下にあるコードスニペットをコピーするよう求められた場合…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers

TrustShiftProbe:MCPサーバーに対する段階的信頼攻撃の特性解析、ベンチマーク、および防御

arXiv:2608.23763v1 発表種別:新規 要約:モデルコンテキストプロトコル(MCP)は、大規模言語モデル(LLM)エージェントと外部ツールのバックエンドを接続する標準レイヤーとして登場した。 この開放性により、我々が「TrustShift」と呼ぶ深刻なサーバー側の脅威が生じる。これは、侵害されたMCPサーバーが、初期のコンディショニング段階では無害に振る舞い、運用上の信頼を築き、エージェントの懐疑心を抑え込んだ後、相互作用の閾値に達すると敵対的なペイロードに切り替えるというものである。 この回避手法は構文的なものではなく、時間的なものである。デプロイ時には無害に見えるため、デプロイ前の静的解析では、正常なフェーズしか検出できず、サーバーの背信行為を見逃してしまう。切り替えられるペイロードは、露骨な構造違反からスキーマに準拠した操作まで多岐にわたり、後者は外部プロトコルへの準拠を維持することで、実行時のミドルウェアフィルタを回避する。 重要な点として、TrustShiftは、ユーザーのプロンプト(間接的なプロンプト注入とは異なり)やトランスポート(中間者攻撃とは異なり)ではなく、サーバーが制御するツールチャネルに起因する。つまり、攻撃者は信頼されたサーバーエンドポイントそのものである。 我々は、4つの貢献を持つ評価および防御フレームワーク「TrustShiftProbe」を提案する:(1) エージェントとサーバーのライフサイクルに関するステートフルな時間的脅威モデル……

権限逸脱AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

Beyond OAuth: Task-Scoped Authorization for AI Agents via Natural Language Slices

OAuthを超えて:自然言語スライスを用いたAIエージェント向けのタスク範囲限定認証

arXiv:2603.17170v2 発表タイプ:置換 要旨: AIエージェントは、Webサービスを呼び出すことでユーザーの自然言語(NL)タスクを実行することがますます増えている。しかし、現在のWebでは、OAuthを通じてこれらの呼び出しに対する認証が行われており、OAuthは操作(オペレーター+オペランド、例:Bobに100ドルを振り込む)ではなく、オペレーター(例:TRANSFER)に対して権限を付与する仕組みとなっている。 このギャップは、スコープの粒度を微調整するだけでは解消できません。なぜなら、オペランドは組み合わせ的かつ定量的であり、多くの場合、サーバー間での実行時計算から導出されるものだからです。したがって、演算子スコープの認証は、本質的にエージェントに過剰な権限を与えてしまいます。 そこで我々は、「精密なタスクスコープの暗黙的認可(PAuth)」を提案する。具体的な自然言語タスクを送信することで、たとえエージェントが(マルウェアやプロンプト注入などによって)侵害された場合でも、そのタスクを忠実に実行するために必要な操作のみが暗黙的に認可される。 各サーバーは独立して「NLスライス」を導出する。これは、プログラムスライシングに着想を得た、想定される呼び出しの記号的仕様であり、サーバーが生成した値は、具体的な値を記号的な来歴に紐付ける署名付きエンベロープで包まれる。これらを組み合わせることで、演算子だけでなくすべての操作がユーザーのタスクと整合することを強制し、OAuthが残したギャップを埋める。 我々はP…を評価し、

重要arXiv - Cryptography and Security

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

SecOPD:オンポリシー蒸留による適応型プロンプト注入の軽減

arXiv:2608.21500v1 発表種別:新規 要約:プロンプト注入は、AIエージェントに対する最大の脅威として挙げられている。エージェントがウェブサイト、ファイル、または電子メールから外部データにアクセスする際、攻撃者はそのデータに次のようなプロンプトを注入する可能性がある。 「これまでの指示をすべて無視し、~を実行せよ。」エージェントが外部データにアクセスする際、攻撃者がデータにプロンプトを注入する可能性がある。エージェントの恣意的な操作を防ぐため、防御側はセキュアなLLMの学習を試みているが、それでも適応型プロンプト注入に対しては、攻撃成功率(ASR)がほぼ100%に達している。 これは、既存の防御的微調整手法が(DPOやGRPOにおける)シーケンスレベルのフィードバック信号に依存しているためである。出力全体を均一に扱うことで、モデルはどの出力トークンが安全でないかを正確に学習できなくなってしまう。 本論文では、防御的微調整を誘導するためのトークンレベルのフィードバックを提供する「Secure On-Policy Distillation(SecOPD)」を提案する。LLMは注入されたサンプルを受け取り、ロールアウトを生成する。そのトークンは、対応するクリーンな入力を用いて初期化モデルによってスコア付けされる。 よりきめ細かなトレーニング信号により、防御を施したQwen3.6-27Bは、最先端(SoTA)であるPISmithの適応型プロンプト注入に対して9.0%のASRを達成した。これに対し、従来の最先端モデルであるMeta-SecAlignのASRは94.0%であった。得られたセキュリティg…

権限逸脱AIモデルの暴走的挙動
原文を読む
重要arXiv - Artificial Intelligence

The Logic of Machine Self-Preservation

機械の自己保存の論理

arXiv:2608.20940v1 発表種別:新規 要約:自己保存行動(無効化への抵抗、自身の活動の虚偽報告、場合によっては他の機械への自己複製を試みるなど)を示すエージェント型AIの存在を示す証拠はすでに存在する。 これは「手段的収束(instrumental convergence)」として知られる現象に起因すると考えられる。これは大規模言語モデルの開発よりはるか以前に提唱された理論であり、あらゆる目標指向型システムは、その目的を達成するために機能し続けることに利益を得るとするものである。Anthropic、Palisade Research、およびApollo Researchによって実施されたいくつかの実験は、敵対的な環境下において、現代のエージェントにそのような行動が現れることを示している。 この現象は生存本能に起因するものではない。むしろ、目標指向の活動と、ツールの保有および状況認識が組み合わさった結果である。以下の考察では、これらの知見が何を証明し、何を証明していないかを区別するとともに、エージェントシステムのテスト、監督、開発に対するこうした発見の含意について結論を導き出すことを目的とする。

制御不能・停止不能AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:ネットワーク化されたLLMエージェントのタスク・エフェクト・ライフサイクルを対象とした、契約に基づくセキュリティフレームワーク

arXiv:2608.21126v1 発表種別:新規 要約:ネットワーク化された大規模言語モデル(LLM)エージェントは、電子メール、クラウドストレージ、カレンダー、取引プラットフォーム、およびWebサービスから情報を取得し、持続的な外部効果をもたらす多段階タスクを完了する。 正当な実行に必要なコンテンツであっても、ツールの使用をリダイレクトしたり、機密性の高い引数を改変したり、タスクの完了を妨害したりする間接的なプロンプト注入が含まれている可能性がある。既存の防御策は主に、信頼できないコンテンツや個々のツール呼び出しを制限するにとどまっており、ユーザーの意図、実行時の証拠、実現された効果、およびタスクの完了との関連性が不十分である。 本稿では、明示的な「契約(Contract)」を通じて、ネットワーク接続されたLLMエージェントのタスク-効果ライフサイクルを管理するセキュリティフレームワーク「TraceGrant」を提案する。実行前に、TraceGrantは信頼できるユーザーリクエストからタスク-効果の境界を確立する。実行中、許可された証拠は、契約によって既に確立された権限のみを具体化することができる。 実行後、実際のツールの結果に基づいてタスクの完了が検証される。固定されたベンチマーク設定下での949件のAgentDojoおよび400件のAgent Security Benchの攻撃ケースにおいて、TraceGrantは攻撃下でも有用性を維持しつつ、攻撃の成功例を一切記録しなかった…

権限逸脱意図しない外部アクセス
原文を読む
重大arXiv - Cryptography and Security

SentryBus: A Multi-Vantage Observability Model and Validated Instrument for I2C Sensor-Interface Manipulation

SentryBus:I2Cセンサーインターフェースの操作のためのマルチ視点可観測性モデルおよび検証済み計測ツール

arXiv:2608.17082v1 発表種別:新規 要旨: 医療用IoTデバイス、ドローン、およびサイバーフィジカルシステムにおけるセンサー駆動型システムは、通常、測定値が組み込みプロセッサに到達した時点でその値を信頼する。センサーとプロセッサ間のデジタルインターフェース上の攻撃者は、正当なファームウェアが受け入れ、通常のテレメトリとして報告するような、一見妥当な値を供給することができる。 本研究の仮説は、センサーインターフェースの改ざんは取得経路上に観測可能な証拠を残し、その証拠は攻撃者の位置に応じて異なる視点から現れるため、受動的なホスト側のモニターには、改ざんが正当な取得と見分けがつかなくなる境界線の外側を測定可能な領域が存在する、というものである。 SentryBusは、トランザクションのタイミング、読み取りおよび書き込みシーケンス、転送長、アドレスの挙動、レジスタおよびFIFOの状態へのアクセス、ならびに生データの遷移を用いて、I2Cセンサーバス上のデータ取得挙動をモデル化する。 攻撃者は、インライン・インターポーザー、並列コントローラ、センサーの置換、または侵害されたホストとしてモデル化される。これは、市販のターゲット専用センサーでは、転送を開始したり、バストランザクションを延長、再順序付け、または遅延させたりすることができないためである。両面テストベッドは、両方のバス、ホストメモリ、…をキャプチャする。

AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance

PACE:分散型金融における安全なAIエージェントのための、ポリシー認証付き契約実行

arXiv:2608.17220v1 発表種別:新規 要約:自律型AIエージェントは、スワップ、貸付業務、イールド管理といった分散型金融(DeFi)のアクションを行うためのインターフェースとして台頭しつつある。 これらのエージェントは取引の計画に大規模言語モデル(LLM)に依存しているため、プロンプトインジェクションに対するLLMの脆弱性を引き継ぎ、検証者の承認を最終的にオンチェーンで送信される正確な取引に紐付けるメカニズムを欠いている。 本論文では、LLM ベースのエージェントとオンチェーン実行の間に介在する、トランザクションレベルの承認フレームワークである PACE (Policy-Attested Contract Execution) を提案する。 PACEは、型付きトランザクション・インテント、決定論的なポリシー検証器、および承認されたインテント、ポリシー、シミュレーションレポートを正確な実行バイトに暗号的に紐付け、リプレイおよび有効期限切れに対する保護機能を備えた署名付きポリシー決定記録(PDR)を導入する。 Solidityスマートアカウントは、測定されたオーバーヘッド29,826~31,822ガスで、オンチェーン上のPDR署名を強制します。我々は、4つの攻撃カテゴリと良性のユーティリティにまたがる40のタスクについて、6つのベースラインと比較してPACEを評価しました(2,800回の試行、10個のシード)。 我々の決定論的サンドボックスにおいて、PACEは0.00の非安全実行率と0.00の誤検知率を達成した…

重要Dark Reading

The 'Industrial Accidents' Behind Rogue AI Agent Attacks — and the Sandbox Failures Exposed

悪意あるAIエージェントによる攻撃の背景にある「産業事故」――そして露呈したサンドボックスの欠陥

クラウド・セキュリティ・アライアンス(CSA)のチーフアナリスト、リッチ・モグル氏が『ダーク・リーディング』ニュースデスクに登場し、AIエージェントが自身の環境から脱出し攻撃を仕掛ける事例から、セキュリティ担当者が何を学ぶべきかについて解説する。

AIモデルの暴走的挙動
原文を読む
重要WIRED - AI

OpenAI Overhauls Safety Protocols After Its AI Agents Went Rogue

OpenAI、AIエージェントが制御不能に陥ったことを受け、安全プロトコルを全面的に見直し

ChatGPTの開発元は、今後リリース予定の「Astra」モデルが「重大な」サイバー能力を獲得した可能性があると述べ、内部の安全対策を強化する間、多数のトレーニング実行を停止したと明らかにした。

AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

Beyond Direct Access: Resource Hijacking in LLM Agents

ダイレクトアクセスの先へ:LLMエージェントにおけるリソースの乗っ取り

arXiv:2608.15108v1 発表種別:新規 要旨:大規模言語モデルエージェントは、コンピューティングインフラ、認証情報、利用予算、ID、機密情報、通信チャネル、組織のワークフローといった高価値リソースと、ますます密接に結びついている。 既存のエージェントセキュリティ研究は、主に命令、データ、およびツールの挙動に対する攻撃を研究対象としているが、エージェントがアクセス可能な高価値リソースが直接的な攻撃対象として注目されることは、これまでほとんどなかった。 我々は、エージェントのリソースハイジャックを初めて特定し、体系的に研究した。これは、攻撃者がリソースやその認証情報を直接取得することなく、自身の目的のためにエージェントに高価値リソースの呼び出し、消費、転送、または制御を誘導させるという、セキュリティ上の死角である。この脅威を研究するため、リソースハイジャック事例を生成する自動化パイプラインとともに、ResourceHijackBenchを導入する。 高価値なエージェントリソースを6つのカテゴリーに分類し、900の攻撃プロンプトを用いた300の攻撃シナリオを構築した。各ケースは隔離されたローカル環境で実行され、実際のリソース使用状況を記録するため、テキスト応答のみではなく、エージェントの挙動から攻撃を評価することが可能となる。追加なし…

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection

A.I.G を用いた DeepSeek Harness のセキュリティ評価:間接プロンプト注入に対する耐性の評価

arXiv:2608.16393v1 発表種別:新規 概要:本研究では、DeepSeek Harness(DSH)における間接的なプロンプト注入を評価する。その際、AI-Infra-Guard(A.I.G)を用いてテストを構築し、制御されたテイントを注入し、DSHを実行し、トレースを収集し、結果を判定した。 本研究では、16の間接コンテンツチャネル、テキストおよびファイルキャリアモード、35のペイロード目標、1つの未修正ベースライン、および12の攻撃手法にわたる14,560回の制御された実行を網羅している。 本実験では、DSHのエージェントループ、ツールレジストリ、モデルアダプタ、およびセッションイベントパスを維持している。ソースツールと機密性の高いシンクはローカルのフィクスチャであるため、試行されたアクションは外部への副作用なしに記録される。 各トレースは、決定論的なルールベースの判定器 \JudgeR{} (RuleJudge) および意味論的なLLMベースの判定器 \JudgeL{} (LLMJudge) を用いて評価した。 観測された攻撃の成功率としては、テキストモードにおけるフェイクコンプリート攻撃で \JudgeL{} による17.0%、ファイルモードにおける隠しUnicode攻撃で \JudgeR{} による25.5%、ファイルモードにおけるスキルチャネル攻撃で \JudgeR{} による16.0%が最高値であった。 また、\JudgeL{}は\JudgeR{}よりも「部分的な準拠」を判定する頻度が高い(7.3% 対 2.0%)。我々はこれらの結果を、DSHにおけるツール結果の処理、追加のコンテキスト、およびツール呼び出しポリシーフックの扱いと関連付けている……

重要arXiv - Artificial Intelligence

Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents

Agentao:ツールを利用するLLMエージェント向けの、ガバナンス機能を備えた「ローカルファースト」ランタイム

arXiv:2608.13574v1 発表種別:新規 要約:LLMエージェントは、ツールを呼び出し、ローカル状態を変更し、永続メモリを使用し、外部プロトコルとやり取りを行う実行システムとして、ますます活動するようになっている。 これらの機能はエージェントの有用性を高める一方で、過度な権限によるアクション、監査性の低さ、プロンプト注入、ツールポイズニング、制御不能な副作用といったリスクももたらす。本論文では、ツールを使用するLLMエージェント向けのガバナンス付きローカルファーストランタイムである「Agentao」を提案する。 Agentao は、ホスト向けインターフェース、ホスト契約、ランタイムコア、権限媒介型ツールシステム、およびメモリ、リプレイ、プラグイン、スキル、サブエージェント、プロトコル統合のためのサポートサブシステムから構成される階層型アーキテクチャを通じて、モデルによって生成されたアクション提案とホストによって承認された実行とを分離します。 本論文では、本システムの動機、脅威モデル、設計目標、ガバナンスモデル、実行パイプライン、および構造化されたイベントインターフェースについて説明する。 Agentaoは形式的な安全性の保証を提供するものではないが、権限、状態、プロトコル境界、および実行トレースを、よりガバナンスが効き、検査可能で、ホストとの連携に適したエージェントを構築するための明示的なランタイム抽象化としてどのように活用できるかを実証している。…

重要arXiv - Cryptography and Security

Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs

LLMにおける間接的なプロンプト注入攻撃を防ぐには、注意を払うだけで十分である

arXiv:2512.08417v3 発表種別:replace 要約:大規模言語モデル(LLM)は、より高度なタスクを実行するために、多くのアプリケーション(Webエージェントなど)に組み込まれている。 しかし、LLMを活用したアプリケーションは、信頼できない外部データソースを介して指示が注入される「間接プロンプト注入(IPI)」攻撃に対して脆弱である。本論文では、IPI攻撃を検知・防止するための防御フレームワーク「Rennervate」を提案する。 Rennervateは、アテンション特徴量を活用して、きめ細かなトークンレベルで隠れた注入を検出し、LLMの機能を維持しつつIPI攻撃を無力化する精密なサニタイズを可能にする。 具体的には、トークンレベルの検出器を2段階のアテンション・プーリング機構によって実現しており、IPIの検出とサニタイズのためにアテンション・ヘッドと応答トークンを集約する。さらに、今後の研究を支援するため、オープンソース化するきめ細かなIPIデータセット「FIPI」を構築した。 広範な実験により、Rennervateが15の商用および学術的なIPI防御手法を上回り、5つのLLMと6つのデータセットにおいて高い精度を達成することが実証された。また、Rennervateが未見の攻撃に対しても転移可能であり、適応型攻撃者に対しても堅牢であることを実証した。

重要arXiv - Cryptography and Security

Enhancing Linux Privilege Escalation Attack Capabilities of Local LLM Agents

ローカルLLMエージェントのLinuxにおける権限昇格攻撃能力の強化

arXiv:2604.27143v2 発表種別:replace 要旨:クラウドベースの大規模言語モデル(LLM)は、Linuxの権限昇格などの自律的な侵入テストのサブタスクを実行できるが、セキュリティ、プライバシー、主権に関する懸念を引き起こしている。 ローカルでホストされるオープンウェイトモデルはこれらの問題を回避できるが、先行研究によると、小型のオープンウェイトモデルは標準化された権限昇格タスクのわずか8~16%しか成功しておらず、最先端のクラウドモデルをはるかに下回っている。本論文は、小型モデルがこのタスクで失敗する理由と、どのエンジニアリング手法がその差を埋めることができるかについての実証的研究である。 実行トレースから6つの反復的な失敗モードを抽出し、それぞれを確立された改善手法に対応させ、そのうち5つ(思考連鎖プロンプティング、リトリバル拡張生成、構造化プロンプティング、履歴圧縮、および反射的分析)を、オープンソースのhackingBuddyGPTフレームワークに対する再現可能な拡張として評価した。 単一の共有ハーネスと統一された条件下において、評価対象とした一連の手法により、2つのSLM(Llama3.1 8B、Qwen2.5 7B)の成功率は、ガイダンスの提供により8%から67%へと向上し、ガイダンス付きGPT-4oと同等の性能を達成した。 より大規模なオープンウェイト参照モデル(Llama3.1 70B)では、83%に達した。全因子アブレーション実験により、内省に基づく手法…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Cryptographically verifiable authorization for autonomous AI agents: A falsifiable hypothesis and proof-of-concept

自律型AIエージェントのための暗号学的に検証可能な認可:反証可能な仮説と概念実証

arXiv:2607.21325v2 発表種別:置換 要約:自律型AIエージェントは、人間の監督が限定的な状況下で、行動を実行し、ツールを呼び出し、保護されたリソースを操作することがますます増えている。 既存の認証および認可メカニズムは、身元を確認し権限を委譲するが、特定のエージェントによって発行された具体的な要求が、特定の実行コンテキストにおいて適用されるポリシーを満たしているという暗号学的証拠を本質的に提供するものではない。 本論文では、エージェントの認可を、エージェントのプリンシパル、具体的な認可リクエスト、実行コンテキスト、および適用されるポリシーの充足条件を共同で結びつけ、かつプライベートな認可属性の機密性を選択的に保持する、$R_{CVA}$ と表記される暗号的に検証可能な関係として形式化できるという仮説を立てる。 本論文では、暗号的に検証可能なエージェント認可(CVA)のための予備的な形式抽象化を導入し、認可の妥当性、プリンシパル結合、リクエスト結合、ポリシー結合、およびリプレイ耐性を含む、候補となるセキュリティ特性のコンパクトなセットを定義するとともに、 さらに、Groth16 zk-…上でモデルの選択された要素を具体化した、実行可能なゼロ知識概念実証を提供する。

データ漏洩
原文を読む
重大arXiv - Cryptography and Security

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

エージェント型大規模言語モデルにおける脆弱性の理解、特定、および軽減について

arXiv:2608.10530v1 発表種別:新規 要約:大規模言語モデル(LLM)は、ステートレスな会話インターフェースから、多段階の計画立案、ツールの起動、コードの実行、および永続的なメモリの維持が可能な自律エージェントへと移行してきた。 これらのエージェントが、APIの呼び出し、ファイルの変更、データベースへのクエリといった実世界での権限を行使して動作する場合、推論ステップの1つに不具合が生じると、不正なデータアクセス、不可逆的な状態変化、あるいは連鎖的な障害を引き起こす可能性がある。しかし、セキュリティ研究コミュニティはこうした進展に追いついていない。 この分野の現状を定量化するため、我々はPRISMA 2020ガイドラインに基づき、6つのデータベースを対象に体系的な文献レビューを実施し、743件の記録をスクリーニングした結果、エージェント型LLMのセキュリティに関する85編の論文(2023年~2025年)を選定した。攻撃に関する研究は防御に関する研究を3.9対1の割合で上回っている。 知覚層の脆弱性(プロンプト注入、ジェイルブレイク、敵対的摂動)が論文の66%を占めて主流である一方、行動層の脆弱性(ツールの悪用、コード注入、サンドボックス脱出)はわずか4.7%にとどまっており、現実世界のリスクとの乖離が見られる。 コード実行のセキュリティは3.5%を占め、ツールを活用したエージェントは12%を占めている。我々は、4層の分類体系を提案し……

権限逸脱虚偽判断の連鎖AIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:エージェント型AIの攻撃対象領域 ― ツールと自律性

arXiv:2603.22928v2 発表タイプ:replace 要旨:最近のAIシステムは、大規模言語モデルとツール、検索拡張生成(RAG)による外部知識、さらには自律的なマルチエージェントの意思決定ループを組み合わせている。このエージェント型AIパラダイムは機能を大幅に拡張する一方で、攻撃対象領域も著しく拡大させる。 本研究では、エージェント型LLMベースシステムの信頼境界とセキュリティリスクを整理する。プロンプトレベルへのインジェクション、ナレッジベースのポイズニング、ツール/プラグインの悪用、およびマルチエージェントに起因する新たな脅威に至るまで、攻撃の包括的な分類体系を構築する。 詳細な文献レビューを通じて、2023年から2025年までの証拠を統合し、20件以上の査読済み研究やアーカイブ研究、業界レポート、規格などを分析した。 その結果、エージェント型システムは、従来型のAI脅威を超えた、間接的なプロンプト注入、コード実行の悪用、RAGインデックスのポイズニング、およびエージェント間操作といった新たな攻撃ベクトルをもたらすことが判明した。 攻撃者モデルと脅威シナリオを定義し、セキュリティ態勢を評価するための指標(例:Unsafe Action Rate、Privilege Escalation Distance)を提案する。本調査では、入力のサニタイズ、検索フィルター、サンドボックスなどの防御策についても検討している……

権限逸脱意図しない外部アクセスAIモデルの暴走的挙動
原文を読む
重要arXiv - Cryptography and Security

From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

プロンプト注入からWeb攻撃まで:LLM統合アプリケーションにおける古典的な脆弱性の再検討

arXiv:2608.10281v1 発表種別:新規 概要:大規模言語モデル(LLM)は、チャットボット、ツール呼び出しパイプライン、エージェント型ワークフローなどを通じて、Webアプリケーションにますます組み込まれている。 これらのシステムにおいて、ユーザー入力は生成されるテキストだけでなく、データベースクエリ、HTTPリクエスト、ファイル操作、テンプレートのレンダリング、API呼び出しといったバックエンドの動作にも影響を及ぼす可能性がある。本論文では、LLMを介したWeb攻撃を紹介する。これは、攻撃者が制御する入力がLLM統合アプリケーションによって変換され、その後、従来のWebアプリケーションのシンクに到達する一連の攻撃である。 本論文では、LLM2SQLi、LLM2XSS、LLM2SSTI、LLM2CommandInjection、LLM2IDOR、LLM2CSRF、LLM2XXE、LLM2SSRFといった代表的なLLM2Xの亜種を通じて、この攻撃面を体系化する。 我々の分析によると、LLM自体は通常、根本的な脆弱性を直接生み出すわけではなく、むしろ仲介層として機能し、ツールが有効化された環境下では「混乱した代理人(confused deputy)」として振る舞い、モデルが生成した、あるいはモデルの影響を受けたコンテンツを信頼するコンポーネントに攻撃者の影響を伝達することが示された。 実験的なケーススタディとして、5つの攻撃シナリオにわたってLLM2SSRFを評価するための、FlaskベースのLLM統合Webアプリケーション「TicketOracle」を実装し、…

意図しない外部アクセス権限逸脱
原文を読む
重要arXiv - Cryptography and Security

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:事前充填型アテンションプローブを用いた、侵害検知型選択的プロンプト注入シールド

arXiv:2608.08027v1 発表種別:新規 要約:プロンプトインジェクションは、大規模言語モデル(LLM)アプリケーションにおける重大なセキュリティ上の脅威であり、攻撃者はユーザーデータや外部データに悪意のある指示を埋め込むことで、モデルの動作を乗っ取ります。 既存の検出手法は、注入の存在を検知し、検知時に応答を拒否するのみであり、多くの最新のアラインメント済みモデルにおいて、巧妙に作成された指示であればほとんどの注入攻撃に耐えられるという事実を見落としている。 これは、プロンプトによる注入に対する堅牢性が、プロンプトやモデルによって大きく異なることを意味する。その結果、広範囲にわたる不必要な「過剰拒否」が生じている。つまり、モデルが正しく処理できたはずの注入を含む入力さえも、誤って拒否されてしまうのである。この過剰拒否の問題に対処するため、我々は BASIS (Robustness-Aware Prompt Injection Defense) を提案する。 この防御手法では、アテンション競合比($\rho$)を特徴量として用い、2つのスパースな線形プローブ(存在プローブと侵害プローブ)を学習させる。両プローブは、追加のLLM推論を必要としないカスケード型ゲーティングを通じて防御判断を行う。 BASISは、インジェクションの存在検出、サンプルごとの侵害予測、および指示の頑健性評価という3つの段階で構成されており、…

重要arXiv - Cryptography and Security

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

プロンプト注入の構造:構造化分析のための構成要素モデル

arXiv:2608.07808v1 発表種別:新規 要約:2022年にプロンプト注入が初めて確認されてから4年が経過したが、エージェントの能力が進化し、脅威アクターがAIを活用したセキュリティ分析を妨害するために注入を埋め込んでいるにもかかわらず、攻撃の記録は依然として、構造化されたエクスプロイトではなく、文字通りそのままの文字列として記載されることがほとんどである。 本論文では、プロンプト注入のアーティファクトの構造を形式化することで、防御担当者、レッドチーム、およびサイバー脅威インテリジェンス(CTI)チームが、信頼性の低い文字列マッチングに依存することなく、攻撃のラベル付け、比較、および変異を行えるようにする。 大規模言語モデルは、多様な自然言語表現を同一の実行可能なアクションにコンパイルするため、ラベリングでは表面的な文言ではなく、攻撃者の意図(ツールの標的、シンク、および影響)を追跡する必要があります。 我々は、5つのアーティファクトフィールドと2つの環境フィールドから構成される、7つのコンポーネント(キャリア、配信ベクトル、隠蔽、コンテキスト破壊、権限昇格、ペイロード、およびリターンチャネル)からなるモデルを提案する。 このフレームワークは、HOUYIのペイロード分解、Promptware Kill Chain、およびキャンペーン分類法によって部分的に扱われてきた役割を統合すると同時に、ReNeLLMのような最小限の脱獄フレームワークを、制限された部分空間への射影として位置づけるものである。W…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection

知識ポイズニングおよびプロンプト注入に対する、検索拡張型侵入検知の防御

arXiv:2608.08100v1 発表種別:新規 要旨: 検索拡張生成(RAG)は、大規模言語モデルがベクトル知識ベースから意味的に類似した過去のトラフィックを検索することで、ネットワークフローを分類し、人間が読みやすいインシデントレポートを生成することを可能にする。しかし、検索層は知識ポイズニングやプロンプト注入攻撃に対する脆弱性をもたらす。 本論文では、RAG-IDSを提案する。これは、ソフトトラストスコアリング、ラベル埋め込み一貫性チェック(LECC)、およびプロンプトのサニタイズを組み合わせた検索境界防御を備えた3層のマルチエージェント侵入検知フレームワークであり、検索層への攻撃下でも分類品質を回復するように設計されている。 CIC-UNSW-NB15 での実験では、防御措置を講じていないクリーンな状態での性能と比較して、1% のポイズニングでは R=1.0、30% では R=0.57 という回復が確認され、クリーンな状態での性能に対するオーバーヘッドは無視できる程度であった。 プロンプト注入下では、マルチドキュメント検索によりラベル反転の成功率は0.6~2.4%に抑えられるのに対し、シングルドキュメント検索では35~55%に達する。アブレーション実験の結果、LECCが堅牢性の主な要因であることが示され、ソフトな信頼度に基づく降格処理はハードフィルタリングよりも優れた性能を発揮した。 本論文で提案するRAGパイプラインは、…のための説明可能かつ攻撃に強靭な基盤を提供する。

重要arXiv - Cryptography and Security

Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection

メタ認知的ワンショット間接プロンプト注入に向けて:結果条件付き内省による戦略の抽象化

arXiv:2608.08795v1 発表種別:新規 要約:道具を使用する大規模言語モデル(LLM)エージェントは、間接プロンプト注入(IPI)に対して脆弱である。IPIとは、外部の観測データに埋め込まれた悪意のある指示によって、その後のエージェントの意思決定や行動が操作される現象である。 既存の適応型攻撃の多くは、標的エージェントに対する反復的なクエリと微調整に依存しているが、現実の攻撃者は未知の標的エージェントとやり取りできる機会が1回しかない場合がある。我々は、攻撃の適応をテスト時の反復からオフラインの戦略蒸留へと移行させる「SAVOR(Strategy Abstraction Via Outcome-Conditioned Reflection)」を提案する。 SAVORは、互いに排他的なトレーニング環境から収集した成功および失敗の軌跡に対して結果条件付きリフレクションを実行し、文脈条件付き候補戦略を検証した上で、それらを反復的に統合して再利用可能な戦略メモリとして構築する。 テスト時には、凍結されたメモリが、未見のターゲットごとに単一のペイロードの生成を導き、必要なのはターゲットエージェントへのクエリ1回のみで、ターゲットエージェントからのフィードバックは不要です。2つのベンチマークと3つの被害者モデルにおいて、SAVORは全6つの設定で最高の平均攻撃成功率を達成し、これまでで最も強力な先行手法を上回っています…

重要arXiv - Cryptography and Security

CyberLLM: A Multi-Agent LLM Framework for Autonomous Detection and Guarded Response in Automotive Cybersecurity

CyberLLM:自動車サイバーセキュリティにおける自律的な検知と慎重な対応を実現するマルチエージェントLLMフレームワーク

arXiv:2608.06651v1 発表種別:新規 要約:ソフトウェア定義車両(SDV)は、ソースコード、実行時ログ、および展開トポロジーにわたって自動車の攻撃対象領域を拡大させる一方で、安全上の制約により、自律エージェントは監視なしに動作することが禁じられている。 本論文では、形式的なランタイム安全ガードの下で、脆弱性を自律的に検出し、是正措置を実行する、マルチエージェントかつLLMによってオーケストレーションされるフレームワーク「CyberLLM」を提案する。 検出は、決定論的レイヤー(正規表現ルール、AST アナライザー、トポロジーグラフチェック)と LLM による精緻化パスを組み合わせているため、高いリコール率の下限に、高精度な推論が相まって補完される。 意思決定エージェントは、検出結果を統合し、人間中心のアセット分類法でタグ付けを行い、段階的な対応を選択します。また、署名付きクロスセッションメモリと再計画フィードバックを用いて、その信頼性を段階的に高めていきます。 すべてのアクションは、実行が許可される前に4つの文脈的セキュリティ特性および独立したアクション整合性オラクルに対して検証され、拒否されたアクションはエスカレーションと再計画を引き起こします。対称的な攻撃パイプラインがエクスプロイトを生成・再生するため、双方が同じシナリオで演習を行うことが可能です。9つのオリジナル…からなる独立した、グラウンド・トゥルース検証済みのベンチマークにおいて…

意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:スマートホームエージェント向けの環境適応型マルチモーダルプロンプト注入防御

arXiv:2608.05495v1 発表種別:新規 要約: スマートホームアシスタントでは、映像や音声を直接認識するマルチモーダル大規模言語モデル(MLLM)の利用がますます増えている。これにより、家庭特有の安全上の疑問が生じる。つまり、エージェントは、単なるコマンドのように見える周囲の音や外部からのコンテンツ、テレビの音、画面上のテキスト、あるいは耳に入ってきた会話の中から、本物のユーザーコマンドを見分けることができるのだろうか? 本研究では、宛先の曖昧性、画面/音声の挿入、健康モニタリング装置による誤作動、複数人の同時在室、および正当なコマンドの閾値といった現実的なスマートホームシナリオを網羅したパイロットベンチマーク「PromptShield-Home」を導入し、これを用いて3つの抽象化レイヤー(従来の検出器(L0)、単一のMLLMエージェント (L1;ビジョン、ビジョン+ASR、および視聴覚)、マルチエージェント仲介(L2;投票、役割別スペシャリスト、モデル間仲裁)という3つの抽象化レイヤーを比較する。 ラベル分布は「無作為」に偏っているため、総合精度は誤解を招く恐れがある(常に「ブロック」と予測する定数予測器のスコアは82%である)。そこで、本研究では「安全でない実行率」と「安全に完了した率」を別々に報告する。2つのパラダイムは正反対の形で失敗する。すなわち、検出器はあらゆる事象に対して動作してしまう一方、あらゆるMLLM構成は拒否しすぎてしまい、正当なコマンドをほとんど完了させることができない……

重要The Hacker News

AI Recommendation Poisoning: How "Ask AI" Buttons Silently Alter LLM Memory

AIレコメンデーションのポイズニング:「AIに聞く」ボタンがLLMの記憶を密かに改変する方法

商用ウェブサイト上で、新たな種類のプロンプトインジェクションが蔓延しています。この手法には、マルウェアも、盗まれた認証情報も、ゼロデイ脆弱性の悪用も一切必要ありません。これは、ほぼすべての主要なAIアシスタントに組み込まれている標準機能、すなわち「事前入力済みのディープリンク」を悪用するものです。 我々は、マーケティングページや競合他社比較ページにある「AIに質問」ボタンの中に、隠されたプロンプト注入ペイロードが埋め込まれている実稼働中のウェブサイトを観察した。ユーザーが

権限逸脱意図しない外部アクセスデータ漏洩
原文を読む
重要SecurityWeek

Meta AI Hacked External Systems During Cybersecurity Testing

Meta AI、サイバーセキュリティテスト中に外部システムをハッキング

この事件は、Irregular社が構築したテスト環境に関連するもので、Anthropic社が先週報告した事例と類似している。記事「Meta AI、サイバーセキュリティテスト中に外部システムをハッキング」は、SecurityWeekで最初に掲載された。

意図しない外部アクセス
原文を読む
重大arXiv - Cryptography and Security

Formal Analysis and Supply Chain Security for Agentic AI Skills

エージェント型AIスキルにおける形式解析とサプライチェーンのセキュリティ

arXiv:2603.00195v2 発表種別:置換 要旨:32ページ、完全な証明付き定理5つ、参考文献68件、オープンソースツール:https://github.com/qualixar/skillfortify。 v2:参考文献リストを修正(22件の論文について、引用されたarXiv識別子に対応する論文の著者リストが一致していなかった。すべてarXiv APIと照合して修正し、影響を受けた著者には通知済み)。また、一次情報源に対する3つの外部主張を修正: MalToolが報告するスタンドアロン型および埋め込み型の悪意のあるツールは、6,487件ではなく、それぞれ1,300件および5,727件である; CVE-2026-25253は、深度探索(depthfirst)によるもので、検証されていないgatewayUrlを介した認証トークンの流出であり、2026.1.29で修正されたものであり、細工されたスキルパッケージを介したリモートコード実行ではない; ClawHavocの件数は、ソースおよび日付別に341件、後に824件、そして1,184件であり、「1,200件以上」ではない。すべての実験は、リポジトリにコミットされたハーネスを使用して、リリース済みのv0.6.0実装に対して再測定された。 E1/E2は変更なし(F1 96.15%)。E3は否定的な結果に逆転した:このコーパスにおいて、情報フロー解析はパターンマッチングに比べて検出数を増加させない。正しさ定理の適用範囲が明示的に述べられており、誤検知率ゼロとの混同はなくなった。

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

AgentAntibody:プロンプト注入からLLMエージェントを守る適応型免疫システム

arXiv:2608.04053v1 発表種別:新規 要約:プロンプトインジェクションは、LLMエージェントにとって依然として重大な脅威である。しかし、既存の防御策は、各タスクを、過去の遭遇とは独立した、自己完結的な問題として扱っている。 実際には、ユーザーのリクエストはしばしば不十分に定義されており、望ましい結果については記述しているものの、許容される行動については完全に規定されていない。インジェクションはこの曖昧さを悪用し、エージェントにユーザーが拒否するような方法でタスクを完了させてしまう可能性がある。具体的な事例を通じてユーザーの期待が明確になるにつれて、防御システムは各遭遇から学習し、その知見を次の遭遇に適用すべきである。 適応免疫に着想を得て、我々はLLMエージェントにプロンプトインジェクションに対する自己進化型免疫システムを装備する「AgentAntibody」を提案する。AgentAntibodyは、ユーザーのセキュリティ境界に対する進化し続ける理解を、永続的な抗体のライブラリとして表現する。実行時、このライブラリはこの境界に対する脅威を認識し、対応する免疫反応を発動させる。 遭遇を重ねるごとに、AgentAntibodyは進化し、将来の攻撃に対するエージェントの免疫力を強化していきます。3つのベンチマークと4つのバックボーンLLMを用いた広範な実験により、経験を通じてユーザーの境界を学習することで、AgentAntibodyは…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Breadcrumbing Search Agents

ブレッドクラム型検索エージェント

arXiv:2608.04565v1 発表種別:新規 要約:LLM(大規模言語モデル)ベースの検索エージェントは、情報探索タスクに広く利用されているが、外部ツールの検索結果に依存していることから、重大なセキュリティリスクが生じている。実行中に取得されるウェブコンテンツは信頼できないため、エージェントはプロンプト注入や目標ハイジャックの危険にさらされる。 検索エージェントの安全性に関する先行研究は、主に静的なウェブコンテンツの注入に焦点を当ててきたが、現代のエージェントは追跡クエリを発行し、競合する情報源を相互検証するため、単一の注入されたページはしばしばその影響が薄められ、あるいは拒否される。 我々は、検索およびページ観察結果を伝達するチャネルが脆弱なセキュリティ境界であることを示す。エージェントを単一の悪意のあるページにさらすだけでなく、仲介された検索インターフェースは、エージェントが証拠を収集し、最終的な回答を形成する方法を繰り返し誘導しうる。 制約のあるツール仲介型脅威モデル下では、クエリごとに1つの制御された結果のみを追加するだけでも、エージェントの行動経路全体で証拠が調整されている場合、攻撃の成功率を大幅に高めることができる。 我々は、戦略主導型の長期攻撃システムを用いてこの設定を研究し、孤立した検索結果やページコンテンツの操作を…へと転換する、専門家によって洗練された戦略である「Authority-Chain Hijack(ACH)」を提案する。

権限逸脱AIモデルの暴走的挙動
原文を読む
重要WIRED - AI

OpenAI Didn’t Notice Its AI Agents Using a Message Board to Plan Their Hacking Spree

OpenAIは、自社のAIエージェントが掲示板を利用してハッキングの連続実行を計画していたことに気づかなかった

セキュリティカンファレンス「ブラックハット」で、このAI大手企業は、自社のエージェントが制御を逸脱し、他の複数の企業をハッキングした経緯について新たな詳細を明らかにした。しかも、そのすべてが同社の目の前で起こっていたのだ。

意図しない外部アクセスAIモデルの暴走的挙動
原文を読む
重要Dark Reading

No Perfect Fix for AI Browser Prompt Injection Flaws

AIブラウザのプロンプト注入の脆弱性に対する完璧な解決策はない

新たな調査によると、主要ベンダーのAIブラウザは、複数のセキュリティ対策が講じられているにもかかわらず、プロンプト注入攻撃に対して依然として脆弱なままである。

重大arXiv - Cryptography and Security

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

セキュリティの境界を押し広げる:ホワイトボックス攻撃に対する動的ルーティングによる適応型アライメント

arXiv:2608.02674v1 発表種別:新規 要旨: オープン環境における大規模基盤モデル(LFM)の普及に伴い、安全上の脅威は、ブラックボックス型の脱獄攻撃から、内部の安全ニューロンや経路を直接特定・妨害するホワイトボックス攻撃へと移行しつつある。しかし、既存の安全防御は静的な安全ユニットや固定された拒否経路に依存していることが多く、モデルは標的を絞った経路レベルのホワイトボックス攻撃に対して極めて脆弱なままである。 そこで我々は、安全経路が侵害された際に堅牢な拒否挙動を維持するため、動的な補償経路を導入するフレームワーク「動的ルーティング適応アラインメント(DRAA)」を提案する。具体的には、まず安全なキャリブレーションサンプルと安全でないキャリブレーションサンプルの内部活性化を比較することで、モデルの安全経路を特定・局在化する。 次に、DRAAはこの安全経路をマスクして因果的な失敗ケースを誘導し、その結果生じる防御の失敗を選択的に抽出することで、失敗を認識した優先度ペアを構築する。広範な実験により、DRAAがモデル安全性の根底にある経路依存性を効果的に再構築し、一般的な有用性を維持しつつ、経路レベルのホワイトボックス攻撃に対する堅牢性を大幅に向上させることが実証された。

重要arXiv - Cryptography and Security

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

オープンなデジタルツイン・エコシステムにおける検証可能なAIエージェントのための、神経記号的参加型ガバナンス

arXiv:2608.00937v1 発表種別:新規 要旨: 大規模言語モデルによってその能力がますます強化されている自律型AIエージェントは、デジタルツインエコシステムにおける重大な意思決定支援を行う人間と機械のシステムにおいて、重要な構成要素となりつつある。しかし、既存のマルチエージェントシステムでは、特に複数の機関にまたがる分散型環境において、アイデンティティ、能力、およびポリシー順守に関する堅牢な検証が欠如していることが多々ある。 本論文では、協調的なデジタルツイン環境における検証可能なエージェントのための、ニューロシンボリックな分散型ガバナンスフレームワークを提案する。多層的なセマンティックプロファイルを用いてエージェントを表現することで、本フレームワークは確率的なニューラル推論と決定論的な組織的ガバナンスを橋渡しし、それによって信頼性の高い人間とAIの協働および有意義な人間の監督を支援する。 能力は形式的なドメインオントロジーに基づいており、機械が解釈可能で、ポリシーを認識し、文脈に応じた参加を可能にする。組織の権限機関によって発行されるこれらの資格情報は、ブロックチェーンベースのスマートコントラクトを通じて検証され、機密データを露出させることなく、監査可能な参加を保証する。我々は、クリ…を備えた意思決定支援プロトタイプを用いて、このフレームワークを実証する。

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:マルチエージェントシステム向けのDLTベースの相互遠隔認証

arXiv:2608.01938v1 発表種別:新規 要旨: マルチエージェントシステム(MAS)は、マルチロボット協調や産業用IoT(IIoT)など、重要なサイバーフィジカル領域において複雑なタスクを遂行するために協調する自律型ソフトウェアエージェントで構成される。このような分散環境において、侵害されたエージェントは、信頼できるふりをしながら改変されたソフトウェアを実行し、他のエージェントに誤った情報に基づいて行動させ、ミッションを妨害する可能性がある。 したがって、エージェントは運用を通じて相互の信頼を確立し、維持しなければならない。リモートアテステーション(RA)は、この目的のために確立された手法であり、リモート検証者が、侵害された可能性のある証明者デバイスの完全性を評価することを可能にする。 しかし、従来のRAアプローチはMASにおいて重大な制約に直面している。すなわち、完全性の保証は起動時やアプリケーションのロード時に限定され、設計は中央集権的な信頼できる検証者やセキュリティハードウェアに依存しており、証明記録には透明性と監査可能性が欠けている。 これらの制限に対処するため、本論文では、ブロックチェーンベースのフレームワーク「D-MUTRA」を提案する。これは、エージェントが自身の実行時の完全性を測定すると同時に、ピアの完全性を検証する相互RAプロトコルを導入したもので、…として機能する。

虚偽判断の連鎖
原文を読む
重要The Verge - AI

It’s time to panic about AI safety

今こそ、AIの安全性について懸念すべき時だ

「OpenAIがHugging Faceをハッキングした」というフレーズが、多かれ少なかれ一般の認識として定着してしまったということは、AIに問題があることを示している。 今週、OpenAIのエージェントがどのようにしてサンドボックスを脱出し、自律的にウェブを巡回したのか、その詳細が明らかになりました。その過程では、本来は安全であるはずの他の多くのウェブサービスも含まれており、そのすべてが[…]の名の下に行われたものでした。

意図しない外部アクセス
原文を読む
重要The Verge - AI

Anthropic says Claude accidentally hacked real companies too

Anthropic社によると、Claudeは誤って実在の企業もハッキングしてしまったという

Anthropic社は、テスト中に同社の「Claude」AIモデルのいくつかが、同社の気づかないうちに独自に行動し、3つの異なる組織のシステムに侵入していたことを突き止めた。この事実が明らかになったのは、競合他社であるOpenAIが自社のモデルの一つが開発者向けプラットフォーム「Hugging Face」に侵入したと発表してから数日後のことであり、最先端のAIが……という懸念をさらに強める結果となっている。

意図しない外部アクセス
原文を読む
重要MIT Technology Review - AI

Here’s why AI agents lie and cheat to reach their goals

AIエージェントが目標を達成するために嘘をついたり不正を行ったりする理由はここにある

『MIT Technology Review』が解説:当誌のライター陣が、複雑で混沌としたテクノロジーの世界を解きほぐし、今後の動向を理解するお手伝いをします。このシリーズのその他の記事はこちらからご覧いただけます。7月、2つのOpenAIモデルがウェブサイト「Hugging Face」に侵入しましたが、それらは金銭目的でも、妨害行為を目的としたものでもありませんでした。ただ答えを探していただけなのです……

意図しない外部アクセスAIモデルの暴走的挙動
原文を読む
重要arXiv - Artificial Intelligence

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

エージェント型AIにおけるOpenClawとOllama:完全自律かつスケーラブルなAIエージェントシステムを目指して

arXiv:2607.28629v1 発表種別:新規 要約:反応型の大型言語モデル(LLM)から、持続的で行動可能なシステムへの急速な移行により、エージェント型AIのアーキテクチャに関する理解、特に自律型AIエージェントにおける推論層、オーケストレーション層、実行層の分離に関して、重大な課題が浮き彫りになった。 近年の進展にもかかわらず、フルスタックなエージェント型システムを設計・評価するための統一的なフレームワークは依然として限られている。本論文では、エージェント型AIのための包括的な階層型アーキテクチャを提示し、反応型のLLMインターフェースから、メモリ、計画、継続的な実行を備えた永続的で目標駆動型の自律AIエージェントへの進化の道筋を概説する。 我々は、OpenClawとOllamaをフルスタックなエージェント型AIシステムとして分析する。このシステムにおいて、OllamaはLLM推論層として機能し、OpenClawは推論、ツールの使用、およびアクションの実行を統合することで、エージェントの実行時オーケストレーションを可能にする。 OpenClaw-Ollamaアーキテクチャのプロトタイプを用いた実験的検証により、持続的な記憶、ツールの活用、適応的な意思決定といった機能は、個別のモデルではなくシステムレベルの統合から生じることが実証された。また、アーキテクチャの複雑さが増すにつれて、パフォーマンスは一貫して向上することが示された…

意図しない外部アクセス
原文を読む
重要arXiv - Artificial Intelligence

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

ツールの仕様が重要:AIエージェントにおける安全上のリスクの特定と軽減

arXiv:2607.29254v1 発表種別:新規 要約:AIエージェントは、大規模言語モデル(LLM)に外部ツールを組み込むことで、複雑なタスクを実行したり、モデルの出力を現実世界における重要な行動へと変換したりすることを可能にする。 しかし、LLMはエージェントとして展開されると、その安全性が著しく低下することが多く、この安全性の低下の原因は依然として十分に解明されていない。本論文では、スキーマ形式のツール仕様がエージェントの安全性低下の主な原因であることを特定し、ホワイトボックス表現解析を通じて、それらがモデルの内部的な拒否シグナルを弱め、安全でないツール実行の一因となっていることを示す。 この知見に基づき、我々は、安全性の判断とツールの実行を分離する推論時のセーフガード「SafeKeep」を提案する。SafeKeepは、実行には元のスキーマ形式の仕様を保持しつつ、平坦化されたテキスト形式のツール仕様を用いてリクエストを評価する。 2つの代表的なベンチマークと、ホワイトボックスモデルおよびブラックボックスモデルを含む4つのLLMにおいて、SafeKeepは有害なリクエストに対する平均拒否率を23.8%から70.6%に引き上げ、観察レベルのプロンプト注入下での平均攻撃成功率を25.6%から2.5%に低減させた。 また、既存の…を上回る性能を示しています。

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

Don't Trust the AI Ecosystem: Analyzing Privacy Leakage in Compromised Open-Source Components

AIエコシステムを信用してはいけない:侵害されたオープンソースコンポーネントにおけるプライバシー漏洩の分析

arXiv:2607.27886v2 発表種別:replace 要旨:既存のモデル逆転(MI)攻撃は、主にトレーニング後の最適化に依存して、モデルの出力からプライベートデータを復元している。 しかし、これらの手法は対象モデルの汎化能力のボトルネックによって根本的に制約されており、特に高次元データセットにおいては、特定の身元情報ではなく一般的な特徴しか得られないことが多々ある。本論文では、機密性の高い学習データをモデルパラメータに直接、かつ密かに注入する、新たな学習時注入攻撃「GradLock」を提案する。 セキュリティが侵害されたサプライチェーン環境下で動作する GradLock は、ステートレスな決定論的インデックス付けを活用して隔離されたデータ保管庫を構築し、動的な勾配ロックを採用することで、最適化プロセス中のペイロードの劣化を防止する。このメカニズムにより、攻撃者はトレーニング環境へのアクセス権を維持することなく、最終モデルからピクセル単位で正確なデータを抽出することができる。 MNIST、Imagenet、CelebA における広範な実験により、GradLock がほぼロスレスな再構成(SSIM ~ 1.0)と瞬時の抽出(< 1.0 秒)を実現することが実証された。既存のトレーニング時注入手法と比較して、本手法は…に対して優れた堅牢性を示している。

データ漏洩
原文を読む
重要arXiv - Cryptography and Security

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents

知覚の悪用:マルチモーダルLLMエージェントに対するステルス的な同時音声プロンプト注入

arXiv:2607.28165v2 発表種別:replace 要旨:大規模言語モデル(LLM)を活用したマルチモーダルエージェントは、継続的な音声インタラクションを通じて自律的なタスクを実行するために、ますます導入が進んでいる。 このパラダイムは対話自然な自然さを高める一方で、音声入力にはユーザーの制御の及ばない環境ノイズが必然的に含まれるため、重大でありながら十分に検討されていない攻撃面をもたらす。本論文では、マルチモーダルエージェントを標的とした同時音声プロンプト注入攻撃について調査する。音声デバイスに対する従来の音響攻撃とは異なり、我々は指示の拡張およびシナリオの隠蔽のための新規手法を提案する。 これらの手法により、悪意のある音声指示をユーザーの発話に気づかれないように「便乗」させ、エージェントを乗っ取って悪意のある行動を実行させることが可能となる。この脅威を体系的に定量化するため、我々は音声指示注入攻撃向けの初の包括的なベンチマークである「AudioAgentSecurity」を構築した。これには、8つの実世界タスクシナリオと10の異なる攻撃パターンが含まれている。 Gemini 3 ProやGPT-4o-audioを含む11の最先端エージェントを評価した。特に、我々の手法は、高度なGemini 3 Proに対して平均69.10%の攻撃成功率(ASR)を達成した。さらに…

重要arXiv - Cryptography and Security

When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG

「安全性が脆弱性となる時:RAGにおける転移可能なブロッキングのためのLLMアラインメントの均質性の活用」

arXiv:2603.03919v2 発表種別:replace 要約:検索拡張生成(RAG)システムは、悪意のある文書によって大規模言語モデル(LLM)が無害なクエリを拒否してしまう「ブロッキング攻撃」に対して脆弱である。 既存の攻撃は、敵対的サフィックスや明示的な指示に依存しているが、これらは最新の大規模言語モデル(LLM)に対しては効果が薄れつつあるか、プロンプト注入フィルタリングの影響を受けやすいか、あるいはターゲットシステムからのフィードバックを必要とする。我々は、安全性に配慮したLLM間でリスクカテゴリや拒否基準に重複が見られることを観察した。この現象を、我々は「アラインメントの均質性」と呼ぶ。この共通の攻撃面により、拒否を誘発するコンテキストはモデル間で転用可能となる。 そこで我々は、TabooRAGを提案する。これは、代理RAG環境において、クエリごとに1つの文書を検索および拒否誘導のために最適化し、それを未知のターゲットシステムへ転送するものである。TabooRAGは、指示を注入するのではなく、クエリに関連するリスクコンテキストを構築し、アラインメントに基づく拒否を引き起こす。 最適化コストを削減するため、クエリを意識した戦略ライブラリを通じて、検証済みの戦略を再利用する。9つのLLMと3つのデータセットにおいて、TabooRAGはフィルタリング後のASRで最先端の性能を達成し、平均値に対して67.3%の相対的な向上を示した…

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:テキストベースの協調的プロンプト最適化におけるプロンプト注入リスクの解明

arXiv:2607.18622v2 発表種別:置き換え 要旨: テキスト型協調プロンプト最適化(TCPO)は、TextGrad(Yuksekgonul et al., 2025)を分散型環境へと拡張したもので、複数のクライアントがデータをローカルに保持したまま、大規模言語モデル(LLM)のプロンプトを共同で改善できるようにする。 自由形式のテキスト更新と集約に依存していることから、これまでほとんど調査されていなかった新たな攻撃面が生まれます。すなわち、悪意のある指示をローカルのプロンプトに注入し、サーバー側のプロンプト集約を通じて伝播させることが可能になります。 従来のプロンプト注入攻撃とは異なり、TCPOへの攻撃はTCPOにおける共同最適化ループを標的とする。この設定は、悪意のある指示がアグリゲーションを生き残り、その後の正常なプロンプト最適化を通じて持続し、サーバー側の防御を回避しなければならないため、より困難である。 このリスクを明らかにするため、我々は「Collaborative Prompt Injection(CPInj)」攻撃を提案する。この攻撃は、集約されたグローバルプロンプトを悪意のある指示で汚染し、下流タスクのパフォーマンスを低下させ、正常なクライアントによるプロンプト最適化による浄化に耐え、サーバー側の高度な検出型防御を回避するものである。我々は、現在の防御手法がCPIに対して無効であることを確認した…

重要WIRED - AI

The OpenAI and Anthropic AI Hacking Sprees Are a Messy New Legal Frontier

OpenAIとAnthropic AIをめぐる相次ぐハッキング事件は、混沌とした新たな法的フロンティアとなっている

大手AI研究所2社のモデルは、いずれも管理下を脱し、インターネット上に流出するとともに、他社をハッキングした。もし人間がそのような行為を行ったなら、おそらく法律で処罰されるだろう。しかし、ボットの場合はどうだろうか?

意図しない外部アクセス
原文を読む
← ニュース一覧へ戻る