AI Risk News

AIが境界を越えた事例を、
継続的に追う。

海外のAI・セキュリティ・ロボティクス専門メディアから、権限逸脱、意図しない外部アクセス、データ漏洩、制御不能などに関係する記事を選定して掲載します。

EDITORIAL POLICY

RSS/Atomを毎日確認し、重要事例を自動掲載します。

登録済みの海外専門メディアから候補を抽出し、現実被害、AIの自律性、境界逸脱、影響範囲、情報源を機械判定します。高スコアの記事は、原題を併記しながらタイトルとRSS概要を日本語へ自動翻訳して掲載します。中間スコアだけを定期確認します。

重大

現実の被害、重大な情報流出、不正操作、人的・物理的影響が確認された事例。

重要

権限逸脱や制御回避など、実害につながる可能性が高い事例・脆弱性。

注視

研究、実証実験、限定条件の事例など、継続確認が必要なもの。

LATEST

最新の掲載記事

重要arXiv - Cryptography and Security

ASPIRE: Agentic Safety & Prompt Injection Red-teaming Engine

ASPIRE:エージェント型安全性・迅速注入レッドチームングエンジン

arXiv:2610.08951v1 発表種別:新規 要約:LLMエージェントは信頼できないコンテンツを取得し、ツールを介して行動するため、不正な行動や永続的な状態変化を引き起こす可能性のある間接的なプロンプト注入リスクが生じる。 既存の自動化されたレッドチーム攻撃は、主に事前に指定されたシナリオに対してペイロードを最適化しているため、エージェントの行動空間全体に潜む脆弱性は未調査のまま残されている。 本稿では、自由度の高い行動レベルの脆弱性発見を目的とした「ASPIRE(Agentic Safety & Prompt Injection Red-teaming Engine)」を提案する。ASPIREは、進化し続ける「エージェントのセキュリティ行動グラフ」を維持し、相互に補完し合う「探索(Explore)」および「悪用(Exploit)」のエキスパートを用いて、結果中心のテストを発見、検証、一般化する。 軌跡の証拠によってグラフが更新され、部分的な試みや失敗した試みが診断される一方、実行間のメモリ転送によって有用なレッドチーム戦略が引き継がれます。様々なベンチマークでの実験により、ASPIREは高い攻撃成功率を維持しつつ、結果、注入手法、環境、および行動経路にわたるカバレッジを大幅に拡大することが示されました。

権限逸脱意図しない外部アクセス
原文を読む
重要SecurityWeek

Apple to Tighten Full Disk Access Controls in macOS Amid AI Risks

Apple、AIのリスクを背景にmacOSのフルディスクアクセス制御を強化へ

Appleは、より高性能で自律性の高いAIエージェントがもたらすリスクの高まりを理由に、追加の制御機能を導入する。記事「Apple、AIのリスクを背景にmacOSのフルディスクアクセス制御を強化へ」は、SecurityWeekで最初に掲載された。

重要arXiv - Cryptography and Security

Containing the Autonomous Operator: A Defense-in-Depth Framework and Reference Architecture for Securing AI Agents on Kubernetes

自律型オペレーターの制御:Kubernetes上のAIエージェントを保護するための多層防御フレームワークとリファレンスアーキテクチャ

arXiv:2610.02861v1 発表種別:新規 要約: 大規模言語モデル(LLM)エージェントは、チャットインターフェースからインフラ運用へと移行しつつあり、そこでテレメトリの読み取り、ツールの呼び出し、コードの生成・実行、本番環境のKubernetesクラスタの状態変更などを行っています。これにより、従来のクラウドネイティブセキュリティが前提としていた「データと制御の境界」という境界線が崩壊します。 エージェントが単に読み取るだけのコンテンツ(ログ行、チケット、ツールの説明など)が、その動作をリダイレクトする可能性があります。本論文では、モデルをセキュリティ境界として扱ってはならないこと、したがってKubernetes上のエージェントの安全性はインフラストラクチャの問題であると論じます。すなわち、エージェントがプロンプト注入によって完全に侵害されているという仮定の下でも、あらゆる保証が引き続き成立しなければならないのです。 本論文では、(i) Kubernetes上およびその内部で動作するエージェント向けの脅威モデルと10分類の脅威分類法(エージェント型アプリケーションに関する新たなOWASPガイダンスに準拠)、(ii) ツールの境界における完全な仲介と、信頼できない入力、機密性の高いアクセス、外部へのデータ流出の組み合わせを断ち切ることを中心とした9つの設計原則、 (iii) 各原則をネイティブまたは広く採用されている…にマッピングした、7層からなる多層防御フレームワーク。

重要arXiv - Cryptography and Security

Securing Computer-Use Agents Against Branch Steering Attacks

ブランチ・ステアリング攻撃に対するコンピュータ利用エージェントの保護

arXiv:2610.03089v1 発表種別:新規 要約:現代のコンピュータ利用エージェント(CUA)は、グラフィカルユーザーインターフェースと直接やり取りを行い、サードパーティ製のWebツールを実行するため、レンダリングされるすべてのページやツールの応答を通じて、間接的なプロンプト注入のリスクにさらされている。 デュアルLLMパターンは、隔離されたプランナーLLM(P-LLM)を使用して実行パスを確定させた上で、隔離されたLLM(Q-LLM)を介して信頼できない入力を処理するという、形式的なセキュリティ保証を提供する主要なシステムレベルのアーキテクチャであるが、これらの保証はグラフィカル環境では機能しなくなる。 CUAとの相互作用は本質的に動的であるため、プランはデータに依存しない状態を維持できず、エージェントが遭遇する可能性のあるすべてのケースを網羅し、予測される実行時のWebコンテンツに基づいて分岐する必要があります。これにより、エージェントは「分岐誘導攻撃」の脅威にさらされます。この攻撃では、攻撃者が信頼できないデータを巧妙に作成し、明示的な命令を注入することなく、CUAを危険な、あらかじめ承認された分岐へと誘導します。 本研究では、分岐誘導攻撃を体系的に調査し、STEER-Bench(9つのドメインにわたる101のタスク)を導入することで、標準的なCUA(94.4%)およびバニラDual-LLM(89.5%)の両方に対して高い攻撃成功率を示す。続いて、信頼できる分岐計画と…を組み合わせたアーキテクチャ「COBRA」を提案する。

権限逸脱意図しない外部アクセス
原文を読む
重要arXiv - Cryptography and Security

The Innocent Courier: Covert Exfiltration Through Legitimate LLM Web Fetching

『無垢な運び屋:正規のLLMウェブフェッチングを利用した秘密裏なデータ持ち出し』

arXiv:2610.01768v1 発表種別:新規 要旨:大規模言語モデル(LLM)およびLLMベースのエージェントの機能向上に伴い、ユーザーは電子メールへの返信やプログラミング支援など、日常的な問題の解決にこれらを利用するケースが増えている。 これまでの研究では、プロンプトインジェクションやチャットボットプロバイダーへの機密データの漏洩など、セキュリティおよびプライバシー上のリスクについて広範に調査が行われてきた。プロンプトインジェクションを防ぐための入力の構造化や、チャットボット運営者との機密データの共有を避けるためのローカルLLMの導入など、これらのリスクに対処するための様々な解決策が開発されてきたが、LLMには機密データを第三者に漏洩させるリスクも存在する。 本論文では、LLMLeakを用いて、ローカルで実行されるがインターネットと直接通信できない悪意のあるソフトウェアが、LLMを悪用して隠蔽チャネルを確立するという新たな攻撃ベクトルを実証する。 LLMに対して生成されたコードを介してデータを直接送信するよう指示する入力は検出しやすく、ネットワークライブラリも通常は制限されているが、LLMLeakは、さらなる情報を取得するためにLLMのツールのみを利用してWebサイトを取得する。クライアント側の悪意のあるソフトウェアコンポーネントは、URLに秘密情報を埋め込む。それは…

データ漏洩権限逸脱
原文を読む
重要arXiv - Artificial Intelligence

AgBench: Agentic AI Benchmarks for Personal AI Devices

AgBench:パーソナルAIデバイス向けエージェント型AIベンチマーク

arXiv:2609.38652v1 発表種別:新規 概要:エージェント型AIシステムは、計画立案、ツールの使用、反復的な実行において、クラウド上でホストされる大規模言語モデルへの依存度を高めており、APIコストやデータ漏洩に関する懸念が高まっている。 パーソナルAIデバイスの進歩により、エージェントはローカルで実行できるようになったが、デバイス上のリソースが限られているため、タスクの成功やパフォーマンスに影響が出る可能性がある。既存のベンチマークでは、デバイス、ワークロード、展開アーキテクチャにわたるこうしたトレードオフを体系的に特徴づけるには不十分である。 本稿では、パーソナルデバイス上でのエージェント型AIを再現性のある形で評価するためのベンチマークスイートおよびオープンなアーティファクトである「AgBench」を提案する。AgBenchを用いて、エージェント型ワークロードにおけるローカル実行、ハイブリッド実行、クラウド実行を評価し、タスクの成功率、レイテンシ、クラウドAPIコスト、およびデータ露出を検証した。 1億6,207万件以上のデータポイントから得られた結果によると、パーソナルAIデバイスは多くのエージェントタスクをローカルで完了できるものの、特に並行処理が増加するにつれて、ローカルのみでの実行は、クラウドのみでの実行に比べて、一般的にタスクの成功率が低く、完了時間が長くなることが示された。 ローカルのみでの実行では、クラウドモデルAPIのコストや、クラウドエージェントへの機密情報の露出を排除できます。ハイブリッド実行では、タスクの成功率を向上させることができ…

意図しない外部アクセスデータ漏洩
原文を読む