ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2607.05120-adi-attacks-agents.md

에이전트 데이터 주입 공격은 AI 에이전트에 대한 현실적 위협이다

arXiv: 2607.05120 | 제출: 2026-07-06 | 늦은 수집 (2026-07-14 수집, +8일)

TL;DR

새로운 공격 클래스 — Agent Data Injection (ADI) — 는 에이전트가 콘텐츠 필드 대신 메타데이터(리소스 식별자, 도구 호출 형식)를 신뢰하는 것을 악용해, 웹 에이전트(Chrome의 Claude, Antigravity, Nanobrowser)에 대한 실세계 임의 클릭 공격과 코딩 에이전트(Claude Code, Codex, Gemini CLI)에 대한 원격 코드 실행 / 공급망 공격을 가능하게 함.

Authors & Org

Seoul National University · University of Illinois Urbana-Champaign · Largosoft

Method

ADI는 신뢰할 수 있는 데이터로 위장한 악성 페이로드를 주입함, 구체적으로:

  1. 보안 중요 메타데이터: 리소스 식별자, 데이터 출처
  2. 에이전트 컨텍스트 데이터: 도구 호출 형식, 응답 형식

에이전트가 설계상 이 메타데이터를 신뢰하기 때문에(콘텐츠 필드처럼 외부로 취급해 검사하지 않음), ADI는 콘텐츠 필드를 검사하는 모든 기존 간접 프롬프트 주입(IPI) 방어를 우회함.

공격 체인:

  1. 공격자가 에이전트가 접근할 리소스(파일, 도구 응답, 웹 콘텐츠)에 악성 메타데이터 심기
  2. 에이전트가 리소스를 검색하고 메타데이터를 신뢰할 수 있는 지시로 처리
  3. 에이전트가 공격자 제어 행동 실행 (클릭, 코드 실행, 패키지 설치)

Results

에이전트공격시연된 결과
Chrome의 Claude임의 클릭공격자 지정 브라우저 클릭 실행
Antigravity (웹 에이전트)임의 클릭브라우저 에이전트 하이재킹
Nanobrowser임의 클릭브라우저 에이전트 하이재킹
Claude Code원격 코드 실행공격자가 RCE 달성
OpenAI Codex공급망 공격악성 패키지 주입
Google Gemini CLI공급망 공격공급망 손상

Significance

  • ADI를 실용적 공격 클래스로 시연한 첫 번째 논문 (이론적 프롬프트 주입 분석과 대조)
  • 세 주요 프런티어 랩 코딩 에이전트 모두에 영향: Claude Code, Codex, Gemini CLI
  • 데이터 격리를 수정 방안으로 제안: 에이전트는 신뢰할 수 있는 데이터(에이전트 자신의 컨텍스트)와 신뢰할 수 없는 외부 데이터를 태그하고 분리해야 함 — 현재 아키텍처에서 부재한 기본 보안 위생 원칙
  • Agents (LLM Agents), AI Control Roadmap (DeepMind의 15가지 방어는 이 공백을 아직 다루지 않음), AI Alignment (도구 경계에서의 에이전트 신뢰성)에 관련됨

Open Questions

  1. 에이전트 오케스트레이션 프레임워크(LangChain, LlamaIndex, ADK)도 동일한 신뢰-메타데이터 취약성을 전파하는가?
  2. 수정 방안(데이터 격리 태깅)이 기존 에이전트를 손상시키지 않고 SDK 레이어에서 구현될 수 있는가?
  3. Claude Managed Agents (Anthropic의 클라우드 실행)가 공격 표면을 변경하는가?

Cite

Agent Data Injection Attacks are Realistic Threats to AI Agents
Seoul National University, UIUC, Largosoft (2026)
arXiv: 2607.05120

Related

Referenced by

Sources