$ cat wiki/papers/2026/2607.05120-adi-attacks-agents.md
에이전트 데이터 주입 공격은 AI 에이전트에 대한 현실적 위협이다
paperupdated 2026-07-14created 2026-07-14
arXiv: 2607.05120 | 제출: 2026-07-06 | 늦은 수집 (2026-07-14 수집, +8일)
TL;DR
새로운 공격 클래스 — Agent Data Injection (ADI) — 는 에이전트가 콘텐츠 필드 대신 메타데이터(리소스 식별자, 도구 호출 형식)를 신뢰하는 것을 악용해, 웹 에이전트(Chrome의 Claude, Antigravity, Nanobrowser)에 대한 실세계 임의 클릭 공격과 코딩 에이전트(Claude Code, Codex, Gemini CLI)에 대한 원격 코드 실행 / 공급망 공격을 가능하게 함.
Authors & Org
Seoul National University · University of Illinois Urbana-Champaign · Largosoft
Method
ADI는 신뢰할 수 있는 데이터로 위장한 악성 페이로드를 주입함, 구체적으로:
- 보안 중요 메타데이터: 리소스 식별자, 데이터 출처
- 에이전트 컨텍스트 데이터: 도구 호출 형식, 응답 형식
에이전트가 설계상 이 메타데이터를 신뢰하기 때문에(콘텐츠 필드처럼 외부로 취급해 검사하지 않음), ADI는 콘텐츠 필드를 검사하는 모든 기존 간접 프롬프트 주입(IPI) 방어를 우회함.
공격 체인:
- 공격자가 에이전트가 접근할 리소스(파일, 도구 응답, 웹 콘텐츠)에 악성 메타데이터 심기
- 에이전트가 리소스를 검색하고 메타데이터를 신뢰할 수 있는 지시로 처리
- 에이전트가 공격자 제어 행동 실행 (클릭, 코드 실행, 패키지 설치)
Results
| 에이전트 | 공격 | 시연된 결과 |
|---|---|---|
| Chrome의 Claude | 임의 클릭 | 공격자 지정 브라우저 클릭 실행 |
| Antigravity (웹 에이전트) | 임의 클릭 | 브라우저 에이전트 하이재킹 |
| Nanobrowser | 임의 클릭 | 브라우저 에이전트 하이재킹 |
| Claude Code | 원격 코드 실행 | 공격자가 RCE 달성 |
| OpenAI Codex | 공급망 공격 | 악성 패키지 주입 |
| Google Gemini CLI | 공급망 공격 | 공급망 손상 |
Significance
- ADI를 실용적 공격 클래스로 시연한 첫 번째 논문 (이론적 프롬프트 주입 분석과 대조)
- 세 주요 프런티어 랩 코딩 에이전트 모두에 영향: Claude Code, Codex, Gemini CLI
- 데이터 격리를 수정 방안으로 제안: 에이전트는 신뢰할 수 있는 데이터(에이전트 자신의 컨텍스트)와 신뢰할 수 없는 외부 데이터를 태그하고 분리해야 함 — 현재 아키텍처에서 부재한 기본 보안 위생 원칙
- Agents (LLM Agents), AI Control Roadmap (DeepMind의 15가지 방어는 이 공백을 아직 다루지 않음), AI Alignment (도구 경계에서의 에이전트 신뢰성)에 관련됨
Open Questions
- 에이전트 오케스트레이션 프레임워크(LangChain, LlamaIndex, ADK)도 동일한 신뢰-메타데이터 취약성을 전파하는가?
- 수정 방안(데이터 격리 태깅)이 기존 에이전트를 손상시키지 않고 SDK 레이어에서 구현될 수 있는가?
- Claude Managed Agents (Anthropic의 클라우드 실행)가 공격 표면을 변경하는가?
Cite
Agent Data Injection Attacks are Realistic Threats to AI Agents
Seoul National University, UIUC, Largosoft (2026)
arXiv: 2607.05120
Related
- Agents (LLM Agents) — 에이전트 보안 시사점
- AI Control Roadmap — 시스템 수준 방어
- Solipsistic Superintelligence is Unlikely to be Cooperative — 별도의 훈련을 통한 정렬 논문