$ cat wiki/papers/2026/2607.14777-seed-agentic-rl-distillation.md
SEED: 에이전트 강화학습을 위한 자기 진화 온폴리시 증류
TL;DR
SEED는 LLM 에이전트 자신의 완료된 궤적을 자연어 "사후 스킬(hindsight skills)"로 변환한 뒤, RL 훈련 중 그 스킬을 정책으로 다시 증류함 — 인간 시연 없이 희소 보상으로부터 에이전트 기능을 부트스트랩함.
Authors & Org
Yuhao Shen, Fan Zhang, Zhengxi Lu, Shuo Yang, Jinyang Wu — Tsinghua University + Zhejiang University. veRL/verl-agent 프레임워크 기반.
Method
동일한 정책 모델에서 실행되는 3단계 루프:
- 궤적 수집: 희소 터미널 보상이 있는 에이전트 작업에서 현재 정책 롤아웃
- 스킬 합성: LLM-as-critic 패스가 각 궤적을 구조화된 자연어 스킬로 변환 — 재사용 가능한 서브워크플로우, 결정적 관찰, 실패 방지 규칙
- 온폴리시 증류: 합성된 스킬을 다음 롤아웃 배치의 행동 사전(prior)으로 주입
전문가 시연 없음. 오프폴리시 데이터 없음. 정책이 자신의 경험에서 부트스트랩함.
Results
에이전트 작업 벤치마크에서 기준선을 능가함. 구체적인 수치는 아직 확인되지 않음; HuggingFace Daily Papers (7월 17일) 86 upvotes는 강한 커뮤니티 신호를 반영함. (source)
Significance
에이전트 RL의 콜드스타트 문제를 해결함: 모델은 사전 전문가 데이터가 필요 없음 — 어떻게든 해낸 것을 스킬로 합성한 뒤 그 위에 쌓음. 사후 스킬 표상은 인간이 읽을 수 있어(검사 가능), 순수 보상 형성 접근법과 구별됨. Agentic Reinforcement Learning의 핵심 미해결 문제인 다단계 크레딧 할당과 직접 관련됨.
Open Questions
- 사후 스킬 품질이 정책이 향상됨에 따라 정체되는가, 아니면 루프가 복리 효과를 내는가?
- 어떤 규모에서 테스트됨? 이 접근법이 프런티어 규모 모델로 전이되는가?
Cite
arXiv:2607.14777 (2026-07-17). HuggingFace Daily Papers 2026년 7월 17일.
Related
- Agentic Reinforcement Learning — 이 논문이 직접 다루는 분야
- Agents (LLM Agents) — LLM-as-agent 패러다임
- Weak-to-Strong Generalization via Direct On-Policy Distillation — 관련 증류 연구 (같은 주)
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning — RL 훈련-추론 불일치 (MIPI; SEED는 스킬 기반 수정 추가)