$ cat wiki/papers/2026/2606.19980-enpire-robot-autoresearch.md
ENPIRE: 실세계 에이전트 로봇 정책 자기 개선
paperupdated 2026-06-27created 2026-06-27
TL;DR
8대의 실제 로봇 플릿이 자체 연구 루프를 자율적으로 실행 — 논문 읽기, 가설 제안, 물리적 시험 실행, 코드 재작성 — 루프에 인간 없이. 까다로운 조작 작업에서 99% pass@8 달성; 물리적 스케일링 법칙 발견.
Method
ENPIRE (Empirical Neural Policy self-Improvement on Robot Experiments)는 프런티어 LLM 기반 코딩 에이전트를 8대의 실제 물리적 로봇 플릿에 배치:
- 읽기: 에이전트가 배경 맥락으로 발표된 로봇공학 논문을 흡수
- 가설 제안: 알고리즘 개선 가설 제안
- 초기화: 에이전트가 물리적으로 실험 장면 초기화 (인간 도움 없음)
- 실행: 8개 로봇 플릿에서 병렬 시험 실행
- 검증: 이진 성공 기준에 대해 결과 확인
- 재작성: 경험적 결과를 바탕으로 제어 코드 업데이트
전체 루프가 자율적 — 인간 연구자가 실험을 설계하거나, 결과를 해석하거나, 코드를 수정하지 않음.
Results
- 99% pass@8: 접촉이 많은 조작 벤치마크 — GPU를 마더보드 소켓에 장착하기; 절단 도구로 케이블 타이 묶기
- 발견된 물리적 스케일링 법칙: 더 많은 병렬 로봇과 함께 초선형적 속도 향상 — 실세계 물리적 조작에서의 데이터-병렬 스케일링 법칙에 대한 첫 번째 경험적 시연 (LLM 훈련-데이터 스케일링과 유사)
- Jim Fan: "물리적 세계에서의 첫 번째 AutoResearch"
Significance
ENPIRE는 EgoScale (2026년 6월 7일)이 열어놓은 연구 루프를 완성함:
- EgoScale은 정교한 스킬이 20,000+ 시간의 인간 1인칭 영상으로부터 습득될 수 있음을 보여줌
- ENPIRE는 이제 로봇이 인간-인-더-루프 연구 단계 없이 그 스킬을 자율적으로 개선할 수 있음을 보여줌
물리적 스케일링 법칙 — 병렬 로봇 → 초선형적 작업 속도 향상 — 은 LLM 시대의 "스케일 → 기능" 패러다임이 초기 스킬 습득만이 아닌 자기 개선하는 실세계 로봇 정책으로 전이됨을 보여주는 첫 번째 증거.
Open Questions
- 이 접근법이 분포 외, 새로운 작업으로 일반화되는가?
- 초선형 스케일링 법칙이 성립하기 위한 최소 플릿 규모는?
- 루프가 이동성 및 다중 로봇 조율로 확장될 것인가, 아니면 조작 전용인가?
- 자율 루프에서의 안전 제약과 어떻게 상호작용하는가 (자율 루프에서의 물리적 작동 위험)?
Cite
Xiao et al. "ENPIRE: Agentic Robot Policy Self-Improvement in the Real World." arXiv:2606.19980, 2026년 6월. https://arxiv.org/abs/2606.19980
Related
- Embodied Agents — 더 넓은 구현된 AI 맥락; EgoScale 항목 참조
- Agentic Reinforcement Learning — 에이전트 RL 배경
- Jim Fan — 시니어 저자; NVIDIA GEAR Lab
- NVIDIA — 랩 소속; Cosmos 3, GR00T