$ cat wiki/papers/2026/2607.00272-aspire-robot-skills.md
ASPIRE: 로봇을 위한 에이전트 스킬 발견
TL;DR
로봇이 재사용 가능한 제어 프로그램을 자율적으로 작성하고 축적할 수 있게 하는 지속적 학습 시스템 (NVIDIA GEAR Lab + UMich/UIUC/Berkeley/CMU). 스킬 라이브러리가 성장함에 따라 로봇이 장기 미시도 작업에 제로샷으로 일반화 — 테스트타임 추론을 사용한 이전 SOTA 대비 LIBERO-Pro Long에서 +670%.
Authors & Org
- NVIDIA GEAR Lab (Jim Fan 팀)
- University of Michigan
- UIUC
- UC Berkeley
- Carnegie Mellon University
Jim Fan (@DrJimFan)이 X에서 발표: https://x.com/DrJimFan/status/2072004192294830583
Method
ASPIRE는 세 가지 구성 요소를 갖춘 개방형 학습 루프로 작동함:
- 폐쇄형 실행 엔진 — 스킬이 왜 실패했는지를 드러내는 세밀한 멀티모달 추적(시각 + 고유수용 + 언어) 생성
- 지속적으로 확장되는 스킬 라이브러리 — 검증된 수정 사항을 전이 가능한, 크로스-에보디먼트 스킬로 증류; 라이브러리는 다른 로봇 하드웨어 전반에 걸쳐 유지됨
- 진화적 검색 절차 — 다양한 작업 시퀀스와 제어 프로그램을 탐색하고 실행 추적 진단으로 자가 수리
시스템은 code-as-policy 패러다임을 사용함: 스킬은 Python 프로그램으로, 프로그래밍 방식 구성, 검사 및 버전 관리가 가능함.
Results
| 벤치마크 | 이전 SOTA 대비 개선 |
|---|---|
| LIBERO-Pro 조작 (섭동 하에서) | +77% |
| Robosuite 양팔 핸드오버 | +72% |
| BEHAVIOR-1K 장기 가정 | +32% |
| LIBERO-Pro Long (제로샷) | 31% vs 4% (+670%) |
| 제로샷 결과가 가장 중요함: ASPIRE의 축적된 스킬 라이브러리가 추가 훈련 없이 미시도 장기 작업으로의 일반화를 가능하게 함. 이전 방법(테스트타임 추론 + 재시도 사용)은 4%만 달성. |
Significance
물리적 스케일링 법칙: 언어 모델의 데이터 플라이휠과 유사 — 로봇이 더 많은 작업을 시도할수록 더 전이 가능한 스킬이 축적되고, 스킬 라이브러리 깊이에 따라 일반화가 향상됨. 이는 지속적인 로봇 학습이 복리 효과를 냄을 경험적으로 뒷받침함.
Code-as-policy의 장점: 학습된 가중치나 궤적이 아닌 코드로 스킬을 작성하면 스킬이 구성 가능하고, 검사 가능하며, 디버깅 가능함 — 실제 환경에서의 안전한 배포를 위한 전제 조건.
크로스-에보디먼트 주장: 논문은 스킬이 다른 로봇 하드웨어 전반에 걸쳐 전이된다고 주장함. 이것이 성립한다면, 중앙에서 유지되는 스킬 라이브러리가 이기종 플릿을 지원할 수 있음 — 플랫폼당 재훈련 비용 절감.
Open Questions
- 훈련 중 보지 못한 하드웨어에서도 성능이 유지되는가? (크로스-에보디먼트 주장에는 더 광범위한 테스트 필요)
- 스킬 라이브러리 깊이는 어떻게 스케일되는가? 성능이 정체되는가 아니면 계속 향상되는가?
- 배포 시 진화적 검색 절차의 계산 비용은?
Cite
@article{aspire2026,
title={ASPIRE: Agentic Skills Discovery for Robotics},
author={...},
journal={arXiv:2607.00272},
year={2026}
}
Related
- Embodied Agents — 이 논문이 발전시키는 더 넓은 범주
- ENPIRE: Agentic Robot Policy Self-Improvement in the Real World — 관련 에이전트 로봇 자기 개선 논문 (NVIDIA/CMU/Berkeley, 2026년 6월)
- Jim Fan — NVIDIA GEAR Lab 수석 연구원
- NVIDIA — 기관 소속