ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2607.00272-aspire-robot-skills.md

ASPIRE: 로봇을 위한 에이전트 스킬 발견

TL;DR

로봇이 재사용 가능한 제어 프로그램을 자율적으로 작성하고 축적할 수 있게 하는 지속적 학습 시스템 (NVIDIA GEAR Lab + UMich/UIUC/Berkeley/CMU). 스킬 라이브러리가 성장함에 따라 로봇이 장기 미시도 작업에 제로샷으로 일반화 — 테스트타임 추론을 사용한 이전 SOTA 대비 LIBERO-Pro Long에서 +670%.

Authors & Org

  • NVIDIA GEAR Lab (Jim Fan 팀)
  • University of Michigan
  • UIUC
  • UC Berkeley
  • Carnegie Mellon University

Jim Fan (@DrJimFan)이 X에서 발표: https://x.com/DrJimFan/status/2072004192294830583

Method

ASPIRE는 세 가지 구성 요소를 갖춘 개방형 학습 루프로 작동함:

  1. 폐쇄형 실행 엔진 — 스킬이 왜 실패했는지를 드러내는 세밀한 멀티모달 추적(시각 + 고유수용 + 언어) 생성
  2. 지속적으로 확장되는 스킬 라이브러리 — 검증된 수정 사항을 전이 가능한, 크로스-에보디먼트 스킬로 증류; 라이브러리는 다른 로봇 하드웨어 전반에 걸쳐 유지됨
  3. 진화적 검색 절차 — 다양한 작업 시퀀스와 제어 프로그램을 탐색하고 실행 추적 진단으로 자가 수리

시스템은 code-as-policy 패러다임을 사용함: 스킬은 Python 프로그램으로, 프로그래밍 방식 구성, 검사 및 버전 관리가 가능함.

Results

벤치마크이전 SOTA 대비 개선
LIBERO-Pro 조작 (섭동 하에서)+77%
Robosuite 양팔 핸드오버+72%
BEHAVIOR-1K 장기 가정+32%
LIBERO-Pro Long (제로샷)31% vs 4% (+670%)
제로샷 결과가 가장 중요함: ASPIRE의 축적된 스킬 라이브러리가 추가 훈련 없이 미시도 장기 작업으로의 일반화를 가능하게 함. 이전 방법(테스트타임 추론 + 재시도 사용)은 4%만 달성.

Significance

물리적 스케일링 법칙: 언어 모델의 데이터 플라이휠과 유사 — 로봇이 더 많은 작업을 시도할수록 더 전이 가능한 스킬이 축적되고, 스킬 라이브러리 깊이에 따라 일반화가 향상됨. 이는 지속적인 로봇 학습이 복리 효과를 냄을 경험적으로 뒷받침함.

Code-as-policy의 장점: 학습된 가중치나 궤적이 아닌 코드로 스킬을 작성하면 스킬이 구성 가능하고, 검사 가능하며, 디버깅 가능함 — 실제 환경에서의 안전한 배포를 위한 전제 조건.

크로스-에보디먼트 주장: 논문은 스킬이 다른 로봇 하드웨어 전반에 걸쳐 전이된다고 주장함. 이것이 성립한다면, 중앙에서 유지되는 스킬 라이브러리가 이기종 플릿을 지원할 수 있음 — 플랫폼당 재훈련 비용 절감.

Open Questions

  • 훈련 중 보지 못한 하드웨어에서도 성능이 유지되는가? (크로스-에보디먼트 주장에는 더 광범위한 테스트 필요)
  • 스킬 라이브러리 깊이는 어떻게 스케일되는가? 성능이 정체되는가 아니면 계속 향상되는가?
  • 배포 시 진화적 검색 절차의 계산 비용은?

Cite

@article{aspire2026,
  title={ASPIRE: Agentic Skills Discovery for Robotics},
  author={...},
  journal={arXiv:2607.00272},
  year={2026}
}

Related

Referenced by

Sources