$ cat wiki/papers/2026/2607.22529-skill-self-play.md
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
TL;DR
Skill-SP는 self-play 루프가 진화시키는 단위를 에이전트 skill로 잡는다. 각 skill의 좁고 검증 가능한 실행이 보상을 정직하게 유지하고, 늘어나는 skill 라이브러리를 넘나드는 라우팅이 과제 공간을 열린 상태로 유지한다. 2026년 7월 27–28일 주간 Hugging Face Daily Papers 트렌딩.
저자 및 소속
Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang. 소속: 수집한 목록에 기재되지 않아 unknown (source).
방법
논문은 자신이 겨냥한 딜레마를 먼저 지목한다. 환경에 묶인 자기진화 방식은 정확한 피드백을 얻지만 학습을 좁은 도메인에 가두고, 열린 형태의 자기 생성 방식은 과제 공간을 넓히는 대신 신뢰할 만한 검증을 잃어 잘못된 보상이 학습 루프를 오염시킨다 (arXiv).
Skill-SP의 답은 세 부분으로 이루어진 공진화 루프다:
- Proposer — 동적으로 샘플링한 skill을 조건으로 어려운 과제를 생성
- Solver — 후보 해법을 탐색하며 자신의 역량 경계를 밀어냄
- Dynamic skill controller — 실행 피드백을 모아 skill 라이브러리를 갱신하고 확장
핵심 주장은 skill이 적절한 중간 지점이라는 것이다. skill은 그 안에서의 실행을 검증할 수 있을 만큼 좁고, 라이브러리는 skill 사이를 오가는 라우팅만으로 과제의 다양성을 열어 둘 만큼 넓다.
결과
도구 사용 및 추론 벤치마크에서 평가했다. 저자들은 Skill-SP가 이미 유능한 백본의 성능 상한을 일관되게 끌어올리며, 처음에 오정렬된 모델에서는 큰 폭의 반전을 만들어 낸다고 보고한다 (source).
구체적인 벤치마크 이름과 점수 차이는 수집한 목록에 포함되어 있지 않다. 전문을 확인하기 전까지 결과 부분은 저자들의 주장으로 다루는 것이 맞다.
의의
- 이번 달에만 같은 벽을 향한 세 번째 서로 다른 시도다. AREX: Towards a Recursively Self-Improving Agent for Deep Research는 연구 과정 자체를 재귀시켰고, Self-Distilled Agentic Reinforcement Learning은 정책이 만든 궤적을 재활용했으며, Skill-SP는 skill 목록을 진화시킨다. 셋 모두 검증 가능한 보상을 잃지 않으면서 열린 확장성을 사려는 시도다.
- 일급 학습 대상이 된 skill. 대부분의 에이전트 skill 연구는 skill을 추론 시점의 산출물 — 작성하고, 검색하고, 실행하는 무언가 — 로 다룬다. 여기서는 skill 라이브러리 자체가 학습 대상이며, 그 점에서 정책과 같은 지위에 놓인다.
- "처음에 오정렬된 모델"이라는 주장이 흥미롭다. 반전 결과가 사실이라면 이 루프는 좋은 모델을 다듬는 데 그치지 않고 나쁜 모델을 고치고 있다는 뜻이며, 이는 대부분의 self-play 결과보다 훨씬 강한 주장이다.
미해결 문제
- skill 라이브러리의 표류(drift)를 무엇이 막는가? 실행 피드백으로 라이브러리를 확장하는 컨트롤러는 검증 가능해 보이기만 하는 skill을 고착시킬 수도 있다.
- skill 내부의 검증은 그 skill의 환경만큼만 믿을 수 있다. 좁은 범위가 신뢰할 만한 보상을 사 준다는 것이 논문의 전제인데, 실행 자체를 모델이 판정하는 skill에서는 입증되지 않았다.
- 연산 비용이 제시되지 않았다. 세 구성 요소가 공진화하는 루프는 비싸며, 예산 비교가 없으면 상한 개선을 단순히 더 오래 학습하는 것과 견주기 어렵다.
- 소속과 코드 공개 여부는 수집 시점 기준 unknown.
인용
arXiv:2607.22529 — https://arxiv.org/abs/2607.22529
관련
- Agentic Reinforcement Learning — 이 연구가 놓인 학습 패러다임
- Agents (LLM Agents) — 진화 대상인 에이전트 측 추상화가 skill
- MCP — Model Context Protocol — skill을 하니스 사이에서 이식 가능하게 만드는 프로토콜 계층
- AREX: Towards a Recursively Self-Improving Agent for Deep Research — 같은 주에 나온 재귀적 자기개선 연구