$ cat wiki/papers/2026/2607.12395-ring-zero-rlvr-1t.md
Ring-Zero: 창발적 추론을 위한 Zero RL의 1조 매개변수 규모 확장
TL;DR
RLVR(검증 가능한 보상을 사용한 RL)을 1조 매개변수로 확장한 첫 번째 시연 — AIME 2026에서 84.2%를 달성했으며, 소규모에서는 나타나지 않는 5가지 창발적 행동을 문서화했다. 여기에는 새로운 "맥락 불안(context anxiety)" 실패 모드가 포함됨.
Authors & Org
Xinyu Tang, Qianggang Cao, Yurou Liu 외 13명 — Ant Group (InclusionAI 팀). ⚡ 늦은 수집: HuggingFace Daily Papers ~7월 14–16일 등장; 7월 19일 수집 (약 +5일).
Method
수학/코딩 벤치마크의 검증 가능한 보상 신호만 사용해 "zero RL" 패러다임(최소 귀납적 편향, 인간 레이블 없음)을 1T 매개변수로 확장함. 사전 지도 파인튜닝 없음; 모델이 순수하게 정확성 피드백으로부터 학습함.
핵심 엔지니어링: Ring-Zero는 1T 규모에서 안정적인 RLVR을 가능하게 하는 훈련 아키텍처를 지칭함 — 이전 연구는 100B 미만에서 정체됨.
Significance
중요한 경험적 공백을 메움: RLVR 스케일링 법칙에 이제 1T 데이터 포인트가 생김. "맥락 불안" 창발이 가장 우려스러운 발견 — 더 큰 모델이 모호함 앞에서 더 결단력을 갖는 것이 아니라 오히려 덜 결단력이 있어지는 질적으로 새로운 행동으로, 단순 RLVR 확장이 견고성을 단조롭게 향상시키지 않음을 시사함. 정렬에도 관련됨 (규모에서의 예상치 못한 창발적 행동).
Open Questions
- 맥락 불안은 RLVR 산물인가, 아니면 SFT+RL 파이프라인에서도 나타나는가?
- Ring-Zero는 동일한 매개변수 수에서의 테스트타임 컴퓨트 접근법(예: best-of-N, 검증기 재순위)과 어떻게 비교되는가?
- 5가지 창발적 행동을 다른 모델 패밀리에서도 재현할 수 있는가?
Cite
arXiv:2607.12395 (~2026-07-12). HuggingFace Daily Papers ~2026년 7월 14–16일.
Related
- Reasoning Models — RLVR은 추론 모델의 주요 훈련 패러다임
- Test-Time Compute (Inference-Time Compute Scaling) — 보완적 스케일링 축
- Agentic Reinforcement Learning — 에이전트 RL은 RLVR의 응용 방향
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning — SEED (같은 주; 에이전트를 위한 온폴리시 증류)
- Weak-to-Strong Generalization via Direct On-Policy Distillation — Direct-OPD (프런티어 규모에서의 RLVR 비용 절감)
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning — MIPI (RL 훈련-추론 확률 불일치)