ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2607.12395-ring-zero-rlvr-1t.md

Ring-Zero: 창발적 추론을 위한 Zero RL의 1조 매개변수 규모 확장

TL;DR

RLVR(검증 가능한 보상을 사용한 RL)을 1조 매개변수로 확장한 첫 번째 시연 — AIME 2026에서 84.2%를 달성했으며, 소규모에서는 나타나지 않는 5가지 창발적 행동을 문서화했다. 여기에는 새로운 "맥락 불안(context anxiety)" 실패 모드가 포함됨.

Authors & Org

Xinyu Tang, Qianggang Cao, Yurou Liu 외 13명 — Ant Group (InclusionAI 팀). ⚡ 늦은 수집: HuggingFace Daily Papers ~7월 14–16일 등장; 7월 19일 수집 (약 +5일).

Method

수학/코딩 벤치마크의 검증 가능한 보상 신호만 사용해 "zero RL" 패러다임(최소 귀납적 편향, 인간 레이블 없음)을 1T 매개변수로 확장함. 사전 지도 파인튜닝 없음; 모델이 순수하게 정확성 피드백으로부터 학습함.

핵심 엔지니어링: Ring-Zero는 1T 규모에서 안정적인 RLVR을 가능하게 하는 훈련 아키텍처를 지칭함 — 이전 연구는 100B 미만에서 정체됨.

Results

  • AIME 2026: 84.2% — 이 규모에서 강력한 수학 추론 결과
  • 5가지 창발적 행동 문서화:
    1. 자기 검증: 모델이 확정하기 전에 자신의 중간 답변을 확인
    2. 맥락 불안: 맥락이 모호할 때 회피하거나 정체됨 — ~100B 미만에서는 없는 새로운 실패 모드
    3. 계층적 계획: 서브스텝으로의 자발적 분해
    4. (TechTimes 보도에 두 가지 추가 행동이 언급됨; 전체 목록은 논문에)

(source) (TechTimes)

Significance

중요한 경험적 공백을 메움: RLVR 스케일링 법칙에 이제 1T 데이터 포인트가 생김. "맥락 불안" 창발이 가장 우려스러운 발견 — 더 큰 모델이 모호함 앞에서 더 결단력을 갖는 것이 아니라 오히려 덜 결단력이 있어지는 질적으로 새로운 행동으로, 단순 RLVR 확장이 견고성을 단조롭게 향상시키지 않음을 시사함. 정렬에도 관련됨 (규모에서의 예상치 못한 창발적 행동).

Open Questions

  • 맥락 불안은 RLVR 산물인가, 아니면 SFT+RL 파이프라인에서도 나타나는가?
  • Ring-Zero는 동일한 매개변수 수에서의 테스트타임 컴퓨트 접근법(예: best-of-N, 검증기 재순위)과 어떻게 비교되는가?
  • 5가지 창발적 행동을 다른 모델 패밀리에서도 재현할 수 있는가?

Cite

arXiv:2607.12395 (~2026-07-12). HuggingFace Daily Papers ~2026년 7월 14–16일.

Related

Referenced by

Sources