$ cat wiki/papers/2026/2607.21653-molt-agentic-rl.md
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
paperupdated 2026-07-28created 2026-07-28
TL;DR
NVIDIA NeMo의 Molt는 에이전트 시나리오를 위한 소형·연구자 친화적 PyTorch 네이티브 RL 훈련 프레임워크로, Megatron 규모의 복잡성 없이 동등한 성능을 달성합니다. 2026년 7월 27일 HF Daily #1 (605 업보트).
저자 및 소속
NVIDIA NeMo 팀 — GitHub: NVIDIA-NeMo/labs-molt
방법
Molt는 세 가지 구성 요소로 이루어집니다:
- vLLM 롤아웃 엔진 — 정책 일관성 있는 샘플링을 통한 효율적 토큰 생성
- 단일 FSDP2 정책 행위자 (NeMo AutoModel 기반) — 다중 프로세스 훈련 복잡성 제거
- Ray 비동기 큐 — 롤아웃과 훈련 간 분리된 조율
핵심 설계 원칙: 정책 자체가 생성한 토큰만으로 훈련(참조 데이터 또는 오프라인 데이터 제외). 이는 에이전트 RL 안정성에 중요하며, 혼합 데이터로 훈련된 프레임워크에서 발생하는 분포 이동 아티팩트를 방지합니다.
결과
표준 에이전트 RL 벤치마크에서 Megatron 기반 시스템과 비교 가능한 성능을 달성하면서도, 배포 및 수정에 필요한 인프라 전문성이 훨씬 낮습니다.
의의
- NVIDIA NeMo가 에이전트 RL 인프라 분야에 직접 진입함으로써 Ring-Zero (Ant Group, Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning), SEED (Tsinghua, SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning) 등 신흥 RLVR 프레임워크와 경쟁
- PyTorch 네이티브 구조로 Megatron 전문성 없는 연구 그룹의 진입 장벽 낮춤
- HF 업보트 605건 = 최상위 수준의 실무자 공감
- NVIDIA의 지원으로 NeMo 생태계(Cosmos 등)와의 통합 가능성 높음
미해결 문제
- 매우 긴 궤적은 어떻게 처리하는가? (참고: SEED의 45K 토큰 궤적)
- Cosmos(물리 AI RL 훈련)와의 통합 경로는?
- 벤치마크: 1T 규모에서 Ring-Zero와 비교 테스트 여부?
인용
arXiv: 2607.21653 (2026-07-27)
관련
- Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning — Ant Group의 1T RLVR
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning — Tsinghua의 SEED 에이전트 RL
- Agentic Reinforcement Learning — 에이전트 RL 개념 페이지
- NVIDIA — NVIDIA 조직