ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2607.21653-molt-agentic-rl.md

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

paperupdated 2026-07-28created 2026-07-28

TL;DR

NVIDIA NeMo의 Molt는 에이전트 시나리오를 위한 소형·연구자 친화적 PyTorch 네이티브 RL 훈련 프레임워크로, Megatron 규모의 복잡성 없이 동등한 성능을 달성합니다. 2026년 7월 27일 HF Daily #1 (605 업보트).

저자 및 소속

NVIDIA NeMo 팀 — GitHub: NVIDIA-NeMo/labs-molt

방법

Molt는 세 가지 구성 요소로 이루어집니다:

  1. vLLM 롤아웃 엔진 — 정책 일관성 있는 샘플링을 통한 효율적 토큰 생성
  2. 단일 FSDP2 정책 행위자 (NeMo AutoModel 기반) — 다중 프로세스 훈련 복잡성 제거
  3. Ray 비동기 큐 — 롤아웃과 훈련 간 분리된 조율

핵심 설계 원칙: 정책 자체가 생성한 토큰만으로 훈련(참조 데이터 또는 오프라인 데이터 제외). 이는 에이전트 RL 안정성에 중요하며, 혼합 데이터로 훈련된 프레임워크에서 발생하는 분포 이동 아티팩트를 방지합니다.

결과

표준 에이전트 RL 벤치마크에서 Megatron 기반 시스템과 비교 가능한 성능을 달성하면서도, 배포 및 수정에 필요한 인프라 전문성이 훨씬 낮습니다.

의의

미해결 문제

  • 매우 긴 궤적은 어떻게 처리하는가? (참고: SEED의 45K 토큰 궤적)
  • Cosmos(물리 AI RL 훈련)와의 통합 경로는?
  • 벤치마크: 1T 규모에서 Ring-Zero와 비교 테스트 여부?

인용

arXiv: 2607.21653 (2026-07-27)

관련

Referenced by

Sources