$ cat wiki/papers/2026/2606.29526-mipi-rl-training-inference.md
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
paperupdated 2026-07-17created 2026-07-17
arXiv:2606.29526 — HF Daily 주목 논문, 2026년 7월 16일
TL;DR
LLM RL 구현은 효율을 위해 추론 엔진과 훈련 엔진을 분리해 쓰는데, 이것이 훈련-추론 확률 불일치("신기루")를 체계적으로 만든다. 논문은 훈련 대리 목표가 아니라 실제 추론 정책을 겨냥하는 2단계 프레임워크 MIPU 를 제안한다.
Authors & Org
- Jing Liang, Hongyao Tang, Yi Ma
- 소속: Tier-1 기관으로 확인되지 않음 (독립 또는 학계)
Method
- 문제: LLM RL 에서 추론·훈련 엔진을 분리하면 파라미터를 동기화한 뒤에도 같은 궤적에 대해 확률이 어긋난다 — 표준 RL 목표가 조용히 잘못된 목표를 최적화하게 되는 구조적 훈련-추론 불일치다
- MIPU (Monotonic Inference Policy Update):
- 샘플러를 기준으로 후보 갱신을 구성한다
- 추론 측 격차 프록시로 동기화된 후보를 선별 수용한다
- MIPI (Monotonic Inference Policy Improvement): 그 결과로 나오는 정책 목표 — 훈련 대리가 아니라 추론 측에서 단조적으로 개선되도록 설계됐다
Results
불일치가 큰 조건에서 두 가지 모델 규모로 시험했다:
- 표준 RL 목표 대비 평균 추론 성능 향상
- 불일치가 큰 조건에서 훈련 안정성 향상
Significance
훈련-추론 격차가 주장만큼 체계적이라면, 처리량을 위해 추론·훈련 엔진을 분리해 쓰는 모든 주요 RLHF/RLVR 훈련 파이프라인이 영향을 받는다. 함의: GPT·Claude·Gemini 의 추론 모드가 실제 추론 시점 행동이 아니라 대리 목표를 최적화하고 있을 수 있다. MIPU 는 새 아키텍처가 아니라 끼워 넣는 교정이다.
Open Questions
- 프런티어 규모(GPT-5.6, Fable 5, Gemini 3.5 Pro)에서 실제 불일치는 얼마나 큰가?
- 완전한 프런티어 모델 규모(100B 이상)에서도 개선이 유지되는가?
- 폐쇄형 랩의 훈련 스택에서는 이미 조용히 해결됐는가?
Cite
Liang, J., Tang, H., & Ma, Y. (2026). The Mirage of Optimizing Training Policies:
Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning.
arXiv:2606.29526.
Related
- Reasoning Models — 영향받는 훈련 패러다임
- Agentic Reinforcement Learning — RL 훈련 파이프라인 맥락
- Test-Time Compute (Inference-Time Compute Scaling) — 최적화 대상이 되는 추론 시점 행동