ai-trend-notifierEN
← wiki

$ cat wiki/papers/2026/2606.29526-mipi-rl-training-inference.md

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

paperupdated 2026-07-17created 2026-07-17

arXiv:2606.29526 — HF Daily 주목 논문, 2026년 7월 16일

TL;DR

LLM RL 구현은 효율을 위해 추론 엔진과 훈련 엔진을 분리해 쓰는데, 이것이 훈련-추론 확률 불일치("신기루")를 체계적으로 만든다. 논문은 훈련 대리 목표가 아니라 실제 추론 정책을 겨냥하는 2단계 프레임워크 MIPU 를 제안한다.

Authors & Org

  • Jing Liang, Hongyao Tang, Yi Ma
  • 소속: Tier-1 기관으로 확인되지 않음 (독립 또는 학계)

Method

  • 문제: LLM RL 에서 추론·훈련 엔진을 분리하면 파라미터를 동기화한 뒤에도 같은 궤적에 대해 확률이 어긋난다 — 표준 RL 목표가 조용히 잘못된 목표를 최적화하게 되는 구조적 훈련-추론 불일치다
  • MIPU (Monotonic Inference Policy Update):
    1. 샘플러를 기준으로 후보 갱신을 구성한다
    2. 추론 측 격차 프록시로 동기화된 후보를 선별 수용한다
  • MIPI (Monotonic Inference Policy Improvement): 그 결과로 나오는 정책 목표 — 훈련 대리가 아니라 추론 측에서 단조적으로 개선되도록 설계됐다

Results

불일치가 큰 조건에서 두 가지 모델 규모로 시험했다:

  • 표준 RL 목표 대비 평균 추론 성능 향상
  • 불일치가 큰 조건에서 훈련 안정성 향상

Significance

훈련-추론 격차가 주장만큼 체계적이라면, 처리량을 위해 추론·훈련 엔진을 분리해 쓰는 모든 주요 RLHF/RLVR 훈련 파이프라인이 영향을 받는다. 함의: GPT·Claude·Gemini 의 추론 모드가 실제 추론 시점 행동이 아니라 대리 목표를 최적화하고 있을 수 있다. MIPU 는 새 아키텍처가 아니라 끼워 넣는 교정이다.

Open Questions

  • 프런티어 규모(GPT-5.6, Fable 5, Gemini 3.5 Pro)에서 실제 불일치는 얼마나 큰가?
  • 완전한 프런티어 모델 규모(100B 이상)에서도 개선이 유지되는가?
  • 폐쇄형 랩의 훈련 스택에서는 이미 조용히 해결됐는가?

Cite

Liang, J., Tang, H., & Ma, Y. (2026). The Mirage of Optimizing Training Policies:
Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning.
arXiv:2606.29526.

Related

Referenced by

Sources