訓練政策的假象:LLM 強化學習真正該優化的是推論政策
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
背景
近年來,強化學習(RL)已成為大型語言模型(LLM)後訓練階段不可或缺的一環,尤其在數學推理、程式生成等任務上效果顯著。但業界普遍觀察到一個棘手現象:RL 訓練常常不穩定,甚至會突然崩潰(collapse)。這篇論文指出了背後一個容易被忽略的關鍵原因——「訓練推論不一致」(training-inference mismatch)。
現代 LLM RL 系統為了兼顧生成效率與訓練精度,通常會採用兩套不同的引擎:一套是負責採樣(rollout)的推論引擎(inference engine),另一套是負責梯度更新的訓練引擎(training engine)。這兩套引擎即便同步了完全相同的模型參數,由於底層實作(如 kernel、數值精度、batching 方式)的差異,對同一段生成軌跡(trajectory)算出來的機率仍會不同。這種差異天然引入了一種特殊的「離策略」(off-policyness)問題,持續污染訓練訊號。
過去的研究(例如 truncated importance sampling、token filtering、learning-rate decay 等方法)大多把這個問題當作「系統層級的數值誤差」來處理,想辦法縮小兩邊機率的差距。但本論文作者提出一個更根本的質疑:即使訓練引擎裡的政策確實被有效更新、變得更好,這並不保證同步到推論引擎、真正部署上線的那個政策也會變好。換句話說,大家一直在優化的「訓練政策」,可能只是一個假象(mirage),真正該關心的目標其實是「推論政策」的單調改善。
方法
作者提出一個新的優化目標,稱為 Monotonic Inference Policy Improvement(MIPI),核心原則是:RL 更新的目標不應只是讓訓練引擎裡的政策 π 變好,而應確保實際部署使用的推論政策 μ 也單調改善。
為了落地這個原則,論文提出兩步驟框架 Monotonic Inference Policy Update(MIPU):
第一步:Sampler-Referenced 候選更新。 不同於傳統做法直接對「訓練端對採樣端」的完整機率比值做 clipping(這樣容易過度限制更新幅度),MIPU 將這個比值拆解,只對「當前訓練端的更新量」做 clipping,同時另外控制「更新前的既有不一致權重」,藉此構造出候選的參數更新。
第二步:推論端差距感知的接受機制(Inference-Gap-Aware Acceptance)。 候選更新產生後,先同步到推論引擎,再用少量驗證性 rollout 估計一個「同步後差距」的代理指標(記為 T̂_post)。如果這個指標低於一個動態容忍閾值 −c,代表這次同步後推論政策很可能比訓練政策表現更差,系統就會拒絕接受這次更新,回退到前一版本;反之才真正生效。
論文用一個公式(文中的 Equation 5)把整體改善拆成三項:訓練端本身的改善量、同步前既有的機率差距、以及同步後新產生的差距,分別對應到「哪裡出了問題就在哪裡修」的設計思路,而不是籠統地去壓低所有機率差異。
實驗結果
實驗在兩個模型規模上進行:Qwen3-1.7B 與 Qwen3-4B,訓練資料分別使用 DAPO-Math-17K 與 DeepMath-103K(並過濾掉過於簡單或過難的題目)。為了製造「高不一致」場景,作者刻意採用 FP8 量化的 rollout 推論引擎,放大訓練與推論兩端的機率差距。評測基準涵蓋 MATH-500、AIME24、AMC23、Minerva、OlympiadBench 五個數學推理任務,對照組包括標準 GRPO、MIS(token filtering)與 learning-rate decay 等方法。
結果顯示,MIPU 在兩個規模上都取得最佳平均表現且訓練更穩定:
- Qwen3-4B:MIPU 平均準確率達 66.71%,在 AMC23 上達 85.00%、Minerva 達 45.96%,而多個對照組出現明顯的性能崩潰或大幅退化。
- Qwen3-1.7B:MIPU 平均準確率 53.97%,MATH-500 上達 86.52%、OlympiadBench 達 59.52%。
消融實驗進一步證實兩步驟缺一不可:只用第一步(候選更新構造)能提升候選品質,但缺乏不一致感知的過濾機制;只用第二步(拒絕機制)能避免崩潰,卻無法彌補本身品質不佳的候選更新。兩者結合才能同時兼顧性能與穩定性。另外一項有趣的對照實驗顯示,即便隨機拒絕 70% 的更新(比 MIPU 的 53.5% 拒絕率更保守),模型仍然崩潰,證明效果來自「有依據的選擇性接受」,而非單純的稀疏化或保守化。分析也指出,較小的 1.7B 模型在訓練與推論兩端的 KL 散度更大、同步後差距更不穩定,說明不一致問題在小模型上可能更嚴重。
意義
這篇論文的貢獻不只是又一種穩定 RL 訓練的技巧,而是重新定義了問題本身:以往大家把訓練推論不一致視為「該被縮小的系統誤差」,這篇論文則指出真正該優化的目標函數本來就沒有對齊——訓練引擎裡看似成功的更新,同步到推論引擎後未必真正變好。這個視角的轉換,對所有採用分離式訓練/推論架構的 RLHF、RLVR(RL with Verifiable Rewards)系統都有參考價值,尤其是在越來越多團隊用量化(FP8/INT8)加速推論、卻同時放大不一致問題的當下。
MIPU 的做法也提示了一個實務上可行的方向:與其一味追求更精確的數值對齊(成本高、且未必能完全消除差距),不如在更新流程中加入「驗證再接受」的機制,用少量額外運算成本換取訓練穩定性與最終部署效果的保證。這對正在規模化訓練推理模型(reasoning model)的團隊而言,是一個值得納入 pipeline 的實用手法。作者也坦言目前實驗僅限於中等規模模型(1.7B、4B),且驗證式過濾會帶來額外運算開銷,未來若能設計更高效率的估計器,應可進一步降低導入成本,讓這套「以推論政策為真正目標」的思路更容易被業界大規模採用。