以弱御強:用「直接在策略上蒸餾」把小模型的強化學習成果轉移給大模型
Weak-to-Strong Generalization via Direct On-Policy Distillation
背景
近年來,提升語言模型推理能力最有效的手段之一是「可驗證獎勵的強化學習」(RLVR,Reinforcement Learning with Verifiable Rewards):讓模型對一道數學題或程式題產生多個解答(rollout),再用「答案對不對」這種可自動驗證的訊號當獎勵,反覆訓練模型往正確方向調整。這套方法在 AIME、MATH、LiveCodeBench 等推理型 benchmark 上屢屢見效,但代價是訓練成本會隨模型尺寸暴漲——因為每次更新都要目標模型自己生成大量 rollout,模型越大,生成與訓練的開銷就越誇張。換句話說,post-training(訓練後強化)正逐漸變成大模型迭代的瓶頸:每出一顆新的旗艦模型,都得重新跑一輪昂貴的 RLVR。
一個自然的念頭是「以小博大」:既然小模型的 rollout 便宜很多,能不能先在小模型上做 RL,再把學到的東西「轉移」給更強的大模型,省下大模型自己跑 RL 的成本?最直覺的做法是把 RL 訓練完的小模型(弱教師)直接當成蒸餾的老師,讓大模型(強學生)模仿它的輸出分布。但論文指出,這樣做效果有限,因為弱教師最終的策略,其實是「RL 帶來的進步」和「小模型本身能力有限」兩者混在一起的產物——直接模仿等於把教師的缺點也一併複製過去。真正有價值的,是 RL 這個過程本身「新增」了什麼,而不是教師最終長什麼樣子。
方法
論文提出的 Direct On-Policy Distillation(Direct-OPD),核心想法是「只轉移 RL 造成的策略位移(policy shift),而不是轉移教師的最終策略」。具體做法是:對同一個弱模型,保留 RL 訓練前的版本(reference policy)與 RL 訓練後的版本(post-RL teacher),把兩者對同一個輸出的 log 機率做差,也就是取兩者的 log-ratio。這個 log-ratio 本質上回答了一個問題:「RL 讓這個小模型更傾向、還是更不傾向做出這個動作?」它自然形成一個密集(dense)的隱式獎勵訊號,不需要另外設計獎勵函數,也不需要答案是否正確這種稀疏訊號。
拿到這組隱式獎勵之後,Direct-OPD 並不是把它套用在弱教師自己的樣本上,而是讓強學生模型自己生成 on-policy 的輸出(即學生模型在自己的狀態分布上探索),再用教師這組「訓練前後差異」的訊號去評分、調整學生的策略。這樣一來,學生不必去啟動一輪昂貴、獎勵稀疏的 RLVR 訓練,卻能吃到本來只有靠大量 rollout 才換得到的 RL 監督訊號。由於這個訊號是「一對 checkpoint 的差異」,理論上也能把多個獨立的小規模 RL 成果依序疊加(sequential composition),一次次把不同的策略位移灌進同一個學生模型裡,累積效果。整體訓練流程比傳統 RLVR 精簡許多,不需要學生模型自己跑龐大的 rollout 與獎勵驗證迴圈。
實驗結果
論文在 Qwen3 系列模型上驗證了這個方法。最亮眼的結果是:把一個經過 RL 訓練的弱教師的策略位移,透過 Direct-OPD 轉移給 Qwen3-1.7B 之後,該模型在 AIME 2024(美國數學邀請賽風格的高難度題目集)上的準確率從 48.3% 提升到 58.3%,整整拉高 10 個百分點,而且整個訓練只花了 8 張 A100 GPU、大約 4 小時就完成——遠比讓 1.7B 模型自己跑一整輪 RLVR 便宜。
論文也做了「步數對齊」(step-matched)的直接 RL 對照實驗,也就是讓學生模型自己跑同樣訓練步數的傳統 RLVR,結果 Direct-OPD 依然勝出,顯示問題不只是「訓練不夠久」,而是直接蒸餾教師最終策略、或直接對學生做稀疏獎勵 RL,效率本來就不如轉移「策略位移」這個訊號來得高。此外,實驗也驗證了序列疊加多個策略位移的可行性——換句話說,不同批小規模 RL 實驗的成果,可以像拼圖一樣逐步組合進同一個強模型裡,而不必每次都從頭重跑。整體而言,這套方法在多個推理任務與模型組合上,都穩定地讓「較弱的教師」提升「較強的學生」,證明了 weak-to-strong 的可行性並非個案。
意義
這篇論文的關鍵洞見,是重新定義了 RL 訓練成果可以被「重複使用」的方式:以往我們預設 RL 訓練完的模型本身就是終點——要嘛拿去部署,要嘛拿它的輸出去做傳統蒸餾。但 Direct-OPD 指出,RL 訓練前後的「差異」(也就是 log-ratio)本身就是一種可攜式的知識資產,可以脫離原本的模型尺寸,套用到完全不同、甚至更大的模型上。這意味著未來的模型迭代,不必每次都為新的旗艦模型從零開始跑一整輪昂貴的 RLVR:團隊可以在便宜的小模型上不斷做實驗、產生一堆「策略位移」,再用類似 Direct-OPD 的方式,把這些成果注入到正式要上線的大模型裡,甚至疊加多次實驗的成果。
對於資源有限的團隊而言,這種做法把「探索」與「規模化」拆開:探索階段用小模型、低成本試錯,規模化階段用便宜的蒸餾式訓練取代昂貴的 rollout 循環。以 4 小時、8 張 A100 就能把 AIME 2024 準確率從 48.3% 推到 58.3% 為例,這樣的效率提升,對於需要頻繁迭代模型、又不想每次都吃下全套 RLVR 算力帳單的實驗室來說,具有相當實際的參考價值,也為「RL 成果的可轉移性」開啟了新的研究方向。