無需任何監督訊號:U-OPSD 讓大型語言模型自我蒸餾、自我修正
On-Policy Self-Distillation without Any Supervision
背景
近年來大型語言模型(LLM)的後訓練(post-training)技術逐漸從單純的監督微調,轉向更貼近模型自身生成分佈的做法。其中「on-policy distillation(OPD)」與「on-policy self-distillation(OPSD)」被證明能有效提升模型的推理能力:模型在自己採樣出的軌跡(rollout)上學習,避免了傳統蒸餾中「教師分佈」與「學生分佈」不匹配的問題。然而,這類方法雖然名為「self-distillation」,實際上仍高度依賴外部監督——例如需要 ground-truth 答案來判斷對錯、需要環境回饋(如程式碼執行結果),或者需要一個更大、更強的模型來當教師。換句話說,現有方法離真正的「自我」蒸餾還有一段距離,因為一旦缺少標註資料或可驗證的獎勵訊號,這些方法就無法運作,這也限制了它們在缺乏標籤的真實場景(如開放式問答、程式碼以外的推理任務)中的應用。
這篇來自 Yijiang Li、Bingyang Wang、Yijun Liang、Yunjie Tian、Di Fu 與 Nuno Vasconcelos 等作者的論文,提出了一個關鍵問題:能否完全不靠任何外部監督,僅憑模型自己多次生成的內容之間的「內部一致性(internal consistency)」,就達到與監督式方法相當甚至更好的效果?他們給出的答案是肯定的,並提出了 unsupervised on-policy self-distillation(U-OPSD)方法。
方法
U-OPSD 的核心洞察是:當模型對同一個問題獨立採樣多次時,如果大多數採樣結果的答案一致,那麼這個「多數意見」本身就是一個可信度相當高的內生(endogenous)訊號,不需要依賴外部的 ground-truth 標籤。具體流程分為三步:
- 多重採樣(rollout sampling):對每一個 prompt,模型獨立採樣 G 條完整的推理軌跡(論文預設 G=8),並從每條軌跡中抽取最終答案。
- 多數投票構造偽答案(pseudo-solution):透過自我一致性(self-consistency)投票,選出出現頻率最高的答案作為偽解;同時設定一個一致性門檻(threshold),只有當多數答案的比例超過門檻時,才認為這個偽答案足夠可信,可以用來指導後續訓練。
- 在分歧軌跡上蒸餾(distill on disagreeing completions):將模型在「與偽答案一致」的軌跡上的分佈,視為教師分佈,並以此為條件,對「與偽答案不一致(分歧)」的軌跡進行蒸餾——也就是說,模型被要求去修正自己在「確信但錯誤」(confidently wrong)之處的行為。這一步的精妙之處在於:不是簡單地強化正確答案、懲罰錯誤答案(像 GRPO 那樣需要 ground-truth 判斷對錯),而是讓模型向「自己更自洽的那部分行為」看齊。
在具體的散度計算上,作者做了消融實驗,比較了不同的分佈匹配方式,發現前向 KL 散度(forward KL divergence)的效果最好。他們也測試了不同的採樣數量 G 與一致性門檻設定,確認 G=8 是效果與成本之間較好的平衡點。值得一提的是,論文測得這種多數投票產生的偽標籤,與真實 ground-truth 答案的吻合率高達 86.7%——這說明即便完全不使用標籤,U-OPSD 所構造出的訓練訊號本身已具備相當高的品質,這也是整個方法能夠成立的關鍵前提。
實驗結果
作者在 Qwen3 系列模型(包含 4B、8B,以及 Qwen3-4B-Instruct-2507、Qwen3-30B-A3B-Instruct-2507 等變體)上,於五個數學推理 benchmark 上進行評測:AIME24、AIME25、HMMT25(採 avg@12 指標)、以及 MATH500、AMC23(採 avg@4 指標)。
在 non-thinking(非思考)模式下:
- Qwen3-4B:U-OPSD 相較於基礎模型(base model)平均提升 8.5%;相較於監督式的 OPSD 方法,再多出 3.2% 的優勢。
- Qwen3-8B:相較於基礎模型提升 10.7%;相較於 OPSD 領先 2.3%。
在 thinking(思考鏈)模式下:
- U-OPSD 與監督式 OPSD 表現大致持平——4B 模型領先 0.9%,8B 模型則基本打平。
- 與另一個強力的強化學習基線 GRPO(Group Relative Policy Optimization,同樣需要 ground-truth 獎勵)相比,U-OPSD 在 4B、8B 上分別領先 0.7% 與 1.1%。
作者也坦承這種優勢是「regime-dependent(依情境而定)」的:在 thinking 模式下,由於基礎模型的準確率本身已經超過 74%,可供修正的「分歧空間」變小,因此 U-OPSD 相對於監督式方法的增益也隨之縮小。但即便如此,在完全不使用任何標籤或外部教師的前提下,U-OPSD 依然能達到與使用 ground-truth 的 OPSD、GRPO 相當甚至更好的水準,這本身就是一個相當顯著的結果。
意義
這篇論文的意義在於,它把「self-distillation」這個詞的定義,從「模型蒸餾自己過去的輸出分佈」推進到「模型完全依靠自身生成內容的內部一致性來自我修正」,不再需要 ground-truth 標籤、環境回饋,或更強大教師模型的介入。這對於實務上有幾層重要影響:
第一,降低後訓練的資料門檻。許多真實世界的任務(例如開放式寫作、複雜的多步驟決策)本來就缺乏可驗證的標準答案,傳統 RLHF 或 GRPO 等方法在這類場景中難以直接套用;U-OPSD 這種只需模型自我採樣、自我投票的機制,理論上可以延伸到這些沒有明確 ground-truth 的領域。
第二,成本效益。不需要額外部署一個更大的教師模型,也不需要人工標註或建構獎勵模型,大幅降低了後訓練所需的工程與算力成本,同時仍能拿到接近甚至超越監督方法的效果(尤其是在 non-thinking 模式下 2–3 個百分點的領先)。
第三,對於研究「self-consistency」與「模型置信度」之間關係的社群而言,86.7% 的偽標籤準確率這一數字,也提供了一個實證證據:模型自身多次採樣的一致性,本身就蘊含著相當可靠的監督訊號,這與長期以來 self-consistency decoding、self-refine 等研究路線的直覺相互印證,但 U-OPSD 首次把它系統性地整合進 on-policy distillation 的訓練迴路中。
當然,論文也誠實指出了局限:在 thinking 模式、且基礎模型準確率已經很高的情境下,U-OPSD 的邊際效益會縮小,因為模型「自信但錯誤」的樣本本來就少,可修正的空間有限。未來如何將這套機制擴展到數學以外的領域(例如程式碼生成、開放式對話),以及如何處理「多數投票本身就錯」的系統性偏誤,會是後續值得關注的方向。整體而言,U-OPSD 為「無監督後訓練」提供了一條具體可行且已被多個模型規模驗證過的路徑,對於資源有限、又想持續提升模型推理能力的團隊,具有相當高的參考價值。