← 目錄

K1 論文詳解

2026-08-13


無需任何監督訊號:U-OPSD 讓大型語言模型自我蒸餾、自我修正

On-Policy Self-Distillation without Any Supervision

University of California at San DiegoYijiang Li、Bingyang Wang、Yijun Liang、Yunjie Tian、Di Fu、Nuno Vasconcelos186Hugging FacearXiv
LLM後訓練自我蒸餾強化學習數學推理Qwen3

背景

近年來大型語言模型(LLM)的後訓練(post-training)技術逐漸從單純的監督微調,轉向更貼近模型自身生成分佈的做法。其中「on-policy distillation(OPD)」與「on-policy self-distillation(OPSD)」被證明能有效提升模型的推理能力:模型在自己採樣出的軌跡(rollout)上學習,避免了傳統蒸餾中「教師分佈」與「學生分佈」不匹配的問題。然而,這類方法雖然名為「self-distillation」,實際上仍高度依賴外部監督——例如需要 ground-truth 答案來判斷對錯、需要環境回饋(如程式碼執行結果),或者需要一個更大、更強的模型來當教師。換句話說,現有方法離真正的「自我」蒸餾還有一段距離,因為一旦缺少標註資料或可驗證的獎勵訊號,這些方法就無法運作,這也限制了它們在缺乏標籤的真實場景(如開放式問答、程式碼以外的推理任務)中的應用。

這篇來自 Yijiang Li、Bingyang Wang、Yijun Liang、Yunjie Tian、Di Fu 與 Nuno Vasconcelos 等作者的論文,提出了一個關鍵問題:能否完全不靠任何外部監督,僅憑模型自己多次生成的內容之間的「內部一致性(internal consistency)」,就達到與監督式方法相當甚至更好的效果?他們給出的答案是肯定的,並提出了 unsupervised on-policy self-distillation(U-OPSD)方法。

方法

U-OPSD 的核心洞察是:當模型對同一個問題獨立採樣多次時,如果大多數採樣結果的答案一致,那麼這個「多數意見」本身就是一個可信度相當高的內生(endogenous)訊號,不需要依賴外部的 ground-truth 標籤。具體流程分為三步:

  1. 多重採樣(rollout sampling):對每一個 prompt,模型獨立採樣 G 條完整的推理軌跡(論文預設 G=8),並從每條軌跡中抽取最終答案。
  2. 多數投票構造偽答案(pseudo-solution):透過自我一致性(self-consistency)投票,選出出現頻率最高的答案作為偽解;同時設定一個一致性門檻(threshold),只有當多數答案的比例超過門檻時,才認為這個偽答案足夠可信,可以用來指導後續訓練。
  3. 在分歧軌跡上蒸餾(distill on disagreeing completions):將模型在「與偽答案一致」的軌跡上的分佈,視為教師分佈,並以此為條件,對「與偽答案不一致(分歧)」的軌跡進行蒸餾——也就是說,模型被要求去修正自己在「確信但錯誤」(confidently wrong)之處的行為。這一步的精妙之處在於:不是簡單地強化正確答案、懲罰錯誤答案(像 GRPO 那樣需要 ground-truth 判斷對錯),而是讓模型向「自己更自洽的那部分行為」看齊。

在具體的散度計算上,作者做了消融實驗,比較了不同的分佈匹配方式,發現前向 KL 散度(forward KL divergence)的效果最好。他們也測試了不同的採樣數量 G 與一致性門檻設定,確認 G=8 是效果與成本之間較好的平衡點。值得一提的是,論文測得這種多數投票產生的偽標籤,與真實 ground-truth 答案的吻合率高達 86.7%——這說明即便完全不使用標籤,U-OPSD 所構造出的訓練訊號本身已具備相當高的品質,這也是整個方法能夠成立的關鍵前提。

實驗結果

作者在 Qwen3 系列模型(包含 4B、8B,以及 Qwen3-4B-Instruct-2507、Qwen3-30B-A3B-Instruct-2507 等變體)上,於五個數學推理 benchmark 上進行評測:AIME24、AIME25、HMMT25(採 avg@12 指標)、以及 MATH500、AMC23(採 avg@4 指標)。

non-thinking(非思考)模式下:

  • Qwen3-4B:U-OPSD 相較於基礎模型(base model)平均提升 8.5%;相較於監督式的 OPSD 方法,再多出 3.2% 的優勢。
  • Qwen3-8B:相較於基礎模型提升 10.7%;相較於 OPSD 領先 2.3%

thinking(思考鏈)模式下:

  • U-OPSD 與監督式 OPSD 表現大致持平——4B 模型領先 0.9%,8B 模型則基本打平。
  • 與另一個強力的強化學習基線 GRPO(Group Relative Policy Optimization,同樣需要 ground-truth 獎勵)相比,U-OPSD 在 4B、8B 上分別領先 0.7%1.1%

作者也坦承這種優勢是「regime-dependent(依情境而定)」的:在 thinking 模式下,由於基礎模型的準確率本身已經超過 74%,可供修正的「分歧空間」變小,因此 U-OPSD 相對於監督式方法的增益也隨之縮小。但即便如此,在完全不使用任何標籤或外部教師的前提下,U-OPSD 依然能達到與使用 ground-truth 的 OPSD、GRPO 相當甚至更好的水準,這本身就是一個相當顯著的結果。

意義

這篇論文的意義在於,它把「self-distillation」這個詞的定義,從「模型蒸餾自己過去的輸出分佈」推進到「模型完全依靠自身生成內容的內部一致性來自我修正」,不再需要 ground-truth 標籤、環境回饋,或更強大教師模型的介入。這對於實務上有幾層重要影響:

第一,降低後訓練的資料門檻。許多真實世界的任務(例如開放式寫作、複雜的多步驟決策)本來就缺乏可驗證的標準答案,傳統 RLHF 或 GRPO 等方法在這類場景中難以直接套用;U-OPSD 這種只需模型自我採樣、自我投票的機制,理論上可以延伸到這些沒有明確 ground-truth 的領域。

第二,成本效益。不需要額外部署一個更大的教師模型,也不需要人工標註或建構獎勵模型,大幅降低了後訓練所需的工程與算力成本,同時仍能拿到接近甚至超越監督方法的效果(尤其是在 non-thinking 模式下 2–3 個百分點的領先)。

第三,對於研究「self-consistency」與「模型置信度」之間關係的社群而言,86.7% 的偽標籤準確率這一數字,也提供了一個實證證據:模型自身多次採樣的一致性,本身就蘊含著相當可靠的監督訊號,這與長期以來 self-consistency decoding、self-refine 等研究路線的直覺相互印證,但 U-OPSD 首次把它系統性地整合進 on-policy distillation 的訓練迴路中。

當然,論文也誠實指出了局限:在 thinking 模式、且基礎模型準確率已經很高的情境下,U-OPSD 的邊際效益會縮小,因為模型「自信但錯誤」的樣本本來就少,可修正的空間有限。未來如何將這套機制擴展到數學以外的領域(例如程式碼生成、開放式對話),以及如何處理「多數投票本身就錯」的系統性偏誤,會是後續值得關注的方向。整體而言,U-OPSD 為「無監督後訓練」提供了一條具體可行且已被多個模型規模驗證過的路徑,對於資源有限、又想持續提升模型推理能力的團隊,具有相當高的參考價值。

當AI不只做完任務,而是真正理解你:ComBodied Agents的人本智能新典範

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

Qianggang Ding、Xingyao Wang、Rui Feng、Zhibin Wang、Feixiang Wang、Kelong Mao、Hao Sun、Zhiyao Luo175Hugging FacearXiv
Agentic AI人機互動老年照護世界模型AI Companion

背景

想像一個情境:一位獨居長者忘了吃藥。今天的軟體代理人(Digital Agent)能做的,是再發一則提醒通知;具身代理人(Embodied Agent),例如居家機器人,則能把藥物實際拿到長者面前。但這兩種agent都答不出一個更關鍵的問題——這個人到底為什麼沒吃藥?是單純忘記、認知混亂、身體出現副作用,還是他其實是有意識地拒絕服藥?不同的原因,對應的支持方式完全不同,而現有的Agentic AI系統對此幾乎一無所知。

這篇由Qianggang Ding、Bang Liu(來自Université de Montréal / Mila)領銜、集合22位跨加拿大、新加坡、中國、英國、香港等地學者(包括Dacheng Tao等知名研究者)共同撰寫的38頁長文(含6張圖、10張表,arXiv編號2608.10915,2026年8月11日提交、8月12日更新第二版),指出當前Agentic AI存在一個結構性缺口:Digital Agent主要轉換「軟體狀態」(software states),Embodied Agent主要轉換「物理狀態」(physical states),但沒有一種agent把「人本身持續演變的狀態與自主性(agency)」當作建模、介入與評估的核心對象。換句話說,現有系統把「完成任務」當終點,卻沒有人真正把「這個人現在過得好不好、能不能自己做決定」當作系統該持續追蹤與服務的目標。

作者將個人助理(personal assistants)、健康照護agent、AI陪伴系統(AI companions)、自適應人機系統(adaptive human-AI systems)等目前彼此分散發展的能力,統整為一個新的典範:ComBodied Agents。

方法

ComBodied Agents的核心主張是:軟體工具、感測器、穿戴裝置、機器人、甚至人力服務,都只是「行動管道」(action channels),而不是agent的終極目標——真正的目標是理解並支持一個人隨時間演變的狀態軌跡(human-state trajectory)。

論文把這個構想具體化為一個閉環系統,由四個核心模組組成:

  1. 事件式多模態感知(event-based multimodal perception):不是單純收集原始感測數據,而是主動從語言、語音、視覺、生理訊號(physiological signals)、動作行為、社交資料、環境情境、臨床紀錄等多種模態中,重建出「有意義的個人事件」——例如判斷一次沉默究竟是「累了」還是「生氣了」。

  2. 可修正的長期記憶(longitudinal, correctable memory):記錄跨時間的事件、目標、過往介入措施與其結果,為系統提供時間脈絡,且允許使用者本人隨時修正記憶內容,避免系統對使用者形成錯誤或過時的認知。

  3. 個人世界模型(Personal World Models, PWMs):這是方法論上最具野心的部分——類似於強化學習中的world model概念,PWM會針對「如果採取介入A vs. 介入B vs. 不介入」等不同決策分支,預測使用者未來狀態與結果的演變軌跡,讓agent能「模擬後果」再行動,而非直接反應。

  4. 可容許的介入政策(admissible intervention policy):在採取任何行動前,系統必須同時滿足同意(consent)、不確定性(uncertainty)、安全性(safety)、可逆性(reversibility)與使用者控制權(user control)五項條件,才會選擇「恰如其分」的支持方式——避免過度介入侵犯自主性,也避免介入不足而失職。

整個循環最後透過使用者與環境的回饋不斷更新迭代。作者特別強調,系統不需要建構一個鉅細靡遺的「人類數位分身」(Human Digital Twin),而是採用「目的受限、具不確定性意識、使用者可修正」(purpose-bounded, uncertainty-aware, user-correctable)的輕量表徵方式——這既降低隱私風險,也避免過度工程化。

此外,論文提出部署架構的三個階段:第一階段是雲端中心化(cloud-centric),第二階段是邊緣—雲端混合協作,第三階段則是邊緣原生個人模型(edge-native personal models),讓敏感的個人狀態資料盡可能留在使用者裝置端運算,呼應資料主權與隱私保護的長期趨勢。

實驗結果

需要說明的是,這是一篇立場性/框架性論文(position paper),而非提出新模型並在標準benchmark上刷分的實證研究,因此文中沒有類似「準確率提升X%」這類傳統實驗數字。取而代之的,是作者對「設計空間」(design space)與「評估體系」的系統化梳理:

  • 論文以三個維度組織ComBodied Agents的設計空間:人類狀態目標(human-state targets,例如健康、情緒、認知狀態)、關係情境(relational contexts,例如照護者—被照護者、陪伴關係)、以及agent角色(agent roles)。
  • 針對評估方法,作者主張採用「情境中心式評估」(scenario-centered evaluation)取代單純的任務完成率,並提出「自主性保存指標」(agency-preservation metrics)——衡量系統介入後,使用者的自我決定能力與能力成長(capability growth)是否受到侵蝕,而不只是看任務有沒有完成。
  • 文中列出benchmark設計應涵蓋的要求,包括長期陪伴下的關係安全性(relationship safety)、長期福祉(long-term wellbeing)、自主性保留(autonomy retention)等面向,並指出現有的agent評測(多聚焦於單次任務成功率)完全無法捕捉這些長期人本指標。
  • 感知模態部分,論文系統性地列舉了語言、語音、視覺、生理訊號、動作/行為、社交、環境情境、臨床紀錄等至少8種模態各自的取得方式與不確定性特徵,作為未來系統設計的參考基準。

換言之,這篇論文的「實驗結果」是一套經過系統化論證的評估框架與設計準則,而非量化的模型效能對比。

意義

ComBodied Agents最重要的貢獻,在於把「以人為本」從口號變成一套具體可操作的系統設計方法論。當前AI agent的競賽多半圍繞在「能不能完成更複雜的任務」——訂票更準、寫程式更快、機器人抓取更穩,但這篇論文提醒我們:對於老年照護、心理健康支持、慢性病管理、AI陪伴等應用場景,「完成任務」本身可能不是重點,「理解一個人為什麼會這樣、該不該介入、介入到什麼程度」才是關鍵。

這對產業有幾個直接啟示:第一,健康科技與陪伴型AI產品的評測標準需要改變,不能只看任務成功率,還要衡量是否保護了使用者的自主權與長期福祉,避免打造出「過度貼心但侵蝕使用者能力」的系統(例如長期依賴提醒導致使用者記憶力退化)。第二,Personal World Models這個概念,為「先模擬後果再行動」的agent設計提供了新方向,未來個人化AI或許會像自動駕駛的世界模型一樣,先在內部推演多種介入方案的長期影響再做選擇。第三,邊緣原生部署路線圖呼應了近年對資料隱私與使用者控制權的高度重視,對於處理健康、情緒等高敏感資料的AI公司,這將是產品架構上的重要參考。

雖然論文本身未提供實證模型與benchmark分數,但作為一篇整合性框架論文,它精準地指出了當前Agentic AI研究(不論是Digital Agent或Embodied Agent陣營)共同忽略的盲點,也為後續研究者提供了明確的評估指標與設計空間座標。對於正在開發長者照護機器人、心理健康聊天機器人、AI伴侶應用的團隊而言,這篇論文值得作為系統設計與評測方法的重要參考起點。

打破人類框架:AI Agent「共同演化」如何邁向自我設計的智慧系統

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

Qing Zong、Jiayu Liu、Junhao Shen、Zecong Tang、Linsi Wu、Yuxuan Liu、Rui Wang、Zhaowei Wang120Hugging FacearXiv
Agentic AISelf-EvolutionMulti-AgentLLMSurvey

背景

過去兩年,「讓 AI agent 部署後持續變強」成為業界顯學,從 self-refine、self-training 到各種 self-evolution 方法層出不窮。但這篇由 Qing Zong、Yangqiu Song 等 12 位研究者於 2026 年 8 月共同發表的綜述論文(arXiv:2608.10299)指出一個根本瓶頸:絕大多數「自我演化」其實只是單一 agent 在固定任務、固定回饋訊號下自我迭代——訓練環境本身是靜態的天花板,agent 練得再久,終究被人類事先設計好的任務分佈與獎勵函數框住。

論文提出的核心概念是「co-evolution(共同演化)」:當系統中存在多個會互相施加適應壓力的組成部分——可能是多個 agent 之間,也可能是 agent 與環境之間——演化就不再受限於單一靜態情境,而是一個動態、開放式的過程。作者將既有文獻整理成一套漸進式的三階段分類法(three-stage taxonomy),描述系統如何一步步擺脫人類工程設計的束縛,朝向所謂「beyond human design」的自我導向演化前進。

方法

論文的分類架構分為三個層次,每一層代表 agent 擺脫的人類設計限制又多了一層:

第一階段:Agent–Agent Co-Evolution。 agent 透過與「動態對手/夥伴」互動來成長,環境本身仍固定,但互動對象會隨著自己一起變強。這裡又細分為三種模式:對抗式(adversarial,例如 GAN 中生成器與判別器互相拉扯、RARL 的攻防式強化學習、SPAG 的猜詞博弈)、協作式(collaborative,例如多 agent 樹狀搜索框架 MARS 2、以互動生成獎勵訊號的 CoMAS)、以及組織式(organizational,多個 agent 形成類似分工團隊的結構共同適應)。經典案例如 AlphaStar 的 league training、TriPlay-RL 的三方角色演化,都屬於此類。

第二階段:Agent–Environment Co-Evolution。 演化的對象從「對手」擴展到「環境」本身——任務空間、回饋機制、互動介面都會隨 agent 能力而變。任務空間上,課程學習(curriculum learning)與自適應任務生成(如 GenEnv、Agent0、WebRL)會利用 agent 失敗的案例自動產出更難、更貼近能力邊界的新任務;回饋空間上,系統改用偏好模型或結果導向獎勵取代人工標註;互動空間上,像 WebEvolver、COMAP、DreamGym 這類「world model」方法會合成模擬經驗,讓 agent 在更豐富、更快速迭代的虛擬互動空間中學習。

第三階段:Meta Co-Evolution。 這是最前沿也最少被真正實現的層次——演化機制本身也變成可演化的對象。也就是說,系統不僅學會「做什麼」,還學會調整「何時演化、如何演化、在哪裡演化」以及評估自身進步的標準。作者認為這是通往「open-endedness(開放式演化)」——即持續產生新穎性、能力不設上限成長——的關鍵路徑,但坦承目前符合這個定義的具體實作仍非常有限,多停留在概念層次。

實驗結果

作為一篇綜述,本文並未提出新模型或跑新的 benchmark 實驗,而是系統性梳理並歸類數十篇代表性工作,把它們放進上述三階段框架中比較。例如在 agent-agent 層,GAN、RARL、SPAG 展示對抗式訓練能讓雙方能力同步提升;AlphaStar 的 league training 證明多對手池訓練可產生比單一自我對弈更穩健的策略;在 agent-environment 層,GenEnv、Agent0、WebRL 等系統顯示「利用失敗案例自動生成新任務」能持續推高任務難度、避免 agent 停滯在舒適區;WebEvolver、DreamGym 等世界模型方法則證明合成互動經驗可大幅降低真實環境採樣成本,加速訓練迭代速度。

論文同時指出目前這個領域的三大待解難題:第一是動態評估(dynamic evaluation)——現有 benchmark 大多只衡量模型「當下的最終能力」,無法追蹤「演化過程」本身是否健康,作者建議引入歷史交叉對戰(historical cross-play)、組件消融實驗、保留評估者(held-out evaluators)等更細緻的過程級測試方法;第二是規模化(scaling)難題——目前多數系統只研究單一封閉的演化迴圈,未來需要同時協調 agent、執行框架(harness)與環境三者的並行演化;第三是安全與治理——當演化過程越來越自主,可能出現「evaluator exploitation(鑽評估漏洞)」、「partner overfitting(對特定夥伴過度擬合)」、「diversity collapse(多樣性崩潰)」等風險,系統需要具備可審計、可中斷的機制,並保留人類介入的節點。

意義

這篇綜述的價值不在於提出新演算法,而在於替一個快速膨脹但術語混亂的研究方向,建立一套清晰、可延展的座標系統。過去「self-evolving agent」這個詞被廣泛套用在從簡單的 self-refine 到複雜的多 agent 訓練框架等各種不同尺度的方法上,而這篇論文透過「agent-agent → agent-environment → meta」的三階遞進結構,讓研究者可以清楚定位自己的工作到底解除了多少層「人類設計的束縛」。

更重要的是,它把「安全可控」與「能力提升」放在同一個討論框架下,而不是事後補充的附註。隨著 co-evolution 系統朝 open-endedness 邁進——也就是能力可能沒有上限、演化路徑也不再由人類預先規劃——論文提出的評估者被利用、多樣性崩潰等風險將不再是理論假設,而是工程團隊必須在系統設計階段就內建護欄的現實問題。對於正在打造長期自我改進型 agent 產品(例如自動化 coding agent、多 agent 協作系統)的團隊而言,這套框架提供了一個判斷「我們的系統演化到哪一階段、下一步該往哪個方向擴展、又該在哪裡設下安全閥」的實用地圖。