← 目錄

K1 論文詳解

2026-07-15


以弱御強:用「直接在策略上蒸餾」把小模型的強化學習成果轉移給大模型

Weak-to-Strong Generalization via Direct On-Policy Distillation

BytedTsinghua-SIAShiyuan Feng、Huan-ang Gao、Haohan Chi、Hanlin Wu、Zhilong Zhang、Zheng Jiang、Bingxiang He、Wei-Ying Ma93Hugging FacearXiv
強化學習LLM推理知識蒸餾RLVRQwen3

背景

近年來,提升語言模型推理能力最有效的手段之一是「可驗證獎勵的強化學習」(RLVR,Reinforcement Learning with Verifiable Rewards):讓模型對一道數學題或程式題產生多個解答(rollout),再用「答案對不對」這種可自動驗證的訊號當獎勵,反覆訓練模型往正確方向調整。這套方法在 AIME、MATH、LiveCodeBench 等推理型 benchmark 上屢屢見效,但代價是訓練成本會隨模型尺寸暴漲——因為每次更新都要目標模型自己生成大量 rollout,模型越大,生成與訓練的開銷就越誇張。換句話說,post-training(訓練後強化)正逐漸變成大模型迭代的瓶頸:每出一顆新的旗艦模型,都得重新跑一輪昂貴的 RLVR。

一個自然的念頭是「以小博大」:既然小模型的 rollout 便宜很多,能不能先在小模型上做 RL,再把學到的東西「轉移」給更強的大模型,省下大模型自己跑 RL 的成本?最直覺的做法是把 RL 訓練完的小模型(弱教師)直接當成蒸餾的老師,讓大模型(強學生)模仿它的輸出分布。但論文指出,這樣做效果有限,因為弱教師最終的策略,其實是「RL 帶來的進步」和「小模型本身能力有限」兩者混在一起的產物——直接模仿等於把教師的缺點也一併複製過去。真正有價值的,是 RL 這個過程本身「新增」了什麼,而不是教師最終長什麼樣子。

方法

論文提出的 Direct On-Policy Distillation(Direct-OPD),核心想法是「只轉移 RL 造成的策略位移(policy shift),而不是轉移教師的最終策略」。具體做法是:對同一個弱模型,保留 RL 訓練前的版本(reference policy)與 RL 訓練後的版本(post-RL teacher),把兩者對同一個輸出的 log 機率做差,也就是取兩者的 log-ratio。這個 log-ratio 本質上回答了一個問題:「RL 讓這個小模型更傾向、還是更不傾向做出這個動作?」它自然形成一個密集(dense)的隱式獎勵訊號,不需要另外設計獎勵函數,也不需要答案是否正確這種稀疏訊號。

拿到這組隱式獎勵之後,Direct-OPD 並不是把它套用在弱教師自己的樣本上,而是讓強學生模型自己生成 on-policy 的輸出(即學生模型在自己的狀態分布上探索),再用教師這組「訓練前後差異」的訊號去評分、調整學生的策略。這樣一來,學生不必去啟動一輪昂貴、獎勵稀疏的 RLVR 訓練,卻能吃到本來只有靠大量 rollout 才換得到的 RL 監督訊號。由於這個訊號是「一對 checkpoint 的差異」,理論上也能把多個獨立的小規模 RL 成果依序疊加(sequential composition),一次次把不同的策略位移灌進同一個學生模型裡,累積效果。整體訓練流程比傳統 RLVR 精簡許多,不需要學生模型自己跑龐大的 rollout 與獎勵驗證迴圈。

實驗結果

論文在 Qwen3 系列模型上驗證了這個方法。最亮眼的結果是:把一個經過 RL 訓練的弱教師的策略位移,透過 Direct-OPD 轉移給 Qwen3-1.7B 之後,該模型在 AIME 2024(美國數學邀請賽風格的高難度題目集)上的準確率從 48.3% 提升到 58.3%,整整拉高 10 個百分點,而且整個訓練只花了 8 張 A100 GPU、大約 4 小時就完成——遠比讓 1.7B 模型自己跑一整輪 RLVR 便宜。

論文也做了「步數對齊」(step-matched)的直接 RL 對照實驗,也就是讓學生模型自己跑同樣訓練步數的傳統 RLVR,結果 Direct-OPD 依然勝出,顯示問題不只是「訓練不夠久」,而是直接蒸餾教師最終策略、或直接對學生做稀疏獎勵 RL,效率本來就不如轉移「策略位移」這個訊號來得高。此外,實驗也驗證了序列疊加多個策略位移的可行性——換句話說,不同批小規模 RL 實驗的成果,可以像拼圖一樣逐步組合進同一個強模型裡,而不必每次都從頭重跑。整體而言,這套方法在多個推理任務與模型組合上,都穩定地讓「較弱的教師」提升「較強的學生」,證明了 weak-to-strong 的可行性並非個案。

意義

這篇論文的關鍵洞見,是重新定義了 RL 訓練成果可以被「重複使用」的方式:以往我們預設 RL 訓練完的模型本身就是終點——要嘛拿去部署,要嘛拿它的輸出去做傳統蒸餾。但 Direct-OPD 指出,RL 訓練前後的「差異」(也就是 log-ratio)本身就是一種可攜式的知識資產,可以脫離原本的模型尺寸,套用到完全不同、甚至更大的模型上。這意味著未來的模型迭代,不必每次都為新的旗艦模型從零開始跑一整輪昂貴的 RLVR:團隊可以在便宜的小模型上不斷做實驗、產生一堆「策略位移」,再用類似 Direct-OPD 的方式,把這些成果注入到正式要上線的大模型裡,甚至疊加多次實驗的成果。

對於資源有限的團隊而言,這種做法把「探索」與「規模化」拆開:探索階段用小模型、低成本試錯,規模化階段用便宜的蒸餾式訓練取代昂貴的 rollout 循環。以 4 小時、8 張 A100 就能把 AIME 2024 準確率從 48.3% 推到 58.3% 為例,這樣的效率提升,對於需要頻繁迭代模型、又不想每次都吃下全套 RLVR 算力帳單的實驗室來說,具有相當實際的參考價值,也為「RL 成果的可轉移性」開啟了新的研究方向。

ABot-N1:用「慢思考、快動作」打造通用視覺語言導航基礎模型

ABot-N1: Toward a General Visual Language Navigation Foundation Model

Alibaba AMAP CV LabRuiyan Gong、Yingnan Guo、Junjun Hu、Jintao Kong、Xiaoxu Leng、Tianlun Li、Weize Li、Fei Liu81Hugging FacearXiv
視覺語言導航具身智慧機器人Chain-of-Thought基礎模型

背景

在機器人與具身智慧(embodied AI)領域,「視覺語言導航」(Visual Language Navigation, VLN)一直是連接語言理解與實體移動的核心難題:機器人要看懂影像、理解人類指令(例如「走到那個紅色郵筒旁邊」),並在複雜的室內外環境中規劃出一條可執行的路徑。過去多數方法採用「單體式策略」(monolithic policy),也就是用一個端到端的神經網路直接把攝影機觀測映射成動作指令。這種做法雖然簡單,卻長期受兩個問題困擾:一是「座標漂移」(coordinate drift),模型在長距離移動後容易累積誤差、逐漸偏離真正目標;二是對「長尾語意」(long-tail semantics)的處理很弱,也就是碰到訓練資料中少見的物件描述或場景時容易失效。此外,這類黑盒模型缺乏可解釋性,工程師很難知道機器人「為什麼」選擇某條路徑,這對於安全性要求高的城市級或戶外部署是一大障礙。

由 46 位作者組成的研究團隊(arXiv 編號 2607.10383,2026 年 7 月投稿,分類屬電腦視覺 cs.CV、人工智慧 cs.AI 與機器人 cs.RO)因此提出 ABot-N1,目標是打造一個能同時兼顧「通用性、穩健性、可解釋性」三者的視覺語言導航基礎模型,並特別鎖定過去研究較少觸及的「城市尺度導航」(urban-scale navigation)場景,例如在真實街道環境中尋找興趣點(POI, Point of Interest)。

方法

ABot-N1 的核心創新是把「認知」(cognition)與「控制」(control)拆解開來,採用「慢-快雙軌架構」(slow-fast architecture),並由「視覺-語言雙重訊號」引導:

  1. 慢速視覺語言推理器(slow vision-language reasoner):這部分負責執行顯式的 Chain-of-Thought(CoT)推理,把指令與影像結合後,逐步推導出一個「像素目標」(pixel goal)——也就是在影像座標空間中標出一組緊湊的「錨點」(anchor points)。這組像素錨點成為一個統一介面,可以同時支援五種任務:point-goal(指定座標點)、object-goal(指定物件)、poi-goal(指定興趣點)、instruction-following(自然語言指令跟隨)以及 person-following(跟隨特定人物)。

  2. 快速動作專家(fast action expert):拿到慢速推理器產生的像素錨點與文字線索後,這個模組以機器人原生的控制頻率,即時生成連續的路徑點(waypoints),驅動實際移動。

這種設計的巧妙之處在於:像素錨點是「影像空間」中的具體座標,天生就不會像純語言指令那樣模糊,也不像純座標系統那樣容易隨著里程計誤差累積而「漂移」;同時,由於推理過程保留了顯式的語言軌跡(linguistic traces),整個決策鏈是可以被人類回溯檢查的,不再是純黑盒。換句話說,高層意圖(人類指令)與底層控制(馬達動作)之間,透過「像素錨點+文字推理」這座橋樑被有效連接起來,兼顧了語意理解的深度與動作執行的精確度。

實驗結果

研究團隊在模擬環境與真實世界的多個 benchmark 上驗證了 ABot-N1,並額外釋出了全新的 Point-Goal 與 POI-Goal benchmark 供社群開源使用。主要成果包括:

  • 城市尺度 POI 導航:POI 抵達率(POI arrival rate)大幅提升 35.0 個百分點,達到 77.3%,是論文中被強調的「massive gains」代表性數字,顯示模型在真實街景中尋找興趣點的能力有質的飛躍。
  • 室內複雜場景:成功率(Success Rate, SR)達到 95.4%。
  • 室外複雜場景:SR 達到 92.9%。
  • 其他任務穩健性:在物件抓取/到達(object-reaching)、person-following、instruction-following 等多種任務上,ABot-N1 也維持了優於既有方法的表現,證明「慢-快」架構並非只針對單一任務調優,而是具備跨任務的泛化能力。

整體而言,論文宣稱 ABot-N1 在上述多個 benchmark 上刷新了「state-of-the-art」紀錄,尤其在此前研究較少涉足、難度也更高的城市級導航場景中取得顯著突破。

意義

ABot-N1 的價值不只在於數字上的提升,更在於它示範了一種可能取代「端到端黑盒策略」的替代路線:把導航拆成「推理(慢)+控制(快)」兩層,並用「像素目標」作為兩者之間的通用語言。這帶來幾個實際好處。第一,可解釋性——工程師可以看到模型的 Chain-of-Thought 文字推理與它標出的像素錨點,出錯時更容易除錯與追責,這對機器人在城市街道、商場等公共空間中部署時的安全審查尤其重要。第二,通用性——同一套介面(像素錨點)能無縫支援 point-goal、object-goal、poi-goal、指令跟隨與人物跟隨五種任務型態,意味著同一個基礎模型可以被部署到送貨機器人、導覽機器人、陪伴型機器人等不同產品線,而不需要為每個任務重新訓練一套策略。第三,穩健性——透過像素空間的錨點設計,模型較不易受里程計累積誤差(座標漂移)影響,也比純語言指令更能處理訓練資料中少見的長尾物件描述。

隨著具身智慧與人形/輪式機器人在城市場景(外送、巡邏、陪伴)中的應用逐漸普及,「城市尺度導航」將是下一階段的關鍵戰場,而目前多數 VLN 研究仍聚焦於室內模擬環境。ABot-N1 在戶外 POI 導航上 77.3% 的抵達率與 92.9% 的室外 SR,加上開源釋出的新 benchmark,為後續研究者提供了具體的評測基準與可複現的比較對象,也讓「慢-快雙軌、像素目標介面」這種設計思路,有機會成為未來通用導航基礎模型的標準範式之一。

ABot-AgentOS:給機器人裝上「終身記憶」的通用代理作業系統

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

Alibaba AMAP CV LabJiayi Tian、Shiao Liu、Yuting Xu、Jia Lu、Zihao Guan、Honglin Han、Di Yang、Minqi Gu68Hugging FacearXiv
具身智能機器人多模態記憶AgentOSbenchmark

背景

近年來 VLM(視覺語言模型)與 VLA(視覺-語言-動作模型)大幅提升了機器人的感知與動作預測能力,讓機器人能「看懂」場景並直接輸出控制指令。但這類系統普遍只解決「當下這一步該怎麼動」,一旦任務拉長到需要規劃、記住過去發生的事、跨房間跨場景執行、甚至換一台機器人繼續做同一件事,現有的低階控制器就顯得力不從心。換句話說,業界缺一層「通用運行層」——負責推理、記憶、工具呼叫、結果驗證與跨本體(cross-embodiment)執行的中介系統,就像手機需要作業系統來排程各種 App 一樣。

由 Jiayi Tian 等 27 位作者於 2026 年 7 月提出的 ABot-AgentOS,正是要補上這一層。論文同時指出評測方式的缺口:目前少有能同時考驗「長時程具身任務」與「持久記憶能力」的可執行 benchmark,因此他們也一併推出了 EmbodiedWorldBench。

方法

ABot-AgentOS 架設在低階控制器之上,扮演「審議式代理層(deliberative agent layer)」,核心設計包含五個模組:

  1. 場景條件式規劃(scene-conditioned planning):規劃時會即時納入當前場景的視覺與空間資訊,而非憑空生成固定腳本。
  2. 情境隔離的技能執行(context-isolated skill execution):每個技能(如導航、抓取、對話)在獨立情境中執行,避免不同任務間互相污染狀態。
  3. 多階段驗證(multi-stage verification):任務執行後有分層檢查機制,確認每一步的結果是否符合預期,而不是「動作做完就算數」。
  4. 多模態記憶:這是全文的重點,稱為 Universal Multi-modal Graph Memory(通用多模態圖記憶)。它把對話紀錄、視覺觀察、空間關係、時間關係、以及任務執行軌跡,統一轉換成「有型別的節點與邊」,構成一個可持久保存、可追溯來源(source-grounded)的知識圖譜,讓機器人在數天甚至數週後仍能「記得」曾經看過什麼、去過哪裡、和誰說過什麼話。
  5. 邊緣-雲端協作(edge-cloud collaboration):把即時反應留在邊緣(機器人本體),把耗算力的推理與長期記憶檢索交給雲端,兼顧延遲與能力。

此外,論文提出「失敗驅動的自我進化迴圈(failure-driven self-evolution loop)」:系統會診斷記憶失敗的案例(例如記錯物品位置、誤判時間順序),把這些診斷結果轉化成「運行期進化資產(evo-assets)」。關鍵設計是這些新資產會經過「閘門(gated)」機制,只被允許用在之後的評測分割(split)上,而不會回頭套用在產生失敗案例的那一個分割——這是為了避免「用答案來訓練考卷」的資料洩漏問題,同時仍保留持續改進的空間。

為了評測這整套系統,論文提出 EmbodiedWorldBench:一個可執行(executable)的具身智能 benchmark,涵蓋 16 個室內、室外、混合場景,設有 4 個難度等級,超過 200 個任務,任務類型包括導航、物品搜尋、與 NPC(非玩家角色)對話、動態事件應對,並採用「軌跡對齊評分(trace-grounded scoring)」——也就是不只看任務最終是否成功,還會核對整個執行軌跡是否合理、可追溯。

實驗結果

在 EmbodiedWorldBench 的初步子集上,ABot-AgentOS 相較於「單一控制器」基線(即沒有這層代理作業系統、僅靠 VLA 直接控制的做法),在任務成功率(task success)與目標完成度(goal completion)兩項指標上都有提升,驗證了「加一層通用代理層」確實比單純堆疊更強的底層控制模型更有效。

在記憶能力相關的既有 benchmark 上,論文也給出具體分數。ABot-AgentOS 的靜態版本(Static,即尚未套用自我進化)成績為:

  • LoCoMo(長對話記憶測試):87.5 分
  • OpenEQA 的 EM-EQA 子任務(具身環境問答):59.9 分
  • Mem-Gallery(多模態記憶檢索):88.6 分
  • NExT-QA 的 Acc@All(視訊問答準確率):76.5 分

導入失敗驅動的自我進化迴圈後,三項指標進一步提升:LoCoMo 從 87.5 升到 88.7(+1.2)、OpenEQA 從 59.9 升到 60.4(+0.5)、Mem-Gallery 從 88.6 升到 89.0(+0.4)。雖然單看數字增幅不算誇張(0.4~1.2 分),但重點在於這是「在不洩漏答案的前提下持續自我修正」所取得的進步,說明這套進化機制是穩健而非取巧達成的。

意義

這篇論文傳達的核心訊息是:機器人要真正做到「長時程、跨場景、跨機型」的實用任務,光靠更強的感知-動作模型是不夠的,還需要一層通用的「代理作業系統」來統籌規劃、記憶與驗證——這和個人電腦當年從單一程式進化到有作業系統管理多工、多資源的邏輯類似。

Universal Multi-modal Graph Memory 把多種模態統一表示成圖結構節點與邊,這種設計讓記憶「可稽核(auditable)」——每一條記憶都能回溯到原始的對話、影像或軌跡來源,這對機器人在家庭、辦公室等真實場景長期服務、且需要對錯誤負責的應用(例如照護機器人記錯病人服藥時間)尤其關鍵。

而「失敗驅動自我進化 + 閘門化評測分割」的設計,示範了一種在持續學習與防止資料洩漏之間取得平衡的方法論,這對整個 embodied AI 領域的評測公信力有參考價值——目前不少長期記憶或持續學習系統的評測容易因為「用測試集訓練」而灌水,這篇論文的分割隔離機制提供了一個相對嚴謹的範本。

EmbodiedWorldBench 本身也可能成為後續研究的公共基礎設施:200+ 個橫跨室內外、4 個難度層級的可執行任務,加上軌跡對齊評分,補足了目前具身智能評測偏重單一動作精度、缺乏長時程綜合任務的空白。整體而言,這篇工作把焦點從「機器人能不能看懂、能不能動」往前推進到「機器人能不能記住、能不能持續變得更好」,是具身智能從單點感知走向系統化長期服務的一個重要嘗試。