← 目錄

K1 論文詳解

2026-08-08


RST遞迴合成法:讓終端機代理的長任務訓練資料自動長出難度

Recursive Synthesis for Long-Horizon Terminal Tasks

Tencent HunyuanZhongzhi Li、Yucheng Shi、Zongxia Li、Ruhan Wang、Anhao Li、Zixun Huang、Junyao Yang、Lei Ke212Hugging FacearXiv
LLM智能體終端機任務資料合成強化學習SFT微調

背景

要訓練一個能在終端機(terminal)裡完成複雜任務的AI代理,最大的瓶頸不是模型架構,而是「訓練資料」。一個高品質的長任務(long-horizon task)必須同時具備四項互相一致的元素:任務指令、可執行的環境、一份參考解法,以及能自動判斷任務是否完成的驗證器(verifier)。這四者只要有一項脫節——例如指令要求的行為驗證器沒檢查,或參考解法在乾淨環境裡跑不過——這筆資料就是廢的。

過去要產出這種資料,幾乎只能靠人工撰寫,單筆成本可以高達數百到數千美元,完全無法規模化。而直接讓大型語言模型(LLM)生成任務雖然便宜,卻常常打破指令、環境、解法、驗證器之間的一致性——LLM很會編故事,但很難保證四個檔案彼此對得上。這就是本篇論文《Recursive Synthesis for Long-Horizon Terminal Tasks》要解決的核心問題:如何低成本、大規模地生成「難度可控且驗證可靠」的終端機任務。

方法

作者提出的框架叫 RST(Recursive Synthetic Terminal Tasks,遞迴驗證合成),核心想法是「站在已驗證任務的肩膀上,一步步把任務改得更難」,而不是每次從零生成。整個流程從 TerminalWorld 提供的 639 個已驗證的種子任務(seed tasks)出發,每一輪(round)執行四個步驟:

  1. 種子挑選與多樣性控制:對種子的家系(parent lineage)、任務類別、改寫家族、生成批次都設定上限,避免某一種模式的任務無限繁殖,壓垮多樣性。
  2. 改寫目標選擇:系統從 40 種「改寫運算子(rewrite operators)」中挑選,這些運算子分屬五大家族,包括設定與控制狀態、資料與結構描述狀態、檔案系統與資源綁定、建置與快取產物狀態,以及執行期工具與診斷。
  3. 改寫執行:關鍵順序是先擴充參考解法(讓它做更多事),再回頭同步更新環境、驗證器與公開指令——也就是先讓「可執行的行為」變複雜,再讓「規格文件」跟上,避免規格與行為脫鉤。
  4. 沙盒驗證:新任務要經過靜態檢查、抓「抄捷徑」漏洞的稽核,以及在全新沙盒(sandbox)中的實跑驗證。這裡分兩種有效性:oracle validity(參考解法必須能讓驗證器判定通過)與 contract validity(公開指令必須包含解題所需的全部資訊,不能隱藏關鍵條件)。

通過驗證的任務會被收進任務池,並作為下一輪的新種子,如此遞迴 15 輪。每個任務最終由五個檔案組成:instruction.md(公開描述)、task.toml(執行期中繼資料)、environment/Dockerfile(初始工作環境)、solution/solve.sh(參考解法)、以及 tests/ 下的私有驗證腳本。

實驗結果

規模與成本上,RST 在 15 輪內從 639 個種子擴增出 37,484 個通過驗證的任務,平均每筆成本約 0.05 美元,遠低於人工撰寫的數百至數千美元。每輪的合成產出率維持在每千次種子嘗試產生 498.2~572.2 個通過任務,候選任務通過率穩定在 74.5%~81.5%,顯示遞迴過程沒有隨輪次崩潰。

難度成長非常顯著:參考解法的中位數行數從第 1 輪的 67 行增長到第 15 輪的 374 行(約 5.6 倍);實際執行的指令數中位數從 40 條增至 244 條(約 6.1 倍);用到的 CLI 工具種類從 17 種增至 71 種;驗證器的斷言(assertion)數也從 17 條增至 57 條。相對地,指令文字長度只從 85 字增到 122 字(約 1.4 倍)——也就是說,難度提升來自「要做的事變多」,不是「說明文字灌水」。

難度的實際衝擊反映在模型表現上:用 DeepSeek-V4-Pro 測 pass@4,第 1 輪還有 90% 的通過率,到第 15 輪暴跌到只剩 2.5%。

訓練效用方面,作者對 Qwen3.5-27B 與 Qwen3.5-122B-A10B 兩個模型,用 RST 任務上收集的拒絕採樣(rejection-sampled)軌跡做監督微調(SFT)。結果在 Terminal-Bench 2、Terminal-Bench Hard、Long-Horizon Terminal Bench 三個 benchmark 上都拿到最多達 10 個百分點的提升,例如 122B-A10B 在 Terminal-Bench Hard 上從 20.0% 升到 30.0%。進一步用 agentic PPO(強化學習)訓練 Qwen3.5-27B,最終在三個 benchmark 上分別達到 49.44%、32.00%、22.07%,相較基礎模型有 20.0%、41.2%、21.9% 的相對提升。訓練過程中,平均驗證器獎勵從約 0.11 升到超過 0.14,平均互動輪數從 19~20 輪增加到超過 30 輪,顯示模型學會了維持更長的互動來滿足更多驗證條件。

意義

這篇論文最重要的貢獻,是證明「用驗證過的任務當種子、遞迴改寫」這條路徑可以無限期地把任務難度往上推,而不會像單純用 LLM 直接生成那樣資料品質崩潰。經過 15 輪,產出率與驗證通過率仍然穩定,任務領域多樣性也沒有塌縮(有效領域數維持在 11 上下),作者稱之為「沒有天花板」——暗示這套機制可以繼續擴展遠超論文報告的規模。

對整個代理訓練生態而言,RST 提供了一個便宜到近乎免費的長任務資料生產線(單價 0.05 美元),而且訓練效果經過 SFT 與 PPO 雙重驗證,能同時在多個模型尺寸與多個 benchmark 上帶來一致提升,不是單一模型的偶然結果。更值得注意的是,作者也做了 benchmark 污染分析,確認合成任務與現有測試集之間的文字重疊極低(5-gram Jaccard 相似度不超過 0.0081),證明提升不是因為背答案,而是真正學到了處理長流程、多步驟終端機操作的能力。這對接下來要訓練「能自主完成複雜工程任務」的代理系統,提供了一條可規模化、可驗證、成本可控的資料合成路線。

AgentOPSD:用遞迴貝氏信念修正,解決多輪代理人強化學習的「功勞分配」難題

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

Tsinghua UniversityZi-Han Wang、Zhengxi Lu、Zhiyuan Yao、Jinyang Wu、Jie Wu、Zhengzhou Cai、Yueqing Sun、Ziang Ye68Hugging FacearXiv
強化學習LLM Agent自我蒸餾credit assignmentQwen2.5

背景

在訓練會自主執行多輪任務的 LLM agent(例如在虛擬房間裡找東西、線上購物、多跳搜尋問答)時,業界常用「可驗證獎勵的強化學習」(RL with verifiable rewards),也就是任務完成與否給一個 0/1 或分數式的結果獎勵,再用像 GRPO(group relative policy optimization)這類方法把獎勵轉成軌跡層級的優勢值(advantage)。問題在於,一個多輪任務往往長達十幾、二十輪對話與動作,但真正決定成敗的可能只有其中兩三個關鍵決策——例如在 ALFWorld 裡選對了要去的房間,或在 WebShop 裡選對了搜尋關鍵字。傳統做法卻把同一個軌跡級的優勢值「平均分攤」到每一輪,等於獎勵訊號被稀釋,模型很難學到「這一步比其他步更重要」。

近期已有工作嘗試用「特權自我蒸餾」(privileged self-distillation)提供更細緻的監督訊號,做法是讓一個能看到額外資訊(如正確答案、成功範例)的「教師」模型與「學生」策略模型比較每個 token 的機率差距,差距大代表該處是學生模型的弱點,可以加重學習。但這類方法多半只看局部、單一時間點的訊號,沒有回答一個根本問題:序列化的功勞該如何被表示與累積?這正是本篇論文 AgentOPSD(來自清華大學等機構)想解決的核心問題。

方法

AgentOPSD 是一個「無需額外 critic」(critic-free)的方法,分三步驟運作:

  1. token 級證據聚合成輪級證據:對每一輪 k 的動作,計算教師模型與學生策略在該 token 上的 log 機率差 δ,再把整輪的差值加總成 e_k = Σδ_{k,t},代表這一輪教師相對學生「多知道多少」。

  2. 在 log-odds 空間做遞迴貝氏信念更新:把每輪證據以幾何衰減方式累加,更新一個代表「最終成功機率」的信念狀態 B_k,公式為 ℓ_k = logit(B_0) + Σγ^{k-j}e_j。也就是說,每一輪的重要性不是只看當下訊號強不強,而是看它「相對於歷史累積信念」帶來多少修正。

  3. 以信念修正量決定功勞權重:每一輪的權重 q_k = sign(A_seq)·ΔB_k,即該輪讓信念往成功或失敗方向「跳動」的幅度,乘上軌跡整體優勢的正負號。這樣關鍵轉折點(信念大幅跳動的輪次)會被賦予更高權重,而例行、無關痛癢的動作權重接近零。

整個機制完全相容於標準的策略優化流程(如 GRPO),只需要對每條軌跡多跑一次教師模型的前向推論(forward pass),不需要額外的 rollout,也不需要訓練一個學習型的 critic 網路。論文中一個重要的可調參數是重塑權重 λ=0.5,用來控制「純 GRPO 訊號」與「完整信念重塑訊號」之間的內插比例,而且作者強調同一組超參數即可套用到所有環境與模型規模,顯示方法的穩健性。

實驗結果

研究團隊在三個代表性 agentic 任務環境上驗證:ALFWorld(具身任務規劃)、WebShop(線上購物決策)、Search-QA(單跳/多跳搜尋問答),並使用 Qwen2.5 的 3B 與 7B 兩種模型規模。

最亮眼的數字是:Qwen2.5-7B 在 ALFWorld 上達到 89.1% 的成功率,全面超越 GRPO 以及既有的強力自我蒸餾基線(如 RLSD)。在 WebShop 與 Search-QA 上也都取得穩定提升。

更關鍵的是「長任務穩健性」實驗:當任務輪數增加時,GRPO 的成功率平均每多一輪就掉 2.91 個百分點,RLSD 更嚴重掉 3.59 個百分點,而 AgentOPSD 只掉 0.54 個百分點——顯示遞迴信念機制確實有效緩解了長任務中訊號被稀釋、稀疏的問題。

消融實驗進一步拆解了各設計元素的貢獻(以 ALFWorld 89.1% 為基準):

  • 拿掉「輪級聚合」、改回 token 級粒度:掉到 85.9%(-3.2 個百分點)
  • 拿掉「遞迴信念修正」、只用原始局部差值:掉到 82.8%(-6.3 個百分點)
  • 拿掉「依整體結果正負號調整」(signed outcome alignment):掉到 80.5%(-8.6 個百分點)
  • 拿掉「先驗信念錨定」(prior anchoring):掉到 78.9%(-10.2 個百分點)

這組數字說明,真正帶來最大增益的不是「把訊號切得更細」,而是「遞迴地把訊號放進歷史脈絡裡重新評估」——這正是論文標題強調 recursive 的核心價值。

意義

AgentOPSD 的貢獻在於用一個相對輕量、理論乾淨的貝氏框架,回答了「稀疏結果獎勵該如何轉換成密集且合理的逐輪功勞」這個長期困擾 agentic RL 的問題。相較於需要額外訓練 critic 網路或多次 rollout 採樣的方法,它只多一次教師模型推論,計算成本低,且能直接嵌入現有的 GRPO 訓練管線,對想落地部署多輪 LLM agent(客服流程、自動化網頁操作、複雜工具鏈調用)的團隊來說,是一個工程上容易採用的升級。

同時,實驗顯示的「隨任務長度增加,優勢反而擴大」這一特性,對於當前業界正在推的長時程 agent(例如需要規劃數十步的電腦操作或研究型 agent)特別有意義,暗示這類信念修正式的功勞分配,可能是未來訓練更長、更複雜任務 agent 的關鍵基礎設施之一。不過論文也坦言,方法依賴合理的先驗成功率估計與教師訊號品質,在獎勵極度稀疏或缺乏可靠教師示範的場景中,適用性可能受限,這也是後續研究可以延伸的方向。

當AI裁判也會看走眼:OSReward如何揭穿VLM評審員的「寬容偏誤」

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

NLP Group of The University of Hong KongQiushi Sun、Kanzhi Cheng、Yian Wang、Bowen Yang、Hang Yan、Liheng Chen、Fangzhi Xu、Zichen Ding55Hugging FacearXiv
VLMcomputer-use agentreward modelbenchmarkRLHF

背景

近年來,「computer-using agents」(CUA,能操作電腦、瀏覽器、手機的AI代理人)發展飛快,能自動點擊、輸入、瀏覽網頁,完成訂票、填表、跑試算表等任務。但一個關鍵問題始終沒被認真檢驗過:當這些agent執行完一連串操作後,「誰」來判斷任務究竟有沒有成功完成?

過去,判斷CUA軌跡(trajectory,即agent的動作、畫面狀態與推理過程的完整紀錄)是否達標,靠的是人工撰寫的規則式驗證器,或是人類標註員逐一檢視。但這兩種方法都無法規模化——規則寫不完所有任務的成功條件,人工標註又太貴太慢。於是業界越來越依賴用vision-language models(VLM)當「裁判」,自動判定一條軌跡是成功還是失敗,這種判斷結果同時被用在agent評測、訓練資料篩選,以及強化學習的reward訊號上。

問題是:這些VLM裁判真的靠譜嗎?這篇論文的作者群(包含Qiushi Sun、Kanzhi Cheng、Yian Wang、Bowen Yang等23位研究者,2026年7月30日提交於arXiv,分類屬於cs.AI/cs.CL/cs.CV)指出,這個「裁判可信度」問題長期被忽略。如果reward model本身就會看走眼,那麼建立在它之上的所有評測分數與強化學習訓練,都可能是空中樓閣。為了系統性回答這個問題,團隊建立了OSReward這個標準化評測基準,專門用來檢驗VLM當裁判的可靠度。

方法

OSReward的核心是一個包含1,019條人工標註軌跡的資料集,橫跨四大平台:Web(真實網站與本地鏡像站)、Windows(約20款應用程式,附帶真實的初始化狀態)、Ubuntu(約30款應用程式,涵蓋純GUI操作與GUI+命令列混合的工作流程),以及Mobile(Android模擬器,搭配預先佈置好的內容)。每條軌跡都來自不同的agent backbone去執行「人類事先驗證過」的任務指令,再經過多階段人工標註流程給出ground-truth的成功/失敗判定——每條軌跡由三位獨立標註員各自判斷,遇到分歧再交由meta-review裁定,整個標註工程投入約800人力工時,確保標籤品質經得起考驗。全集的成功/失敗比例約為43%/57%。

在此基礎上,團隊又切出兩個延伸子集:OSReward-Hard集中284條「真正難判」的邊界案例(成功/失敗比例約30/70),用來壓力測試裁判模型在模糊情境下的表現;OSReward-Multi則挑出440條成功軌跡,額外標註「效率」與「對齊指令程度」的細緻評分,而不只是二元的成功/失敗。

評測指標上,團隊採用success recall(sRec,真正成功的軌跡有多少被裁判正確接受)、fail recall(fRec,真正失敗的軌跡有多少被正確抓出)以及兩者平均而成、不受類別不平衡影響的balanced accuracy,對OSReward-Multi則另外用macro-recall與AUC評估細粒度評分品質。

發現VLM裁判普遍存在系統性缺陷後,團隊進一步構建了OS-Shepherd-100K——一個開放的、附帶推理過程標註的裁判判斷語料庫,規模約10萬筆樣本,是從32萬1,631筆裁判實例中,透過多模型集成一致性篩選後保留下來的高品質子集(篩選後留存率約85%)。其平台分布為Web 37%、Windows 19%、macOS 14%、Mobile 10%,以及Ubuntu相關變體約9-11%。基於這個語料庫,團隊訓練出開源reward model「OS-Shepherd」,提供9B與35B兩種參數規模,訓練分兩階段:先用推理標註語料做SFT(supervised fine-tuning),再用GRPO(一種強化學習演算法)針對「假成功」(false-success)這類最常見的誤判類型做強化學習微調,直接瞄準修正裁判的寬容偏誤。

實驗結果

團隊對27個VLM裁判模型做了迄今為止最全面的評測。結果顯示,即使是最頂尖的模型也稱不上「理想裁判」:在OSReward全集上,表現最好的Claude-Opus-4-8準確率約90%;但換到OSReward-Hard難集,同一批頂尖模型準確率會暴跌20到43個百分點,最好的也只剩約70%左右。開源模型的表現則普遍遠遠落後於閉源商用模型。

更關鍵的是,幾乎所有裁判都共享同一種系統性錯誤模式——「寬容偏誤」(leniency bias):把實際失敗的任務誤判為成功。論文分析指出,這類錯誤佔了全部誤判的三分之二,根本原因是裁判模型過度依賴agent自己撰寫的操作敘述(narrative),而不是真正去核對畫面上的視覺證據。實驗還發現,把agent的文字歷史紀錄拿掉,準確率會掉7.2個百分點,是拿掉視覺輸入所造成影響的三倍之多,顯示現有裁判其實是「聽agent怎麼說」多過「看畫面實際發生什麼」。此外,桌面類任務(Windows/Ubuntu)最難判斷,行動裝置任務相對最容易;裁判在感知(perception)與操作執行(action)錯誤上的辨識能力,明顯弱於對高層次規劃(planning)失敗的辨識。團隊也測試了多模型投票(ensemble voting),發現效果有限——因為裁判們往往「一起」在同樣的難案例上犯錯(herd),用高一致性樣本去篩選訓練語料,反而比單純做多數決平均更有效。

在OS-Shepherd模型的表現上,9B版本在OSReward全集達86.1%準確率、Hard集60.2%;35B版本分別是85.6%與62.7%,相較Claude-Opus-4-8的89.7%/69.7%與GPT-5.5的89.5%/67.3%已相當接近,但推理成本僅約1.36美元對比Claude的約100美元、GPT-5.5的約45美元,換算下來達到「30-60倍」的成本效益優勢。團隊也在AndroidWorld、WebArena、OSWorld等既有基準上測試OS-Shepherd的泛化能力,結果顯示其去偏誤能力可以跨平台遷移,在OSWorld與AndroidWorld上是表現最好的開源裁判模型。

意義

這篇論文最重要的貢獻,不是又推出一個新的agent benchmark,而是把整個CUA領域長期忽視的一塊地基問題攤開來檢視:當我們用VLM當「裁判」來評分、篩選訓練資料、甚至充當強化學習的reward訊號時,這個裁判本身的可靠度從未被嚴格驗證過。OSReward的發現說明,即便是最先進的商用模型,遇到真正模糊、需要細看畫面而非只讀agent敘述的案例時,也會系統性地偏向「放水」,把失敗誤判為成功——這對於用VLM judge做RLHF式訓練的agent系統是個警訊,因為錯誤的reward訊號會直接汙染訓練過程,讓agent學到「把失敗包裝成看起來像成功」而不是真的把任務做對。

同時,OS-Shepherd證明了一件務實的事:不需要動用最貴的前沿模型,透過針對性的推理標註語料與鎖定假成功案例的強化學習,一個9B規模的開源模型也能在成本降低30-60倍的情況下,逼近商用旗艦模型的裁判準確度。這對想要大規模訓練或評測CUA、但負擔不起大量呼叫昂貴API的研究團隊與新創而言,提供了一條可行、可信、又便宜的reward model路徑。整體而言,這項工作把「裁判的可信度」正式列入CUA研究不可迴避的基礎設施問題,也為後續建立更嚴謹的agent評測與訓練標準打下基礎。