當開放式任務也能自動打分:RLSVR 用「臥底遊戲」讓 LLM 自我進化
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
背景
過去兩年,Reinforcement Learning with Verifiable Rewards(RLVR)是推動大型語言模型(LLM)推理能力大幅躍進的關鍵技術。它的邏輯很單純:只要任務有「標準答案」,例如數學題的最終數字、程式碼能不能通過測試,就能用規則自動判斷模型輸出對不對,把這個對/錯訊號當成獎勵去做大規模強化學習,完全不需要人類或額外模型介入評分。這正是 DeepSeek-R1 之類模型能靠純 RL 練出強推理能力的核心機制。
問題是,這套方法幾乎只在數學、程式碼這類「可驗證領域」好用。一旦任務變成開放式的(open-ended)——例如寫摘要、寫小說、寫文案——就沒有唯一正解,無法用規則判斷對錯。目前業界的解法通常是引入人類偏好標註(RLHF)、訓練獨立的 reward model,或者請另一個更強的 LLM 當裁判(LLM-as-judge)。但這三種做法都有明顯代價:人類標註成本高、reward model 訓練出的判準會有偏差且容易被「刷分」、LLM 裁判則受限於裁判本身的能力上限,還要多花一次推理成本。換句話說,開放式任務至今仍缺一套「像 RLVR 一樣便宜又可規模化」的自我改進機制。
這篇論文的作者(來自 Duke、Oregon State 等機構,論文將發表於 COLM 2026)從自監督學習(self-supervised learning)的思路中找到靈感:自監督學習的精髓,是設計一個「代理任務」(pretext task),讓監督訊號直接從資料本身產生,不需要外部標籤。他們把同樣的想法搬到強化學習上,提出 RLSVR(Reinforcement Learning with Self-Verifiable Rewards),試圖把 RLVR 的「可驗證」優勢延伸到開放式任務。
方法
RLSVR 的核心想法是:把一個本來不可驗證的開放式任務,「轉換」成一個帶有內部規則的可驗證代理環境(proxy environment),讓環境本身的互動結果自動產生獎勵訊號,而不必依賴外部裁判。
論文用一個具體的實作 SpyRL 來驗證這個想法,靈感來自派對遊戲「誰是臥底」。SpyRL 的設計分成兩個階段:
表演階段(Performing Stage):一組 n 個智能體(agent)要完成同一個目標任務(例如寫同一份文件的摘要)。但其中 n-1 個「平民」agent 拿到完整、正常的任務輸入,只有 1 個「臥底」agent 拿到被刻意破壞過的、資訊不完整的輸入版本——摘要/寫作任務是對原文做 20% 的連續片段遮蔽(span masking),數學推理任務則是移除 40% 的題目上下文。所有 agent 各自根據自己拿到的資訊生成輸出。
偵測階段(Detection Stage):所有 agent 讀過彼此的輸出後進行投票,猜誰是臥底。因為臥底身分是環境事先設定好的「標準答案」,投票結果天生就是完全可驗證的——不需要人類、不需要 reward model、也不需要外部 LLM 裁判。
這個設計巧妙的地方在於:由於臥底拿到的資訊比較差,它生成的輸出品質理論上會偏離主流、比較容易露餡;平民要嘛靠輸出品質「藏得像」,要嘛靠敏銳觀察揪出臥底。因此「投票對不對」這件事,會與「輸出品質好不好」產生強關聯——投票的可驗證獎勵,間接地就成為輸出品質的代理訊號。論文用 GPT-4o 額外做了驗證分析(Figure 4),證實「被懷疑票數」確實與輸出品質存在顯著相關性,支撐了這個獎勵訊號的有效性假設。
在獎勵設計上,表演階段採用零和(zero-sum)機制:臥底的獎勵是 −β(得票數 − 平民平均得票),平民則依「猜中臥底的票數 − 平民間互相猜錯的票數」做加權;偵測階段則採用類似 GRPO 的組內優勢正規化。此外,由於臥底與平民手上資訊本來就不對稱,直接比較優勢值會有偏差,因此論文設計了 Role-Advantage Estimation(RAE)機制來校正這個偏差。訓練時兩個階段交替優化,預設分組人數 n=5,batch size 1024,訓練 100 個 epoch,最長輸出 2048 tokens,主要在 Qwen3-4B 與 Qwen3-8B 兩個模型上驗證。
實驗結果
論文在三大類任務上做了驗證,涵蓋開放式與可驗證兩種類型:
文本摘要(開放式,五個 benchmark:GovReport、Multi_News、QmSum、VcSum、SamSum):Qwen3-4B 套用 SpyRL 後平均 ROUGE 分數提升 4.56 分,平均勝率(win rate,相對基準模型)達 73.92%;Qwen3-8B 平均 ROUGE 提升 4.04 分,勝率 75.38%。
創意寫作(開放式,WritingPrompts、WritingBench,從新穎性、情感、連貫性、一致性、整體五個維度評分):Qwen3-8B + SpyRL 整體勝率達 76.5%;額外做的人類評測中,對比原始 Qwen3-4B 基準模型的勝率高達 80%。
數學推理(可驗證,七個 benchmark:GSM8K、Math500、AIME24、AIME25、Minerva、MMLU-Pro、GPQA-D):Qwen3-4B 平均準確率提升 8.40 個百分點,Qwen3-8B 提升 6.32 個百分點。具體例子:AIME24 上 Qwen3-4B 達 13.3%、Qwen3-8B 達 20.0%;AIME25 上分別達 20.0% 與 23.3%。
在與其他「零額外標註」自我改進方法(如 R-Zero、Absolute Zero 這類 proposer-solver 框架)的比較中,SpyRL 在開放式任務上的勝率普遍高出 15–20 個百分點。消融實驗也證實了兩階段設計缺一不可:只保留表演階段,準確率停滯在約 72.3%;只保留偵測階段,增益微弱(約 69.2%);拿掉臥底機制則整體訓練效果停滯不前;完整版 SpyRL 在 Math500 上可達 79.5%。分組人數的消融也顯示 n 從 3 提升到 5 時平均增益 3.8%,但再往上加到 6、8 人則報酬遞減,5 人是效益與成本的最佳平衡點。
意義
這篇論文最大的貢獻,不是「臥底遊戲」這個具體設計本身,而是它證明了一個更通用的原則:只要能找到合適的「任務轉換」,把一個本來主觀、難以量化的開放式任務,包裝成一個帶有內部確定性規則的博弈或互動環境,RLVR 那種便宜、可規模化、不依賴外部裁判的自我改進範式,就有機會被搬到幾乎任何領域上。這對整個 LLM 訓練生態的意義在於,它繞開了目前開放式任務優化的三大痛點:不用花錢做人類標註、不用擔心 reward model 被模型「鑽漏洞」刷分、也不會被裁判 LLM 自身的能力天花板卡住。
同時,實驗顯示 SpyRL 在數學推理這種原本就可驗證的任務上,也能帶來額外增益(+6~8%),說明這種「自我對局產生訊號」的機制,不只是可驗證與不可驗證任務之間的替代方案,甚至可能是一種通用的、能疊加在既有 RLVR 之上的自我改進手段。當然,這個方法目前只驗證到 8B 規模的 Qwen3 模型,且遊戲式的設計(分組人數、資訊遮蔽比例等)需要針對不同任務類型手動調參,能否無痛擴展到更大模型、更多元的開放式任務(例如程式碼審查、對話系統、多模態生成)仍待後續研究驗證。但作為一個把「自監督學習造代理任務」的思路成功注入強化學習訓練的案例,RLSVR 為「後訓練資料枯竭」與「裁判成本高昂」這兩個當前 LLM 自我進化的瓶頸,提供了一條頗具想像空間的新路徑。