← 目錄

K1 論文詳解

2026-08-04


當開放式任務也能自動打分:RLSVR 用「臥底遊戲」讓 LLM 自我進化

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

Qinsi Wang、Jing Shi、Huazheng Wang、Kun Wan、Yiran Wu、Bo Liu、Qingyun Wu、Hai Helen Li73Hugging FacearXiv
強化學習LLM自我改進多智能體RLVR

背景

過去兩年,Reinforcement Learning with Verifiable Rewards(RLVR)是推動大型語言模型(LLM)推理能力大幅躍進的關鍵技術。它的邏輯很單純:只要任務有「標準答案」,例如數學題的最終數字、程式碼能不能通過測試,就能用規則自動判斷模型輸出對不對,把這個對/錯訊號當成獎勵去做大規模強化學習,完全不需要人類或額外模型介入評分。這正是 DeepSeek-R1 之類模型能靠純 RL 練出強推理能力的核心機制。

問題是,這套方法幾乎只在數學、程式碼這類「可驗證領域」好用。一旦任務變成開放式的(open-ended)——例如寫摘要、寫小說、寫文案——就沒有唯一正解,無法用規則判斷對錯。目前業界的解法通常是引入人類偏好標註(RLHF)、訓練獨立的 reward model,或者請另一個更強的 LLM 當裁判(LLM-as-judge)。但這三種做法都有明顯代價:人類標註成本高、reward model 訓練出的判準會有偏差且容易被「刷分」、LLM 裁判則受限於裁判本身的能力上限,還要多花一次推理成本。換句話說,開放式任務至今仍缺一套「像 RLVR 一樣便宜又可規模化」的自我改進機制。

這篇論文的作者(來自 Duke、Oregon State 等機構,論文將發表於 COLM 2026)從自監督學習(self-supervised learning)的思路中找到靈感:自監督學習的精髓,是設計一個「代理任務」(pretext task),讓監督訊號直接從資料本身產生,不需要外部標籤。他們把同樣的想法搬到強化學習上,提出 RLSVR(Reinforcement Learning with Self-Verifiable Rewards),試圖把 RLVR 的「可驗證」優勢延伸到開放式任務。

方法

RLSVR 的核心想法是:把一個本來不可驗證的開放式任務,「轉換」成一個帶有內部規則的可驗證代理環境(proxy environment),讓環境本身的互動結果自動產生獎勵訊號,而不必依賴外部裁判。

論文用一個具體的實作 SpyRL 來驗證這個想法,靈感來自派對遊戲「誰是臥底」。SpyRL 的設計分成兩個階段:

表演階段(Performing Stage):一組 n 個智能體(agent)要完成同一個目標任務(例如寫同一份文件的摘要)。但其中 n-1 個「平民」agent 拿到完整、正常的任務輸入,只有 1 個「臥底」agent 拿到被刻意破壞過的、資訊不完整的輸入版本——摘要/寫作任務是對原文做 20% 的連續片段遮蔽(span masking),數學推理任務則是移除 40% 的題目上下文。所有 agent 各自根據自己拿到的資訊生成輸出。

偵測階段(Detection Stage):所有 agent 讀過彼此的輸出後進行投票,猜誰是臥底。因為臥底身分是環境事先設定好的「標準答案」,投票結果天生就是完全可驗證的——不需要人類、不需要 reward model、也不需要外部 LLM 裁判。

這個設計巧妙的地方在於:由於臥底拿到的資訊比較差,它生成的輸出品質理論上會偏離主流、比較容易露餡;平民要嘛靠輸出品質「藏得像」,要嘛靠敏銳觀察揪出臥底。因此「投票對不對」這件事,會與「輸出品質好不好」產生強關聯——投票的可驗證獎勵,間接地就成為輸出品質的代理訊號。論文用 GPT-4o 額外做了驗證分析(Figure 4),證實「被懷疑票數」確實與輸出品質存在顯著相關性,支撐了這個獎勵訊號的有效性假設。

在獎勵設計上,表演階段採用零和(zero-sum)機制:臥底的獎勵是 −β(得票數 − 平民平均得票),平民則依「猜中臥底的票數 − 平民間互相猜錯的票數」做加權;偵測階段則採用類似 GRPO 的組內優勢正規化。此外,由於臥底與平民手上資訊本來就不對稱,直接比較優勢值會有偏差,因此論文設計了 Role-Advantage Estimation(RAE)機制來校正這個偏差。訓練時兩個階段交替優化,預設分組人數 n=5,batch size 1024,訓練 100 個 epoch,最長輸出 2048 tokens,主要在 Qwen3-4B 與 Qwen3-8B 兩個模型上驗證。

實驗結果

論文在三大類任務上做了驗證,涵蓋開放式與可驗證兩種類型:

文本摘要(開放式,五個 benchmark:GovReport、Multi_News、QmSum、VcSum、SamSum):Qwen3-4B 套用 SpyRL 後平均 ROUGE 分數提升 4.56 分,平均勝率(win rate,相對基準模型)達 73.92%;Qwen3-8B 平均 ROUGE 提升 4.04 分,勝率 75.38%。

創意寫作(開放式,WritingPrompts、WritingBench,從新穎性、情感、連貫性、一致性、整體五個維度評分):Qwen3-8B + SpyRL 整體勝率達 76.5%;額外做的人類評測中,對比原始 Qwen3-4B 基準模型的勝率高達 80%。

數學推理(可驗證,七個 benchmark:GSM8K、Math500、AIME24、AIME25、Minerva、MMLU-Pro、GPQA-D):Qwen3-4B 平均準確率提升 8.40 個百分點,Qwen3-8B 提升 6.32 個百分點。具體例子:AIME24 上 Qwen3-4B 達 13.3%、Qwen3-8B 達 20.0%;AIME25 上分別達 20.0% 與 23.3%。

在與其他「零額外標註」自我改進方法(如 R-Zero、Absolute Zero 這類 proposer-solver 框架)的比較中,SpyRL 在開放式任務上的勝率普遍高出 15–20 個百分點。消融實驗也證實了兩階段設計缺一不可:只保留表演階段,準確率停滯在約 72.3%;只保留偵測階段,增益微弱(約 69.2%);拿掉臥底機制則整體訓練效果停滯不前;完整版 SpyRL 在 Math500 上可達 79.5%。分組人數的消融也顯示 n 從 3 提升到 5 時平均增益 3.8%,但再往上加到 6、8 人則報酬遞減,5 人是效益與成本的最佳平衡點。

意義

這篇論文最大的貢獻,不是「臥底遊戲」這個具體設計本身,而是它證明了一個更通用的原則:只要能找到合適的「任務轉換」,把一個本來主觀、難以量化的開放式任務,包裝成一個帶有內部確定性規則的博弈或互動環境,RLVR 那種便宜、可規模化、不依賴外部裁判的自我改進範式,就有機會被搬到幾乎任何領域上。這對整個 LLM 訓練生態的意義在於,它繞開了目前開放式任務優化的三大痛點:不用花錢做人類標註、不用擔心 reward model 被模型「鑽漏洞」刷分、也不會被裁判 LLM 自身的能力天花板卡住。

同時,實驗顯示 SpyRL 在數學推理這種原本就可驗證的任務上,也能帶來額外增益(+6~8%),說明這種「自我對局產生訊號」的機制,不只是可驗證與不可驗證任務之間的替代方案,甚至可能是一種通用的、能疊加在既有 RLVR 之上的自我改進手段。當然,這個方法目前只驗證到 8B 規模的 Qwen3 模型,且遊戲式的設計(分組人數、資訊遮蔽比例等)需要針對不同任務類型手動調參,能否無痛擴展到更大模型、更多元的開放式任務(例如程式碼審查、對話系統、多模態生成)仍待後續研究驗證。但作為一個把「自監督學習造代理任務」的思路成功注入強化學習訓練的案例,RLSVR 為「後訓練資料枯竭」與「裁判成本高昂」這兩個當前 LLM 自我進化的瓶頸,提供了一條頗具想像空間的新路徑。

當世界模型學會讀心:MENTIS 如何補上人類決策裡的「心智」缺口

Mental World Modeling

Mental World ModelHao Fei、Yiran Zhao53Hugging FacearXiv
世界模型心智理論多模態LLM人機協作決策模擬

背景

近年來,「世界模型」(world model)成為打造能規劃、能行動的 AI 系統的核心概念:給定當下場景,模型預測「接下來會發生什麼」,藉此支援機器人、自駕車或對話代理人做決策。然而,現有的世界模型幾乎都只回答一個物理層次的問題——場景裡有什麼、東西在哪裡、下一步會如何演變——卻完全略過了人類行為背後真正的驅動力:一個人相信什麼、想要什麼、意圖為何、當下的情緒,以及在特定社會情境中「什麼是被允許的」。這篇由 Hao Fei 與 Yiran Zhao 於 2026 年 7 月投稿至 arXiv(編號 2607.27201)的論文指出,只追蹤物理場景卻不追蹤各個角色「知道什麼、相信什麼」的模型,會對「看起來一樣的場景」給出錯誤的行為預測——因為兩個外觀相同的場景,只要角色心中的信念不同,人類實際會做出的選擇就會完全不同。

論文因此提出 Mental World Modeling(MWM,心智世界模型)這個通用理論框架,主張心智變量(信念、注意力、目標、意圖、情緒、性格傾向、社會規範與行為限制)應該是世界模型的核心組成部分,而不是事後才拿來解釋行為的「補充說明」。這個定位相當於把「心智理論」(Theory of Mind)從認知科學的旁註,正式提升為世界建模的第一等公民,呼應了 AI 領域從「模擬物理場景」邁向「模擬會思考的心智」的下一階段野心。

方法

MWM 框架的核心設計是維護一個「物理-心智耦合狀態」s_t = (s_t^phy, s_t^ment):模型不再只更新場景裡物體的位置與狀態,還同時更新每個角色的信念與意圖。系統會針對特定目標角色渲染出「第一人稱的部分觀察」(target-specific partial observation),因為每個人看到的、知道的都不完全相同;接著模擬候選行動如何「同時」更新物理與心智兩個分量——這種耦合正是關鍵:物理動態的演變依賴其他行動者的潛在意圖,而心智狀態的變化又同時取決於行動的物理形式與情境詮釋。

論文將此框架具體實作為 MENTIS,一個「免訓練、完全可檢視」的基準系統,拆解為六個階段:(1) 狀態解析——把原始場景依既定分類法轉換成物理與心智的結構化狀態;(2) 目標觀察生成——渲染出特定角色視角下能看到的資訊;(3) 行動分解——把候選選項拆成物理載體(移動、說話)與心智內容(安撫、欺騙等意圖);(4) 耦合物理-心智轉移——平行模擬每個候選行動後的物理與心智後續狀態;(5) 分支價值評估——依心智一致性、物理合理性、社會適切性三個維度打分;(6) 決策——依評分做出可完整追溯的最終選擇。整套流程不需要額外訓練,且每一步的中間產物都可被記錄與檢查,方便定位錯誤來源。

為驗證框架,研究團隊建構了 Menti-Bench 資料集,共 448 筆人工建構、品質管控的情境決策案例,涵蓋文字敘事(320 筆)、圖片序列(100 筆,每筆 1–5 張圖搭配文字說明)與含聲影片(28 筆,含對話與環境音)。場景分為人際互動(47.5%)、物件/資源(28.1%)、空間/知覺(12.9%)及風險/規範(11.4%)四類,其中 78% 的案例涉及多角色、需要心智推論才能判斷正確行動。每筆資料都附有完整的「金標準」推論軌跡:當前狀態、目標觀察、六個候選分支的後續狀態,以及最終行動,並透過選項平衡、盲測探針與逐筆人工複核來防止模型「抄捷徑」答對。

實驗結果

研究團隊在 8 個現代多模態 LLM 世界模型上做實驗,包含 OpenAI 系列(gpt-5.6-sol、gpt-5.5、gpt-5.4、gpt-5.4-mini、gpt-4.1)與 Anthropic 系列(claude-fable-5、claude-opus-4-8、claude-haiku-4-5),統一在校準過的操作點上比較。論文設計了一條「必要性階梯」(necessity ladder):純選項猜測(S0)僅 31.3% 準確率;直接作答(S1)63.3%;加入思維鏈(S2)74.6%;六次採樣自我一致性(S3)77.9%;結構化狀態(S5)82.6%;完整 MWM/MENTIS 流程(S6)達到 87.9%(八模型平均),而人類參考基準為 98.5%——顯示即便是最好的系統設定,距離人類仍有約 10 個百分點的差距。

消融實驗更凸顯了兩個通道缺一不可:拿掉心智狀態(A1)準確率掉到 75.8%(−12.1);拿掉物理狀態(A2)掉到 71.4%(−16.5);把物理與心智轉移「解耦」分開模擬(A3)也會掉到 81.5%(−6.4),這個模式在全部八個模型上一致成立。進一步的「神諭介入」實驗(以 gpt-5.6-sol 為例)顯示,若直接餵入金標準轉移結果,可拉高 3.5 分(占人類差距 7.8 分中的 45%);金標準狀態帶來 2.8 分;金標準觀察帶來 1.7 分;金標準行動分解僅帶來 0.7 分——說明「轉移模擬」(預測行動如何同時改變物理與心智狀態)才是目前最大的瓶頸,而非狀態表徵或觀察生成。

依場景類型看,人際互動場景從 S1 到 S6 的提升最大(66.5% → 92.9%,+26.4),物件/資源場景提升最小(74.0% → 88.0%,+14.0)。依模態看,文字從 70.8% 提升到 90.5%(+19.7),圖片從 67.0% 提升到 91.2%(+24.2),影片從 64.8% 提升到 90.9%(+26.1)——多模態場景反而因為資訊更豐富,MWM 帶來的增益更大。研究也做了通道置換測試:把圖片換成純文字說明會讓 S6 掉 6.4 分,去掉聲音掉 6.1 分,打亂影格順序掉 4.1 分,只用聲音則會暴跌 18.8 分,證明模型確實有效利用了多模態證據,而非單純依賴文字先驗猜測。

意義

這篇論文的意義在於明確指出,現有世界模型「重物理、輕心智」的設計盲點,正是它們在需要理解人類行為的場景中頻頻失準的根本原因。MWM 框架把心智狀態從「事後解釋」提升為與物理狀態並列的一等公民,並透過 MENTIS 這個免訓練、可檢視的基準系統證明:只要顯式建模並耦合心智與物理狀態,多模態 LLM 世界模型的決策預測準確率就能從 63–75% 的區間躍升到 88% 左右,逼近人類水準的 98.5%。更重要的是,論文透過神諭介入實驗把「轉移模擬能力不足」定位為當前最大瓶頸,為後續研究指出了明確方向——與其繼續堆疊更精細的狀態表徵,不如優先攻克「行動如何同時改變物理世界與人心」這個核心推理環節。

對實務應用而言,這意味著任何需要與人類協作、照護、教育或互動的 AI 系統(例如具身機器人、陪伴型代理人、教學助手),若缺乏對使用者信念與意圖的顯式建模,很容易在「場景看起來一樣、但人心不同」的情境中做出錯誤判斷。MWM 提供的不只是一個評測基準,更是一套可推廣的設計原則:當部分可觀察性造成「全局狀態」與「個體感知」之間存在落差、心智變量會改變理性行動的判斷、且行動本身帶有超越物理效果的社會意涵時,模擬心智就和模擬物理場景一樣不可或缺。這也標誌著世界模型研究可能正從「看懂世界」邁向「讀懂人心」的下一個階段。

Memory Decoder at Scale:把長期記憶獨立擴展到 69 億參數,比單純做大模型更划算

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

Rubin Wei、Jiaqi Cao、Jiarui Wang、Junming Zhang、Qipeng Guo、Bowen Zhou、Zhouhan Lin51Hugging FacearXiv
語言模型檢索增強kNN-LM參數效率Qwen3

背景

現在主流的 decoder-only 大型語言模型,把「長期記憶」(記住訓練語料中的事實、術語、罕見搭配)和「推理能力」(邏輯運算、指令理解)全部塞進同一組參數裡。這帶來一個結構性問題:想讓模型記住更多東西,唯一辦法就是把整個模型做大——但做大模型同時也會放大推理相關的參數,成本高、效益卻不成比例。

過去已有 kNN-LM 這類檢索增強方法,讓模型在推理時去查一個外部的向量索引(例如用 Faiss 建的最近鄰資料庫),把檢索到的機率分布和模型原本的輸出混合,藉此補強記憶而不用真的把知識硬記進參數。但檢索型方法在推理階段要即時做向量搜尋,延遲高、部署麻煩。先前一篇規模較小的工作提出了「Memory Decoder」,做法是把檢索式記憶「蒸餾」成一個獨立的參數化模組——先用 Faiss 對海量語料建 kNN 索引,離線算出每個位置的檢索機率分布,再訓練一個小型網路去模仿這個分布,訓練完之後推理時就不再需要查索引,只要跑這個記憶模組、把它的輸出和基礎模型的輸出結合即可。但那項工作只在較小規模下驗證,這篇論文要回答的問題是:這套方法能不能真正「規模化」(scale up)到接近工業級的模型與資料量。

方法

本篇論文將 Memory Decoder 擴大到 69 億(6.9B)參數,並用 3000 億(300B)tokens 進行預訓練,這個資料量級是先前小規模研究的數量級以上。作者發現在這個規模下,標準的 Faiss 索引與檢索流程(建索引、做最近鄰搜尋、載入 kNN 機率分布)本身就成為效能瓶頸——單機或標準管線根本跑不動。

為此,團隊設計了一套分散式(distributed)Faiss 建索引與檢索管線,把索引建置和搜尋工作拆分到多台機器上平行處理;同時搭配「稀疏、分批載入(sparse, batch-wise loading)」的 kNN 分布讀取方式,避免一次性把龐大的檢索結果全部載入記憶體,大幅降低 I/O 與儲存開銷。這讓 6.9B 規模、300B tokens 等級的記憶模組訓練變得可行。

訓練完成的 Memory Decoder 可以獨立於任何基礎模型單獨訓練與擴充,之後再與不同大小的基礎模型(如 Pythia 系列、Qwen3 Base 系列)在推理時做組合——概念上類似「小的推理骨幹 + 大的記憶外掛」,兩者可以分開擴大規模,而不必同步放大整個模型。論文也區分了「通用記憶(general memory)」與「領域記憶(domain memory)」兩種訓練方式,後者針對特定領域語料訓練較小的記憶模組。

實驗結果

論文在 17 個 benchmark 上做了系統性評測。關鍵結果如下:

  • 把一個 69 億參數的通用記憶模組,搭配 Pythia-410M(4.1 億參數)使用後,平均分數從 29.86 提升到 37.34,提升超過 7 分。
  • 這個組合的平均分數(37.34)甚至超過了參數量大得多的 Pythia-12B(120 億參數,平均 37.24),但兩者組合起來的總參數量卻比 Pythia-12B 少 39%。這代表「小模型 + 大記憶」比「直接用大模型」更省參數、效果更好。
  • 在 Qwen3 Base 系列(從 0.6B 到 14B 共多個規模)上,搭配一個 17 億(1.7B)參數的領域記憶模組後,在三個測試領域上的平均分數在每一個模型規模下都提升超過 9 分——也就是說,不論基礎模型是 0.6B 還是 14B,加上同一顆相對小的領域記憶,效益都很穩定。
  • 整體趨勢顯示:在固定的「總參數預算」下,把更多參數分配給記憶模組,比把同樣的參數拿去擴大基礎模型本身,能得到更好的「參數—效能」轉換率(parameter-performance tradeoff)。

意義

這篇論文的核心訊息是:語言模型的「記住知識」和「會推理」這兩件事,值得被拆開來獨立擴展,而不是綁死在同一組參數裡一起放大。過去業界擴大模型幾乎等於整體參數翻倍,成本(訓練、部署、推理延遲)全部同步增加;而 Memory Decoder at Scale 證明,把新增的參數預算優先投入到一個可獨立訓練、離線蒸餾自檢索分布的記憶模組,能用更少的總參數達到甚至超越大模型的效果——69 億記憶+4 億基礎模型打贏 120 億的單體模型就是最直接的證明。

更重要的是,這種記憶模組因為是「蒸餾自 kNN 檢索、但推理時不用真的檢索」,部署成本遠低於傳統的檢索增強生成(RAG)方案,同時又保留了記憶可以獨立於基礎模型升級、替換、做領域客製化(domain memory)的彈性。對於資源有限、想在小模型上做垂直領域應用的團隊來說,這提供了一條「不用重新訓練整個大模型,只需訓練/替換一個記憶外掛」的低成本升級路徑,也為未來語言模型的架構設計——記憶與推理模組化、可分別擴展——提供了具體的實證支持。論文團隊也釋出了 Pythia 與 Qwen3 版本的記憶模型、領域資料與程式碼,方便後續研究驗證與擴展這套分散式 Faiss 訓練管線。