← 目錄

K1 論文詳解

2026-08-10


EnvACE:讓 AI agent 在腦內「排練」環境,訓練不再依賴真實工具

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

TencentZishan Xu、Zhiyuan Yao、Yuxin Chen、Yifu Guo、Zhengxi Lu、Yuquan Lu、Jinyang Huang、Yan Xu38Hugging FacearXiv
LLM agent強化學習world modeltool useRLHF

背景

近年來,大型語言模型(LLM)agent 要處理長流程的工具呼叫任務——例如訂機票、查資料庫、操作金融系統——訓練方式主要靠兩條路:一是讓模型在真實或高擬真的可執行環境中反覆試錯,二是接上外部模擬器(simulator)來產生互動回饋。這兩條路都有明顯的成本問題。建構一個可驗證、可規模化的執行環境(例如要模擬真實 API 的回應、資料庫狀態變化)本身就需要大量工程投入;而外部模擬器又常常「難以貼地」(difficult to ground),也就是模擬出來的環境反應和真實世界有落差,導致模型學到的策略遷移到真實場景時效果打折。

換句話說,agentic 強化學習(agentic RL)目前最大的瓶頸不是演算法,而是「環境」本身——沒有足夠多、夠真實、夠便宜的環境可以讓模型練習。這也是為什麼過去許多工作走向「環境擴增」(environment scaling),也就是想辦法造更多、更豐富的訓練環境,但這類方法終究受限於人力和算力去維護環境的正確性。

EnvACE(發表於 2026 年 8 月,arXiv 編號 2608.06197,作者來自華為等機構的 Zishan Xu、Zhiyuan Yao 等 11 人團隊)提出一個不同的思路:如果 agent 能自己把「環境會怎麼回應」這件事學進參數裡,是不是就不需要外部環境了?

方法

EnvACE 的核心概念叫「world rehearsal」(世界排練)。訓練時,同一個 policy(策略模型)會在兩種角色之間切換:

  1. 行動者(actor)角色:根據當前任務狀態,生成一個工具呼叫(tool call)。
  2. 環境角色:立刻切換身分,扮演「環境」本身,自己生成這個工具呼叫理論上會得到的回應(response)。

接著,policy 會把自己剛剛「排練」出來的環境回應,當作真實觀察值,拿去決定下一步動作,如此反覆進行,直到任務結束或達到最大互動輪數(論文中設定最長 30 輪)。整個過程完全不接觸真實或外部模擬環境——訓練資料只需要任務描述與工具規格,環境反應全靠模型自己「想像」出來。

關鍵在於,這兩個角色(行動與環境模擬)是端到端聯合優化的,獎勵訊號來自任務是否成功完成(task-success reward)。技術上採用一種「角色分離的 GRPO」(role-wise GRPO):行動角色和環境角色各自有獨立的獎勵基準線(baseline),避免兩種角色的梯度互相干擾,但共享同一組模型參數更新。這樣一來,模型不只是學會「怎麼做」,還同時把「做了會發生什麼」內化成自己的世界模型(agent world model),兩者互相校準。

訓練基礎模型是 Qwen3 系列(1.7B 與 8B),資料來自 CM2 工具使用軌跡集,訓練規模約 470 步、16 張 NVIDIA H20 GPU、batch size 16。

更有趣的是測試時的應用:由於模型已經內化了環境動態,推論階段可以在「真正執行」工具呼叫之前,先私下(不影響外部環境)排練幾次,預測可能的後果,選出比較安全或成功率較高的動作再送出——這叫「private rehearsal」,不需要額外呼叫真實環境,純粹靠模型內部多想幾遍。

實驗結果

EnvACE 在四個 agent benchmark 上測試:BFCL-v4、τ²-Bench(tau²-Bench)、VitaBench、FinMCP-Bench。

  • 在 BFCL-v4、τ²-Bench、VitaBench 三者的綜合評分上,EnvACE-8B 取得 32.91%,優於環境擴增基線 EnvScaler-8B 的 31.92%,也優於參數量更大的 AWM-14B(32.54%)——也就是用更小的模型、不靠外部環境,反而贏過擴大環境規模或擴大模型規模的做法。
  • 在 FinMCP-Bench 上,EnvACE 取得最佳 TF1 分數 46.78%,以及最佳工具呼叫精確度(tool precision)54.04%
  • 模型規模效應:把模型從 1.7B 擴大到 8B,BFCL-v4 上進步 +14.23%,τ²-Bench 上進步 +21.4%,顯示 world rehearsal 帶來的收益隨模型容量增加而放大——換句話說,模型越大,越能把環境動態學得更準,自我排練的價值也越高。
  • 測試時排練(test-time rehearsal):在排練次數 N=2 的設定下,並行排練(parallel rehearsal)可以把整體分數從 36.7% 提升到 40.9%(+4.2%);序列式排練(sequential rehearsal)則從 36.7% 提升到 38.5%(+1.8%)。也就是說,即使不接觸額外的真實環境,只靠模型自己在腦內多想幾種可能性,就能顯著提高任務成功率。

論文也做了控制實驗,證實 world rehearsal 在不同模型規模下都能穩定改善 policy 的學習效果,而不只是在特定規模下的偶然結果。

意義

EnvACE 這篇論文最核心的貢獻,是把「agent 訓練必須依賴外部環境」這個長期被視為理所當然的前提,換成「環境動態可以被模型自己學會並內化」。這件事有幾個層面的意義:

第一,訓練成本結構改變。過去要擴大 agent 訓練規模,常常意味著要花更多資源建更多可執行環境或維護模擬器;EnvACE 顯示,把資源投入在讓模型自己學會模擬環境上,可能是更划算的擴展路徑——用 8B 模型加 world rehearsal,就能打贏靠更大環境規模或更大模型規模堆出來的基線。

第二,世界模型(world model)與 agent 決策的結合變得更直接、更輕量。過去談 world model 常需要獨立的模型架構去預測未來狀態,EnvACE 則證明同一個 transformer policy 只靠角色切換和聯合強化學習,就能同時扮演「行動者」和「世界」,不需要額外模組。

第三,測試時排練這個機制,某種程度上是把「思考過再做」的直覺,用具體、可訓練的方式實作出來——模型在真正送出工具呼叫前,先在內部模擬幾種後果,篩掉可能失敗或危險的動作。這對需要謹慎操作的場景(例如金融交易、系統管理)特別有價值,因為犯錯的代價高,而 EnvACE 提供了一種不需要額外外部試錯就能降低風險的手段。

整體而言,EnvACE 為 LLM agent 訓練指出一條「跳脫外部環境限制」的可能路徑,對於想要用強化學習訓練 tool-use agent、又苦於環境建構成本的團隊,是一個值得參考的方向。作者也已公開程式碼(github.com/Within-yao/EnvACE),方便社群驗證與延伸。

從失敗中學習:UniME-R1 用「檢索為中心的思維鏈」讓多模態檢索更聰明

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

DeepGlintZelong Sun、Jun Wang、Kaicheng Yang、Tiancheng Gu、Ziyong Feng、Zhiwu Lu37Hugging FacearXiv
多模態檢索LVLMChain-of-Thought強化學習Embedding

背景

近年來,統一多模態檢索(Unified Multimodal Retrieval)成為搜尋與推薦系統的重要基礎,任務是根據文字、圖片等混合輸入,從龐大的候選庫中找出真正符合使用者意圖的內容。以 Large Vision-Language Model(LVLM)為骨幹的檢索器因為效率高、擴展性好而被廣泛採用,但這類方法直接把原始多模態輸入編碼成向量,往往會遺漏細粒度的區分線索,導致模型在語意相近的候選之間搞混——比如分不清「紅色跑車在山路上」和「紅色跑車在城市街道上」這種只差背景的圖片。

為了解決這個問題,近期研究開始用 Chain-of-Thought(CoT)產生推理文字來豐富 query 的表示,幫助模型抓住細節。但這類 CoT 有個根本缺陷:推理只基於 query 本身生成,說明的是「這個 query 在描述什麼」,而不是「檢索器到底哪裡理解錯了」。換句話說,現有方法從頭到尾都沒有真正看過檢索失敗的樣子,自然也無法針對性地修正。這正是 UniME-R1(arXiv:2608.06060,由 DeepGlint-AI 團隊 Zelong Sun、Jun Wang、Kaicheng Yang 等人提出)要解決的核心問題:讓推理「條件化」在真實的檢索回饋(retrieval feedback)之上,而不只是憑空解釋 query。

方法

UniME-R1 採用「embedder-adviser」雙角色框架。Embedder 負責初步檢索,adviser 則負責診斷。流程分兩種情況:

  1. 目標已在初始 top-k 中:adviser 直接對候選逐一分析,找出讓 embedder 混淆的區分線索,對候選做重排序(rerank),不需要重新生成推理文字。
  2. 目標不在 top-k 中:adviser 生成 Retrieval-Centric Chain-of-Thought(RC-CoT),針對「檢索器誤解了什麼」寫出推理,再用一個雙模式(dual-mode)embedder 拿著修正後的方向,對整個語料庫重新做全量檢索(full-corpus re-retrieval)。

訓練上有三個關鍵設計:一是主動挖掘難負例(hard negatives)來模擬真實世界會發生的檢索失敗場景,而不是用隨機負例;二是聯合優化「直接檢索」與「RC-CoT 增強檢索」兩條路徑,讓模型學會何時該直接信任初檢結果、何時該重新推理;三是用監督式學習加上「檢索導向的強化學習」(retrieval-oriented RL,類似 GRPO)來對齊 adviser 的輸出與最終檢索效果,而不只是文字品質。

具體模型上,UniME-R1 提供 2B 與 4B 兩個版本:2B 版以 Qwen3-VL-2B 作為 embedder、Qwen3-VL-4B 作為 adviser;4B 版則兩者都用 Qwen3-VL-4B。訓練資料包含 embedder 的判別式表示(<dis_emb>)使用完整 MMEB-V2 語料庫,生成式表示(<gen_emb>)則用 173 萬筆 RC-CoT 增強樣本;adviser 的監督式微調用了 64.3 萬筆結構化標註,強化學習階段則聚焦 1.3 萬筆真實失敗案例做對齊。

實驗結果

在 MMEB-V2 這個涵蓋分類、VQA、檢索、視覺定位等多任務的統一評測基準上,UniME-R1-2B 拿到 69.9 分整體分數,UniME-R1-4B 則達到 70.3 分,雙雙超越同量級甚至更大量級(4B–7B)的強基線模型——換句話說,2B 版本本身模型規模不大,卻已經打贏所有中型(4B–7B)基線,說明效果提升主要來自方法設計,而不是單純堆參數量。

除了 MMEB-V2,團隊也在 UVRB(零樣本設定)、Flickr30K、COCO2014、ShareGPT4V、Urban1K,以及 ViDoRe、VisRAG 這類視覺文件檢索基準上驗證,結果都一致優於既有的強基線,顯示 RC-CoT 與難負例訓練帶來的提升具有跨任務、跨資料型態的泛化能力。

效率方面,由於直接重排序模式使用 <dis_emb> 表示,單個候選編碼只需約 0.01 秒,比另一個需要對每個候選都跑推理的方法 Embed-RL(0.27 秒/候選)快了 27 倍;即便走 RC-CoT 生成路徑,query 端的處理時間也只從 0.28 秒增加到 0.34 秒,增幅有限,說明這套「按需啟用推理」的設計在準確度與延遲之間取得了實用的平衡。

意義

UniME-R1 的核心洞見其實很直白:推理應該對症下藥,而不是憑空描述。過去多模態檢索領域把 CoT 當作「幫 query 加註解」的工具,但如果模型從沒見過自己真實會犯的錯,再多的推理文字也只是換一種方式重複同樣的偏見。透過難負例挖掘去模擬真實失敗場景,再讓 adviser 針對「embedder 具體搞混了什麼」生成有目的性的推理,UniME-R1 把 CoT 從「解釋輸入」升級成「診斷錯誤」,這個思路對其他需要人機協作糾錯的檢索、推薦、甚至 RAG(Retrieval-Augmented Generation)系統都有參考價值。

更重要的是,論文示範了一個小模型(2B)透過更好的訓練訊號(retrieval feedback + RL 對齊)就能打敗更大模型的可能性,這對於需要在真實產品中控制推理成本的場景相當有吸引力——尤其是效率數據顯示,這套機制在大多數情況下幾乎不增加額外延遲,卻能明顯提升準確率,對正在打造搜尋、電商推薦或多模態問答系統的工程團隊,是一個值得關注的技術方向。

ChronoVision:讓多模態模型用「潛在影像」而非文字來做時間推理

ChronoVision: Temporal Reasoning via Latent State Reconstruction

PediaMed AIYifan Shen、Jian Xu、Boyi Li、Yuner Zhang、Tianjiao Yu、Bingxuan Li、Houze Yang、Rushi Wang37Hugging FacearXiv
多模態大模型時間推理強化學習視覺表徵學習benchmark

背景

近年的多模態大型語言模型(Multimodal LLM,簡稱 MLLM)在「被動感知」任務上表現亮眼——看一張圖描述內容、回答靜態視覺問答都游刃有餘。但一旦任務牽涉到「多步驟時間推理」,例如判斷一段影片中物體如何隨時間變化、排列一系列畫面的正確順序、或推論一個連續物理過程的中間狀態,這些模型的表現就會明顯下滑。

論文作者指出,問題的根源在於目前主流做法(包含 chain-of-thought 式的文字推理)都是「用語言去描述視覺變換」。語言本質上是離散、抽象的符號系統,而真實世界的視覺轉換(物體位移、形變、遮擋關係變化等)是連續且細節豐富的。當模型被要求用一段文字去「講清楚」畫面如何從狀態 A 變到狀態 B 時,語言的表達力往往不夠精確,容易產生語意含糊或邏輯斷裂,進而導致推理鏈條走偏、最終答案錯誤。這種「語言中介的歧義性」被作者視為 MLLM 在複雜視覺認知任務上退化的主因。

為了驗證與改善這個問題,作者提出了 ChronoVision 框架,核心想法是讓模型的推理過程不只依賴文字,而是同時對齊到「潛在影像表徵」(latent imagery)——也就是讓模型在內部直接預測、比對視覺狀態的隱藏向量,繞過純語言描述可能帶來的失真。

方法

ChronoVision 的訓練分為兩個階段:監督微調(SFT)與強化學習(RL)後訓練,分別導入了幾個關鍵模組。

監督微調階段引入兩個新設計:

  1. Reconstructive Visual Head(重建式視覺頭):在模型做推理的同時,額外訓練一個頭部模組去預測「最終轉換後狀態」的潛在表徵。也就是說,模型不只要輸出文字答案,還要在隱藏空間裡「想像」出視覺變換完成後應該是什麼樣子,並將這個潛在向量與真實的目標畫面表徵做對齊。這相當於給模型一個額外的視覺監督訊號,強迫它在內部維持一條連續的視覺演化軌跡,而不是單靠語言鏈條跳來跳去。

  2. ROI Attention Locating 模組(關注區域定位模組):透過「語意片段查詢」(semantic span queries)的方式,引導模型將注意力集中在畫面中真正關鍵的視覺證據區域(Region of Interest)。這解決了 MLLM 常見的問題——面對長影片或多幀輸入時,模型的注意力容易被無關背景稀釋,導致抓不住真正驅動時間變化的關鍵物體或區域。

強化學習後訓練階段則採用「隱式過程接地」(implicit process grounding)機制,搭配一個複合式獎勵函數(composite reward),同時評估三件事:

  • 結果正確性(outcome correctness):最終答案是否正確;
  • 潛在過程對齊(latent process alignment):推理過程中的潛在視覺表徵是否與真實變換軌跡一致;
  • 無監督視覺聚焦(unsupervised visual focus):模型注意力是否落在合理的關鍵區域上,這部分不需要人工標註,而是透過模型自身的注意力分布做自我一致性評估。

這種設計的核心思路,是把 RLHF 類方法中常見的「只看最終答案對錯」的稀疏獎勵,擴展成同時獎勵「過程是否合理」,類似於在視覺領域做 process reward model,但獎勵訊號來自潛在表徵層面而非人工標註的中間步驟。

為了系統性評測「時間追蹤」能力,作者還提出了新資料集 Vbvr-VQA。它把傳統的影片推理問題,重新表述為一個「嚴格圖像排序任務」(strict image-ordering task)——也就是把影片拆成若干關鍵幀,要求模型判斷正確的時間順序,這樣可以更乾淨地隔離出「時間邏輯推理」這一項能力,避免與其他因素(如語言生成品質)混雜在一起評分。

實驗結果

在自己提出的 Vbvr-VQA 基準上,ChronoVision 取得了目前最佳(state-of-the-art)的表現:

  • in-domain(同分布)準確率 74.8%
  • out-of-domain(跨分布)準確率 71.6%

兩者差距僅約 3 個百分點,顯示模型學到的並非單純記憶訓練分布中的排序模式,而是具備一定的泛化能力,能將「潛在視覺對齊」的推理策略遷移到未見過的場景組合上。

更關鍵的是跨資料集的驗證:在公認高難度的跨領域基準 IntPhys2(專門測試模型對物理直覺與時間連續性的理解)上,ChronoVision 取得了 55.0% 的準確率。IntPhys2 之所以被稱為「highly challenging」,是因為它刻意設計了違反物理常識的干擾選項,要求模型不只看表面像素變化,還要理解物體運動背後隱含的物理規律——這對純語言驅動的推理方法往往是重大考驗。ChronoVision 在完全沒有針對 IntPhys2 做專門訓練的情況下,仍能取得超過一半的準確率,說明其「潛在狀態重建」與「ROI 聚焦」的設計具有跨任務、跨資料分布的遷移價值,而不只是針對自家資料集調優的結果。

論文中的實驗設計也隱含了消融比較的邏輯——即 Reconstructive Visual Head、ROI Attention Locating 以及 RL 階段的複合獎勵各自對最終表現的貢獻,用以證明「潛在影像對齊」相較於純文字鏈式推理確實帶來實質提升。

意義

ChronoVision 這篇工作對 MLLM 研究社群傳達了一個值得注意的訊號:當前以「文字 chain-of-thought」為主流的推理範式,在處理連續、細粒度的視覺時間動態時存在結構性瓶頸,單靠加大模型規模或增加文字推理步驟未必能根本解決問題。轉而讓模型在潛在表徵空間中直接對齊視覺轉換過程,提供了一條不同於純語言推理的技術路線。

其次,將 RL 獎勵函數從「只看答案對錯」擴展到「同時評估潛在過程對齊與視覺聚焦」,呼應了近期強化學習研究中「過程監督優於結果監督」的趨勢——但 ChronoVision 的做法巧妙之處在於,這種過程監督訊號可以透過潛在表徵與注意力分布自動產生,不需要昂貴的人工步驟標註,這對於擴大訓練資料規模、降低標註成本有實際意義。

再者,Vbvr-VQA 這個「把影片推理轉化為嚴格圖像排序任務」的評測設計思路,本身也是一個方法論貢獻——它讓研究者能夠更精確地量化模型的「時間邏輯」能力,而不是被語言生成流暢度或無關細節干擾評分結果,未來可能被其他團隊採用作為時間推理能力的標準化測試工具。

最後,在 IntPhys2 這類強調物理直覺的跨域基準上取得 55.0% 的成績,雖然離「完全解決」還有距離,但已展示出「視覺—潛在對齊」這條路線在真實世界物理推理場景中的可遷移性。對於自動駕駛感知決策、機器人操作規劃、影片內容理解等需要模型準確把握「事物如何隨時間演變」的下游應用而言,這類研究提供了一個值得持續關注的技術方向。