EnvACE:讓 AI agent 在腦內「排練」環境,訓練不再依賴真實工具
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
背景
近年來,大型語言模型(LLM)agent 要處理長流程的工具呼叫任務——例如訂機票、查資料庫、操作金融系統——訓練方式主要靠兩條路:一是讓模型在真實或高擬真的可執行環境中反覆試錯,二是接上外部模擬器(simulator)來產生互動回饋。這兩條路都有明顯的成本問題。建構一個可驗證、可規模化的執行環境(例如要模擬真實 API 的回應、資料庫狀態變化)本身就需要大量工程投入;而外部模擬器又常常「難以貼地」(difficult to ground),也就是模擬出來的環境反應和真實世界有落差,導致模型學到的策略遷移到真實場景時效果打折。
換句話說,agentic 強化學習(agentic RL)目前最大的瓶頸不是演算法,而是「環境」本身——沒有足夠多、夠真實、夠便宜的環境可以讓模型練習。這也是為什麼過去許多工作走向「環境擴增」(environment scaling),也就是想辦法造更多、更豐富的訓練環境,但這類方法終究受限於人力和算力去維護環境的正確性。
EnvACE(發表於 2026 年 8 月,arXiv 編號 2608.06197,作者來自華為等機構的 Zishan Xu、Zhiyuan Yao 等 11 人團隊)提出一個不同的思路:如果 agent 能自己把「環境會怎麼回應」這件事學進參數裡,是不是就不需要外部環境了?
方法
EnvACE 的核心概念叫「world rehearsal」(世界排練)。訓練時,同一個 policy(策略模型)會在兩種角色之間切換:
- 行動者(actor)角色:根據當前任務狀態,生成一個工具呼叫(tool call)。
- 環境角色:立刻切換身分,扮演「環境」本身,自己生成這個工具呼叫理論上會得到的回應(response)。
接著,policy 會把自己剛剛「排練」出來的環境回應,當作真實觀察值,拿去決定下一步動作,如此反覆進行,直到任務結束或達到最大互動輪數(論文中設定最長 30 輪)。整個過程完全不接觸真實或外部模擬環境——訓練資料只需要任務描述與工具規格,環境反應全靠模型自己「想像」出來。
關鍵在於,這兩個角色(行動與環境模擬)是端到端聯合優化的,獎勵訊號來自任務是否成功完成(task-success reward)。技術上採用一種「角色分離的 GRPO」(role-wise GRPO):行動角色和環境角色各自有獨立的獎勵基準線(baseline),避免兩種角色的梯度互相干擾,但共享同一組模型參數更新。這樣一來,模型不只是學會「怎麼做」,還同時把「做了會發生什麼」內化成自己的世界模型(agent world model),兩者互相校準。
訓練基礎模型是 Qwen3 系列(1.7B 與 8B),資料來自 CM2 工具使用軌跡集,訓練規模約 470 步、16 張 NVIDIA H20 GPU、batch size 16。
更有趣的是測試時的應用:由於模型已經內化了環境動態,推論階段可以在「真正執行」工具呼叫之前,先私下(不影響外部環境)排練幾次,預測可能的後果,選出比較安全或成功率較高的動作再送出——這叫「private rehearsal」,不需要額外呼叫真實環境,純粹靠模型內部多想幾遍。
實驗結果
EnvACE 在四個 agent benchmark 上測試:BFCL-v4、τ²-Bench(tau²-Bench)、VitaBench、FinMCP-Bench。
- 在 BFCL-v4、τ²-Bench、VitaBench 三者的綜合評分上,EnvACE-8B 取得 32.91%,優於環境擴增基線 EnvScaler-8B 的 31.92%,也優於參數量更大的 AWM-14B(32.54%)——也就是用更小的模型、不靠外部環境,反而贏過擴大環境規模或擴大模型規模的做法。
- 在 FinMCP-Bench 上,EnvACE 取得最佳 TF1 分數 46.78%,以及最佳工具呼叫精確度(tool precision)54.04%。
- 模型規模效應:把模型從 1.7B 擴大到 8B,BFCL-v4 上進步 +14.23%,τ²-Bench 上進步 +21.4%,顯示 world rehearsal 帶來的收益隨模型容量增加而放大——換句話說,模型越大,越能把環境動態學得更準,自我排練的價值也越高。
- 測試時排練(test-time rehearsal):在排練次數 N=2 的設定下,並行排練(parallel rehearsal)可以把整體分數從 36.7% 提升到 40.9%(+4.2%);序列式排練(sequential rehearsal)則從 36.7% 提升到 38.5%(+1.8%)。也就是說,即使不接觸額外的真實環境,只靠模型自己在腦內多想幾種可能性,就能顯著提高任務成功率。
論文也做了控制實驗,證實 world rehearsal 在不同模型規模下都能穩定改善 policy 的學習效果,而不只是在特定規模下的偶然結果。
意義
EnvACE 這篇論文最核心的貢獻,是把「agent 訓練必須依賴外部環境」這個長期被視為理所當然的前提,換成「環境動態可以被模型自己學會並內化」。這件事有幾個層面的意義:
第一,訓練成本結構改變。過去要擴大 agent 訓練規模,常常意味著要花更多資源建更多可執行環境或維護模擬器;EnvACE 顯示,把資源投入在讓模型自己學會模擬環境上,可能是更划算的擴展路徑——用 8B 模型加 world rehearsal,就能打贏靠更大環境規模或更大模型規模堆出來的基線。
第二,世界模型(world model)與 agent 決策的結合變得更直接、更輕量。過去談 world model 常需要獨立的模型架構去預測未來狀態,EnvACE 則證明同一個 transformer policy 只靠角色切換和聯合強化學習,就能同時扮演「行動者」和「世界」,不需要額外模組。
第三,測試時排練這個機制,某種程度上是把「思考過再做」的直覺,用具體、可訓練的方式實作出來——模型在真正送出工具呼叫前,先在內部模擬幾種後果,篩掉可能失敗或危險的動作。這對需要謹慎操作的場景(例如金融交易、系統管理)特別有價值,因為犯錯的代價高,而 EnvACE 提供了一種不需要額外外部試錯就能降低風險的手段。
整體而言,EnvACE 為 LLM agent 訓練指出一條「跳脫外部環境限制」的可能路徑,對於想要用強化學習訓練 tool-use agent、又苦於環境建構成本的團隊,是一個值得參考的方向。作者也已公開程式碼(github.com/Within-yao/EnvACE),方便社群驗證與延伸。