AREX:讓深度研究 Agent 學會「自我驗證、自我改進」
AREX: Towards a Recursively Self-Improving Agent for Deep Research
背景
近年來「deep research」類型的 AI agent 蔚為風潮:使用者丟出一個複雜問題,agent 自動上網搜尋、瀏覽網頁、彙整證據,最後給出一份有憑有據的答案。但這類任務有一個根本困難——答案往往必須同時滿足「多重限制條件」(例如「找出 2010 年代某位獲獎、任職於某機構、又發表過某類論文的學者」),而找到滿足所有條件的答案,成本遠高於「驗證某個候選答案是否成立」。換句話說,發現答案很貴,驗證答案卻可以拆解成一條條可獨立檢查的條件,相對便宜。
現有的 deep research agent 大多只是「搜尋更久、想更多步」,屬於單向的線性推進:一路蒐證、一路推理,直到湊出答案就結束,很少回頭系統性地檢查每個限制條件是否真的被滿足。這種做法在任務簡單時堪用,但面對 BrowseComp、Humanity's Last Exam(HLE)這類需要層層限制、極易出錯的長鏈推理任務時,錯誤很容易在中途累積,且無法被及時發現與修正。
AREX(arXiv:2607.21461)的作者群(由 Shuqi Lu 領銜、共 23 位作者)正是針對這個「發現—驗證不對稱」的結構性洞察,提出了一個「遞迴式自我改進(Recursively Self-Improving, RSI)」的 agent 框架,主張 agent 不該只是搜得更久,而應該把「驗證」變成一個主動的控制訊號,用來反覆修正自己的研究狀態。
方法
AREX 的核心是一個雙層迴圈架構:
- 內層研究迴圈(inner research loop):負責實際動手做事——搜尋、瀏覽網頁、彙整證據,逐步建構出一個「暫定答案(provisional answer)」。
- 外層自我改進迴圈(outer self-improvement loop):不直接做研究,而是把暫定答案拆解成一條條限制條件(constraint-wise),逐項稽核,找出尚未被證實的主張(unresolved claims),然後針對這些漏洞發動有目標的後續研究(targeted follow-up research),再把結果餵回內層迴圈。
這種設計讓「驗證」不只是最後把關的濾網,而是全程參與、驅動下一步該查什麼的引擎。推論時,內層迴圈最多執行 300 輪工具呼叫,外層自我改進迴圈最多執行 5 次稽核操作。
要讓這套遞迴機制在長時間、多輪對話下還能撐得住,關鍵挑戰是「互動歷史會越滾越長」,容易撐爆上下文視窗。為此,AREX 訓練了一個自主上下文更新工具(Autonomous Context Update, ACU),能把不斷膨脹的互動紀錄壓縮成一個精簡的「改進狀態」,只保留已驗證的證據和尚未解決的限制條件,且完全不依賴外部模型輔助壓縮。實測中,ACU 在 BrowseComp 測試裡有 80.3% 的案例被觸發,觸發時平均上下文只有 25,721 tokens(中位數 25,386 tokens),遠低於 128K 的視窗上限;觸發原因主要是「搜尋策略需要修正」(66.9%)與「候選答案被推翻」(13.6%),且更新後的狀態有 95.5% 保留了未解決的限制條件、96.4% 保留了下一步計畫。
訓練上,AREX 採用「agentic mid-training + 長時程強化學習(long-horizon RL)」兩階段流程:
- 多階段 mid-training:先用「瀏覽密集型」任務打底工具使用與證據蒐集能力,接著加入「專家推理型」任務訓練假設驗證與高難度題目,最後混合各類任務並搭配「關鍵步驟重播(key-step replay)」做整合。
- 關鍵步驟強化監督:作者發現在標準訓練後,「發現關鍵證據」「推翻錯誤方向」「觸發上下文更新」這三類步驟的 loss 明顯高於一般步驟(分別高出 19%、28%、29%),顯示這些是模型較難學會、也最關鍵的節點,因此訓練時特別加重這些步驟的監督權重。
- 步驟感知式 RL(Step-Aware RL):因為長任務的最終獎勵訊號稀疏,作者對長度做正規化的步驟級別策略比值(用幾何平均聚合),並只對成功軌跡中的關鍵步驟給予額外獎勵加成,而非對整條軌跡一視同仁。
模型有兩種規模:AREX-Turbo(4B 稠密模型,以 Qwen3.5-4B 為底座)與AREX-Base(122B 總參數、僅啟用 10B 的 Mixture-of-Experts 模型,以 Qwen3.5-122B-A10B 為底座)。
實驗結果
在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch-en、HLE(文字子集)等六個 benchmark 上:
- AREX-Base:BrowseComp 82.5%、GAIA 85.4%、xbench-2510 71.0%、DeepSearchQA 89.9%(F1)、WideSearch-en 82.0%(Item-F1)、HLE 52.4%。其中 WideSearch-en 分數是所有受測模型中最高的,且在多數 benchmark 上追平甚至超越參數量大得多的 Qwen3.5-397B,也在 DeepSearchQA、HLE 上優於 MiroThinker-H1,在 DeepSearchQA、WideSearch、HLE 上優於 DeepSeek-V4-Pro,在 GAIA、WideSearch 上優於 Kimi-K2.6。
- AREX-Turbo(僅 4B):BrowseComp 70.7%、GAIA 81.6%、xbench-2510 57.0%、DeepSearchQA 78.5%、WideSearch-en 68.5%、HLE 40.6%——在六項中的五項超越參數量是自己 8.75 倍的 Qwen3.5-35B。
消融實驗(以 BrowseComp 準確率為指標,滿分基準 82.5%)也證實各設計都有實質貢獻:
- 拿掉漸進式多輪 mid-training、直接混合訓練:降至 77.5%(-5.0 points)
- 拿掉關鍵步驟監督、改用隨機步驟重播:降至 74.1%(-8.4 points)
- 拿掉步驟感知式 RL、改用標準 GRPO:降至 79.4%(-3.1 points)
- 拿掉 ACU 且拿掉外層迴圈:只剩 59.6%;加回外層迴圈但沒有 ACU:69.8%(+10.2 points);同時具備 ACU 與外層迴圈才能到 82.5%,顯示兩者疊加的效果最大。
此外,作者分析模型輸出的信心分數校準度:正確答案中有 95.9% 落在 90–100 分信心區間,錯誤答案中有 55.2% 落在 60 分以下,顯示模型的信心判斷相當可靠,能有效支撐「該接受、該修正、還是該重來」的決策機制。附錄中一個初步的自我蒸餾(self-distillation)實驗也顯示,用中間版 agent 產生的軌跡訓練,比直接用原始軌跡訓練效果更好(在簡化情境下由 52.3% 提升到 57.1%,+4.8 points),暗示這套遞迴改進框架未來還有進一步自我迭代提升的空間。
意義
AREX 最重要的貢獻,是把「驗證」從研究流程的終點,重新定位成貫穿全程的控制訊號——這呼應了論文標題裡「recursively self-improving」的核心主張:與其讓 agent 無止盡地搜更久、想更多步,不如讓它像人類研究者一樣,邊做邊查、發現漏洞就回頭補強。這種「內層做事、外層審查」的雙迴圈設計,加上不依賴外部模型、能自主決定何時壓縮歷史紀錄的 ACU 機制,讓小模型也能在長時程、多限制條件的任務上撐得住,而不會被無限膨脹的上下文拖垮。
實務意義上,AREX-Turbo 用僅 4B 參數就打贏 35B 模型,AREX-Base 用 10B 活躍參數就追平甚至超越數百億活躍參數的旗艦模型,這對於想要壓低推論成本、卻又需要高可靠度深度研究能力的產品(例如企業知識檢索、法規遵循查核、學術文獻整合)非常有吸引力。更長遠來看,這篇論文示範了一種訓練長時程 agent 的通用配方——用關鍵步驟監督緩解稀疏獎勵問題、用步驟感知式 RL 取代整條軌跡的粗粒度獎勵——這套方法論很可能會被延伸到其他需要多輪工具使用、長期規劃的 agent 任務上,而不僅限於「深度研究」這個垂直領域。