ABSeeker:用答案回溯的步驟級獎勵,教會搜尋Agent分辨好壞行動
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
背景
近年來,像 OpenAI 的 Deep Research 一樣的「長程搜尋代理人」(long-horizon search agent)成為研究熱點:模型要在多輪對話中反覆執行搜尋、檢索、驗證、整合證據等動作,最終才給出一個答案。這類任務的訓練難點在於軌跡(trajectory)很長,往往要走十幾步甚至幾十步才能拿到最終結果,而現有的訓練方法——無論是監督式微調(SFT)還是強化學習(RL,例如 GRPO)——幾乎都是把整條軌跡當成一個整體來對待:只看最終答案對不對,給一個「稀疏」的、軌跡層級的獎勵訊號,卻不區分軌跡中每一步到底是有用的探索,還是無用甚至有害的重複、誤判。
這會造成兩個明顯的問題。第一,一條最終答錯的軌跡裡,可能其實包含了很多正確、有價值的中間發現,但因為結果判定失敗,整條軌跡的訊號都被壓低,等於把「好步驟」也一起懲罰了。第二,一條最終答對的軌跡裡,也可能夾雜冗餘或走錯路的步驟,卻因結果正確而被一併「獎勵」,模型學不到要剔除這些雜訊。這正是 Answer-Backtracked Credit Assignment(ABC,答案回溯式credit assignment)這篇論文要解決的核心問題:如何把「一條軌跡一個分數」的稀疏監督,轉換成「每一步都有分數」的稠密監督。
方法
ABC 框架分兩個階段運作。第一階段稱為 Answer-Backtracked Clue Recovery(答案回溯式線索還原):給定一個問題與其已驗證的正確答案,系統會用一個 LLM 從答案「倒推」回去,重建出解題所需的中間實體、事實與關聯線索,並透過主動的網頁搜尋來驗證每一條線索是否可靠,從而建立起一套可信賴的「解題路徑錨點」。
第二階段是 Clue-Anchored Step Scoring(線索錨定式步驟評分):把軌跡中每一步搜尋行動,拿去對照這些還原出來的線索,判斷這一步究竟是「找到了正確線索」「排除了錯誤候選」還是「誤判、丟棄了本來正確的線索」,並依此給出一個介於 0 到 2 分之間的分數——基準分為 1.0,找到正確線索加 0.8 分,成功排除錯誤候選加 0.4 分,若錯誤地否定了本應正確的線索則扣 0.8 分。這樣一來,即使整條軌跡最終答錯,其中真正有價值的步驟依然能拿到高分;反之,答對的軌跡裡的冗餘或誤判步驟也會被扣分。
基於這套步驟級分數,論文提出兩種訓練方式:ABC-SFT 用 sigmoid 映射後的步驟獎勵去重新加權每一輪(turn)的損失函數,讓高分步驟在梯度更新中貢獻更大、低分步驟貢獻趨近於零;ABC-GRPO 則把步驟級分數直接當作 GRPO 強化學習中的獎勵訊號,並以折扣因子 γ=0.25 計算跨步驟的折扣優勢(advantage),讓 RL 訓練也能感知到每一步的品質差異,而不只是看整條軌跡的最終結果。整套方法以 Qwen3.5-4B 為骨幹模型,只用了 8.5k 筆軌跡資料(其中約 5.5k 條正確、3.0k 條錯誤,取自 OpenSeeker)進行 3 個 epoch 的 SFT,再用 1,000 個問題、每題 8 次 rollout 做 GRPO 強化學習,訓練出最終模型 ABSeeker。
實驗結果
ABSeeker 在多個高難度搜尋類 benchmark 上取得亮眼成績:在專門考驗多跳、隱蔽線索檢索能力的 BrowseComp 上拿下 37.3%,中文版 BrowseComp-ZH 上拿下 39.1%;若加上額外的 context management(上下文管理)機制,兩項分數further大幅提升到 55.3% 與 52.9%。此外在 xbench-2505 上達到 77.0%,xbench-2510 上達到 46.0%,GAIA-text 上達到 81.6%。
作為對照,同等規模(4B 參數)的其他 agent,例如 QUEST-4B 僅拿下 40.0%、DR-Venus 僅 29.1%(注:未加context management情況下ABSeeker表現已可比擬甚至超越同尺寸對手,加上context management後優勢更明顯);而規模大它近十倍(約 30B 參數)的 Tongyi DeepResearch 在 BrowseComp 上也只有 43.4%,說明一個 4B 模型透過更精細的訓練訊號,已能追平甚至超越大得多的模型。論文的分析還發現,失敗軌跡中竟有將近 10% 的步驟拿到高於 1.0 的獎勵分數,證明「失敗」不代表過程全無價值;反過來,成功軌跡裡也有約 4% 的步驟被判定為低品質,驗證了步驟級區分的必要性。消融實驗顯示,單獨使用 ABC-SFT 已能在多數 benchmark 上帶來提升,而 ABC-GRPO 在五個 benchmark 上都全面優於傳統的軌跡層級 GRPO,且訓練過程中觀察到 ABSeeker 傾向產生更長、探索性更強的搜尋軌跡。
意義
這篇論文的核心貢獻,不是又造出一個更強的搜尋 agent,而是指出了訓練長程 agent 時一個長期被忽視的結構性問題:結果導向的稀疏獎勵,會系統性地錯誤分配 credit 給軌跡中每一個步驟。透過「從答案回溯線索」這個巧妙的設計,ABC 讓模型能夠不依賴人工標注每一步,就自動獲得可信的步驟級監督訊號——這對於資料稀缺、標注成本高的 agentic 訓練場景特別有價值。
更重要的是,ABSeeker 只用 8.5k 筆資料、4B 參數規模,就能在 BrowseComp 這種公認極難的 benchmark 上追平約 30B 規模的模型,說明訓練訊號的品質、而不僅僅是模型規模或資料量,才是決定 agent 能力上限的關鍵因素之一。這也為之後的 search agent、tool-use agent 甚至更廣泛的多輪 LLM agent 訓練提供了一個可推廣的思路:把最終結果反向拆解成可驗證的中間線索,用中間線索去評分每一步行為,而不是簡單地「一好俱好、一壞俱壞」。對於資源有限、無法動輒訓練數十億級模型的團隊而言,這種細粒度credit assignment的做法,可能比單純堆疊參數規模更具性價比。