← 目錄

K1 論文詳解

2026-08-07


ABSeeker:用答案回溯的步驟級獎勵,教會搜尋Agent分辨好壞行動

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

Shanghai Jiao Tong UniversityYijun Lu、Rui Ye、Jiajun Wang、Yuwen Du、Tian Jin、Songhua Liu、Siheng Chen54Hugging FacearXiv
LLM Agent強化學習GRPO資訊檢索Qwen

背景

近年來,像 OpenAI 的 Deep Research 一樣的「長程搜尋代理人」(long-horizon search agent)成為研究熱點:模型要在多輪對話中反覆執行搜尋、檢索、驗證、整合證據等動作,最終才給出一個答案。這類任務的訓練難點在於軌跡(trajectory)很長,往往要走十幾步甚至幾十步才能拿到最終結果,而現有的訓練方法——無論是監督式微調(SFT)還是強化學習(RL,例如 GRPO)——幾乎都是把整條軌跡當成一個整體來對待:只看最終答案對不對,給一個「稀疏」的、軌跡層級的獎勵訊號,卻不區分軌跡中每一步到底是有用的探索,還是無用甚至有害的重複、誤判。

這會造成兩個明顯的問題。第一,一條最終答錯的軌跡裡,可能其實包含了很多正確、有價值的中間發現,但因為結果判定失敗,整條軌跡的訊號都被壓低,等於把「好步驟」也一起懲罰了。第二,一條最終答對的軌跡裡,也可能夾雜冗餘或走錯路的步驟,卻因結果正確而被一併「獎勵」,模型學不到要剔除這些雜訊。這正是 Answer-Backtracked Credit Assignment(ABC,答案回溯式credit assignment)這篇論文要解決的核心問題:如何把「一條軌跡一個分數」的稀疏監督,轉換成「每一步都有分數」的稠密監督。

方法

ABC 框架分兩個階段運作。第一階段稱為 Answer-Backtracked Clue Recovery(答案回溯式線索還原):給定一個問題與其已驗證的正確答案,系統會用一個 LLM 從答案「倒推」回去,重建出解題所需的中間實體、事實與關聯線索,並透過主動的網頁搜尋來驗證每一條線索是否可靠,從而建立起一套可信賴的「解題路徑錨點」。

第二階段是 Clue-Anchored Step Scoring(線索錨定式步驟評分):把軌跡中每一步搜尋行動,拿去對照這些還原出來的線索,判斷這一步究竟是「找到了正確線索」「排除了錯誤候選」還是「誤判、丟棄了本來正確的線索」,並依此給出一個介於 0 到 2 分之間的分數——基準分為 1.0,找到正確線索加 0.8 分,成功排除錯誤候選加 0.4 分,若錯誤地否定了本應正確的線索則扣 0.8 分。這樣一來,即使整條軌跡最終答錯,其中真正有價值的步驟依然能拿到高分;反之,答對的軌跡裡的冗餘或誤判步驟也會被扣分。

基於這套步驟級分數,論文提出兩種訓練方式:ABC-SFT 用 sigmoid 映射後的步驟獎勵去重新加權每一輪(turn)的損失函數,讓高分步驟在梯度更新中貢獻更大、低分步驟貢獻趨近於零;ABC-GRPO 則把步驟級分數直接當作 GRPO 強化學習中的獎勵訊號,並以折扣因子 γ=0.25 計算跨步驟的折扣優勢(advantage),讓 RL 訓練也能感知到每一步的品質差異,而不只是看整條軌跡的最終結果。整套方法以 Qwen3.5-4B 為骨幹模型,只用了 8.5k 筆軌跡資料(其中約 5.5k 條正確、3.0k 條錯誤,取自 OpenSeeker)進行 3 個 epoch 的 SFT,再用 1,000 個問題、每題 8 次 rollout 做 GRPO 強化學習,訓練出最終模型 ABSeeker。

實驗結果

ABSeeker 在多個高難度搜尋類 benchmark 上取得亮眼成績:在專門考驗多跳、隱蔽線索檢索能力的 BrowseComp 上拿下 37.3%,中文版 BrowseComp-ZH 上拿下 39.1%;若加上額外的 context management(上下文管理)機制,兩項分數further大幅提升到 55.3% 與 52.9%。此外在 xbench-2505 上達到 77.0%,xbench-2510 上達到 46.0%,GAIA-text 上達到 81.6%。

作為對照,同等規模(4B 參數)的其他 agent,例如 QUEST-4B 僅拿下 40.0%、DR-Venus 僅 29.1%(注:未加context management情況下ABSeeker表現已可比擬甚至超越同尺寸對手,加上context management後優勢更明顯);而規模大它近十倍(約 30B 參數)的 Tongyi DeepResearch 在 BrowseComp 上也只有 43.4%,說明一個 4B 模型透過更精細的訓練訊號,已能追平甚至超越大得多的模型。論文的分析還發現,失敗軌跡中竟有將近 10% 的步驟拿到高於 1.0 的獎勵分數,證明「失敗」不代表過程全無價值;反過來,成功軌跡裡也有約 4% 的步驟被判定為低品質,驗證了步驟級區分的必要性。消融實驗顯示,單獨使用 ABC-SFT 已能在多數 benchmark 上帶來提升,而 ABC-GRPO 在五個 benchmark 上都全面優於傳統的軌跡層級 GRPO,且訓練過程中觀察到 ABSeeker 傾向產生更長、探索性更強的搜尋軌跡。

意義

這篇論文的核心貢獻,不是又造出一個更強的搜尋 agent,而是指出了訓練長程 agent 時一個長期被忽視的結構性問題:結果導向的稀疏獎勵,會系統性地錯誤分配 credit 給軌跡中每一個步驟。透過「從答案回溯線索」這個巧妙的設計,ABC 讓模型能夠不依賴人工標注每一步,就自動獲得可信的步驟級監督訊號——這對於資料稀缺、標注成本高的 agentic 訓練場景特別有價值。

更重要的是,ABSeeker 只用 8.5k 筆資料、4B 參數規模,就能在 BrowseComp 這種公認極難的 benchmark 上追平約 30B 規模的模型,說明訓練訊號的品質、而不僅僅是模型規模或資料量,才是決定 agent 能力上限的關鍵因素之一。這也為之後的 search agent、tool-use agent 甚至更廣泛的多輪 LLM agent 訓練提供了一個可推廣的思路:把最終結果反向拆解成可驗證的中間線索,用中間線索去評分每一步行為,而不是簡單地「一好俱好、一壞俱壞」。對於資源有限、無法動輒訓練數十億級模型的團隊而言,這種細粒度credit assignment的做法,可能比單純堆疊參數規模更具性價比。

ToolArtist:讓統一多模態模型自己決定何時查資料、何時畫圖

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

Jiahao Zhao、Xiaomin Yu、Zhongxiang Sun、Fengwei Teng、Chengwei Qin、Xiaobin Hu、Jun Xu、Shuicheng Yan45Hugging FacearXiv
agentic-AI圖像生成UMMRLHFGRPO

背景

現在的文字生成圖片(T2I)模型,例如各種 diffusion 或 autoregressive 模型,已經能畫出視覺上相當漂亮的圖片。但只要任務牽涉到「開放世界知識」——例如某個特定歷史事件的服裝樣式、某座冷門建築的真實外觀、某個地區傳統器具長什麼樣子——這些模型常常會憑空捏造,因為它們的知識完全鎖在訓練資料裡,沒辦法即時查證。

要解決這個問題,一個直覺的做法是把「代理人(agent)」概念引入圖像生成:讓模型先上網搜尋文字或圖片資料,再把查到的資訊整理成生成描述,最後呼叫繪圖工具產出圖片。但論文指出,現有的 agentic 圖像生成方案都有結構性缺陷:要嘛整個流程是「固定工作流」(先搜尋、再生成,順序寫死、無法動態調整),要嘛只把流程中的一部分(例如只有搜尋,或只有 prompt 重寫)交給 agent 控制,生成本身仍然外包給獨立的繪圖模型。這樣一來,「推理」「工具呼叫」「圖像生成」這三件事分屬不同模組,沒有一個統一的策略(policy)去協調它們——模型不知道自己畫出來的圖是否真的忠實反映了搜尋到的證據,也無法根據生成結果反過來調整推理和搜尋策略。

論文作者來自新加坡 Sea AI Lab / 相關團隊(作者包括 Jiahao Zhao、Xiaomin Yu、Zhongxiang Sun、Shuicheng Yan 等),於 2026 年 8 月提出 ToolArtist,目標是把「推理、外部工具使用、原生圖像生成」三者統一到同一個策略裡,讓一個統一多模態模型(Unified Multimodal Model, UMM)自己決定什麼時候該查資料、查什麼、以及何時該動筆畫圖,而不是被寫死的流程牽著走。

方法

ToolArtist 的基礎模型是 Emu3.5,一個把文字和圖像都當成 token、以統一序列建模的原生自回歸 UMM。整個訓練分兩個階段。

第一階段是監督式微調(SFT)。研究團隊先訓練一個「教師 agent」,讓它同時擁有文字搜尋、圖片搜尋、以及外部圖像生成工具,在真實互動環境中跑出大量多輪推理軌跡(rollout)。接著把這些軌跡轉換成 UMM 相容的格式——關鍵技巧是「隱藏」教師 agent 呼叫外部繪圖工具這個動作本身,但保留該工具產出的圖片。這樣一來,UMM 學到的是「自己原生畫出這張圖」,而不是「呼叫外部工具畫圖」,讓生成能力真正內化進模型本身。經過篩選後,最終的 SFT 資料集包含 7,132 條高品質軌跡,平均長度約 20.5k tokens,每條軌跡平均呼叫 4 次工具。資料涵蓋地理/建築(18.9%)、科學工程(14.8%)、歷史(11.6%)、IP/遊戲(10.4%)等多個領域。訓練時 loss 只計算模型自己生成的 token,會排除輸入條件與環境觀察(如搜尋結果),確保模型學到的是完整的「推理→工具呼叫→運用證據→生成圖像」全流程。

第二階段是強化學習,作者為此打造了一套 agentic RL 基礎設施,並提出 Reason-Act-Draw GRPO(RAD-GRPO)。這是 Group Relative Policy Optimization 的變體,採用 token-normalized 方式並對 SFT 參考策略做 KL 正則化,避免策略跑偏太遠。獎勵設計上採用兩種互補訊號:一是「意圖獎勵」,評估模型最終產生的視覺描述(caption)是否準確地把使用者需求與搜尋到的證據翻譯成可執行的生成描述;二是「品質獎勵」,評估最終圖像是否忠實呈現意圖並維持視覺品質,這個獎勵由四個維度加權組成:忠實度(0.1)、視覺正確性(0.4)、文字準確性(0.4)、美學(0.1)。此外還加入格式檢查、鼓勵繪圖、長度懲罰、以及「不畫圖」懲罰等輔助訊號,避免訓練過程中模型出現偷懶或崩潰(比如只推理不畫圖、或输出格式混亂)等退化行為。

實驗結果

論文在兩個核心 benchmark 上驗證效果。第一個是 WISE benchmark,涵蓋 1,000 條 prompt、25 個子領域(物理、化學、文化、時空常識等),ToolArtist 取得整體 0.79 分,其中物理 0.81、化學 0.79,在時空類別上也能與部分頂尖專有模型競爭。

第二個是 WorldGenBench-Humanities,共 732 條涉及 244 個國家的人文知識類 prompt,用 Knowledge Checklist Score(KCS)評分。ToolArtist 平均得分 22.10,明顯超過幾個開源基線:Qwen-Image 為 21.76,Unify-Agent 只有 15.58,GenSearcher-Qwen-Image 為 13.66。按洲別拆解,ToolArtist 在非洲、南極洲、亞洲相關題目上領先,其他地區則互有勝負。論文舉了一個具體案例:一道關於 1955 年 Socotra 島採集龍血樹脂傳統作業的題目,ToolArtist 拿到 0.625 分(8 項檢查點中滿足 5 項,正確呈現傳統工具、當代服裝、當地牲畜與儲存容器等細節),而 Unify-Agent 得 0 分、GenSearcher 只得 0.25 分,差距相當明顯。

消融實驗也驗證了搜尋證據整理機制的重要性:如果拿掉「LLM 生成的網頁來源摘要」這一步(即讓模型直接面對雜亂的原始搜尋結果,而非先由 LLM 整理成結構化摘要),WISE 分數會從 0.79 大幅掉到 0.61,其中生物類子領域退步最明顯,掉了 0.50 分,說明對搜尋結果做語意層面的整理,是模型能正確運用外部知識的關鍵一環。RL 訓練過程本身也很穩定:獎勵在訓練初期略微下滑,第 10–20 步開始快速提升,之後穩定在 0.37–0.40 區間並緩慢爬升到約 0.41;策略熵則從約 12.03 平緩降到 11.87–11.91,沒有出現熵崩潰現象,代表模型是穩健地把機率質量集中到高獎勵行為上,而非訓練失控。

整體而言,把「推理、工具、生成」全部交給同一個策略控制的 ToolArtist,一致優於固定流程或只有部分模組交給 agent 的方案。

意義

ToolArtist 的重要性在於,它示範了 agentic 能力如何能真正「內化」進生成模型本身,而不是靠外部拼接。過去多數 agentic 圖像生成系統本質上是「LLM 規劃 + 獨立繪圖模型執行」的兩段式架構,等於是把 LLM 當調度員、繪圖模型當工人,兩者目標函數並不一致,也無法端到端聯合優化。ToolArtist 透過「隱藏工具呼叫但保留生成結果」的 SFT 轉換技巧,加上 RAD-GRPO 這種同時獎勵意圖轉譯品質與最終圖像品質的強化學習方法,讓一個模型同時具備決策何時查證、如何整合證據、以及親自產出高保真圖像的完整能力。

這對需要「知識密集型」圖像生成的實際場景(教育素材、文化考據插圖、新聞配圖、遊戲/IP 美術設定等)有直接意義:模型不再只是憑訓練資料裡的印象作畫,而是能主動查證後再下筆,大幅降低事實性錯誤。同時,作者承諾釋出 7,132 條訓練軌跡與完整的後訓練(post-training)基礎設施,這對開源社群而言是重要資源——目前多數 agentic RL 訓練框架都是為純文字 LLM 設計,針對 UMM 的 agentic RL 基礎設施相對稀缺,ToolArtist 補上了這塊拼圖,讓後續研究者可以直接在此基礎上探索更複雜的多模態 agent 訓練方法。

多模態預訓練的「物理定律」:知識如何在語言與視覺間流動

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

AI at MetaJunlin Han、Shengbang Tong、David Fan、Minghao Chen、Philip Torr、Filippos Kokkinos、Mike Lewis42Hugging FacearXiv
多模態預訓練MoETransformer視覺生成

背景

過去兩年,基礎模型的競賽逐漸從「純語言」擴展到「原生統一多模態」——也就是讓同一個 transformer 從頭就同時學習文字理解、視覺理解與視覺生成,而不是先訓練好語言模型再「外掛」視覺模組。這個方向背後有個直覺:如果人類的智能是靠語言、視覺、動作互相印證發展出來的,那模型或許也該用同樣的方式訓練。

問題是,業界雖然一頭熱地往「統一多模態預訓練」衝,但對於模態之間到底怎麼互動、什麼時候互相幫忙、什麼時候互相扯後腿,幾乎沒有系統性的理解。多數論文只丟出一個「效果不錯」的模型,卻沒有拆解背後的因果機制。這篇由 Meta FAIR、Reality Labs 與牛津大學共同完成的論文《Towards Physics of Multimodal Pretraining》,標題裡的「物理」二字很貼切——作者想做的正是找出多模態訓練背後類似物理定律的規律,而不是又一次「調參數調出一個好模型」。

研究團隊(Junlin Han、Shengbang Tong、David Fan、Minghao Chen、Philip Torr、Filippos Kokkinos、Mike Lewis)用了大量控制實驗,從 1.5B 參數規模的小模型一路驗證到 13.5B 的 MoE(Mixture-of-Experts)大模型,累積訓練 token 數最高達 2T(兩兆),試圖回答四個問題:知識怎麼在語言、視覺理解、視覺生成三者之間流動?什麼決定了模態之間是「互補」還是「打架」?應該多早開始統一訓練?以及,有沒有更省錢的訓練配方。

方法

作者採用 Transfusion 框架,把離散的 next-token prediction(用於文字)和連續的 flow matching / diffusion(用於影像生成)整合進同一個 decoder-only transformer 裡。基礎架構是類似 Llama-3 的設計:SwiGLU 啟動函數、RoPE 位置編碼、pre-RMSNorm、分組查詢注意力(GQA)、FlashAttention,並用 AdamW(β₁=0.9, β₂=0.95, weight decay 0.1)訓練,bf16 精度搭配 FSDP-2 做分散式訓練,context length 為 4096。連續擴散損失的權重被刻意調高到文字交叉熵的 3 倍,以平衡兩種模態的學習速度。

實驗設計分兩層:第一層是小規模控制實驗(1.5B 模型,100B 到 2T tokens 不等),用來做單變量消融;第二層是把發現的規律放大驗證到 13.5B 的 MoE 模型(256 個專家,每個 token 路由到 top-16,實際啟用參數約 1.5B),訓練滿 2T tokens。資料來源上,語言資料用 DCLM 網路爬取語料,視覺資料用約 3.5 億筆 Shutterstock 圖文對(SSTK),另外還設計了一套合成的 CLEVR 擴充資料集,專門用來做「概念遷移」的因果分析(例如顏色、形狀、空間關係、大小、計數等抽象概念能不能在理解與生成任務之間零樣本遷移)。

視覺編碼方式也做了四種對照:預設的 RAE(用 SigLIP-2 ViT-400m/14 編碼成 16×16 語意 token)、直接用原始像素做卷積切塊、CLIP 理解 + Stable Diffusion 3 VAE 生成的混合方案,以及基於 UniTok 的自迴歸離散視覺碼。這樣做是為了驗證觀察到的規律是否只是某種 tokenizer 的巧合,還是能跨架構通用的現象。

在架構消融上,團隊系統性比較了「共享多少參數」的四種變體:完全共享(dense)、只拆開 FFN(前饋層)、拆開 FFN+注意力,以及全部拆開。同時也做了資料混合比例(語言/理解/生成)與訓練時序(何時開始聯合訓練)的系統掃描。

實驗結果

四個核心發現都有具體數字支撐:

知識流動具有明顯不對稱性。 語言資料幾乎總能同時提升視覺理解和視覺生成表現;視覺理解對視覺生成有強烈助益,但反向幾乎沒有回饋;視覺生成對語言或理解任務的幫助則微乎其微。在 CLEVR 合成實驗中,顏色、形狀這類低階屬性在兩個方向都無法零樣本遷移,但空間關係、大小、計數這類結構性概念,理解到生成方向的遷移是成立的,反向卻不成立;微調後,生成任務給理解任務帶來 +0.133 到 +0.273 的平均準確率提升,但理解給生成的提升幾乎是 0。

架構決定了模態間是互補還是競爭。 消融實驗(對應論文 Figure 9)顯示:完全共享參數的 dense 架構,語言困惑度(PPL)反而變差 0.272,擴散損失也惡化 0.0537;而只拆開 FFN、保留共享注意力與正規化層的架構,PPL 改善 0.211,擴散損失改善 0.0168。若連注意力也拆開,協同效益大幅下降;全部拆開則幾乎等同各自獨立訓練的基準線。也就是說,「共享注意力+共享正規化+各模態獨立 FFN」是效果最好的組合,而這個結論在四種不同的視覺 tokenizer 上都成立。

越早統一訓練效果越好。 團隊發現,如果訓練時先跑一段純語言階段再引入視覺(晚期對齊),會出現「視覺懶惰(vision laziness)」現象——模型傾向依賴語言先驗而不去真正建立視覺處理通路。具體來說,經過 800B tokens 純語言預熱後才加入視覺的模型,視覺相關 benchmark 表現普遍下滑 10-20%,推論時對影像 token 的注意力權重從約 0.4 掉到約 0.1,影像 wrapper token 的嵌入範數也明顯萎縮。相對地,從一開始就聯合訓練所有模態,語言指標幾乎不受影響,視覺能力卻穩健得多。

高效訓練配方:70/25/5 的資料配比最佳。 相較於平均分配(70% 語言/15% 理解/15% 生成,下游準確率 46.99%),調整為 70% 語言/25% 理解/僅 5% 生成後,語言下游準確率提升到 54.31%,理解任務平均分數 43.08%(其中一般理解 53.63%、知識類 40.11%、OCR/圖表 27.23%、視覺中心任務 51.33%),生成任務 DPG-Bench 達 0.689、GenEval 達 0.482,證明只用 5% 的生成 token(等於大幅壓低生成資料所需算力)也能維持強勁生成品質。放大到 13.5B MoE、2T tokens 規模驗證後,MoE 架構相較同等規模 dense 模型在語言準確率上再多出 0.37%,早期融合相較晚期融合再多 1.08%,不對稱資料配比相較平衡配比多 1.45%——三項改進疊加,驗證了小規模實驗結論可以直接遷移到大規模訓練。

意義

這篇論文的價值不在於刷新某個 benchmark 的 SOTA,而在於把「統一多模態預訓練」從一門玄學式的調參藝術,往「有原則可循的工程學」推進了一步。過去業界常見的做法是「大力出奇蹟」——把所有模態資料混在一起、砸算力去試,論文則提供了可操作的具體結論:資料複雜度決定協同或競爭、FFN 該不該拆分、什麼時候該引入視覺模態、資料配比該怎麼配。對於正在設計下一代原生多模態模型(類似 GPT-4o、Gemini 這類統一架構)的團隊來說,這些發現可以直接轉化為訓練決策,省下大量试错成本——論文自己就展示了用 5% 的生成資料就能拿到接近甚至優於均衡配比的效果,等於間接省下可觀的算力預算。

「視覺懶惰」現象的發現也值得單獨留意:它提醒研究者,模型會傾向抄捷徑,只要語言先驗夠強,就懶得真正建立視覺處理迴路,除非在架構和資料時序上刻意逼迫它從一開始就得依賴視覺訊號。這其實與強化學習裡「reward hacking」的精神有些相似——只要有更省力的路徑,模型就不會走你以為它在走的那條路。

最後,团队用 13.5B MoE、2T tokens 的大規模實驗驗證了小規模控制實驗的結論具有可遷移性,這本身也是一個重要的方法論貢獻:未來研究者可以更有信心地先在小尺度做便宜的控制實驗,再放心地把結論外推到大模型訓練上,而不必每次都要用昂貴的大規模訓練去試錯。這種「先建立物理定律,再據此设计工程」的思路,或許會成為多模態基礎模型研發下一階段的標準做法。