← 目錄

K1 論文詳解

2026-07-22


TimeLens2:讓多模態大模型不只「看懂」影片,還能精準「定位」證據時刻

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Multimedia Computing Group-Nanjing UniversityYuhan Zhu、Changlian Ma、Xiangyu Zeng、Xinhao Li、Zhiqiu Zhang、Songze Li、Jun Zhang、Tianxiang Jiang141Hugging FacearXiv
影片理解多模態LLM時序定位強化學習benchmark

背景

近年來影片多模態大語言模型(video MLLMs)在「看懂影片內容」上已經相當成熟——問它「這段影片在講什麼」,它能給出流暢的描述。但當你追問「證據出現在影片的哪個時間點」,多數模型就顯得力不從心。這個任務被稱為「video temporal grounding」(影片時序定位):給定一段查詢或問題,模型需要在影片時間軸上標出支持答案的一組區間,而且這組區間的數量本身就是不確定的——可能是一段、兩段,甚至更多段不連續的片段。TimeLens2 這篇論文(arXiv:2607.17423,作者包含 Yuhan Zhu、Limin Wang 等 15 位研究者)就是針對這個「generalist video temporal grounding」問題提出的完整解法。

論文指出現有方法在兩個層面上都與「集合式」(set-valued)任務錯位:第一是監督訊號層面,長影片的標註往往依賴「一次過」(one-pass)的人工或自動標註,容易漏掉重複出現的證據或標錯邊界;第二是優化目標層面,強化學習中常用的 temporal IoU(tIoU)獎勵對「完全沒有重疊」的預測一律給零分,無法區分「差一點點就對」和「差很遠」的預測,這讓訓練訊號變得非常稀疏且不穩定。TimeLens2 的核心主張是:從監督到優化的整個流程,都應該把時序證據當作一個「區間集合」(interval set)來處理,而不是簡化成單一區間或依賴脆弱的一對一匹配。

方法

TimeLens2 的解法分成資料建構與獎勵設計兩大部分。

TimeLens2-93K 資料集:研究團隊從 34,867 支 YouTube 影片出發,涵蓋從一分鐘以內到一小時以上五種時長區間。建構流程分六步驟:先用 Qwen3-VL-235B 生成帶時間戳記的階層式字幕,再透過 Kimi-K2.5 推導出陳述式查詢與粗略的多區間候選提案;接著用兩個獨立的定位代理(Qwen3-VL-30B 與 TimeLens-8B)各自重新定位證據區間,只保留兩者 IoU_set 超過 0.9 的「跨代理共識」樣本;再用文字—影片嵌入的餘弦相似度(門檻 0.5)做語意驗證;最後把邊界精修當作局部變化點偵測問題處理。這套流程最終產出 23,793 支影片、93,232 個定位實例(其中 12,091 個為多區間案例)。消融實驗顯示,這套逐步過濾流程讓 mIoU 從原始標籤的 42.0 一路提升到 45.8,只用了約八分之一的標籤量就換來 3.8 分的淨提升。

Temporal Wasserstein 獎勵(R_TW):這是本文最關鍵的創新。標準 tIoU 只要預測區間和真值完全不重疊就給 0 分,導致「差一點的近似錯誤」和「差很遠的離譜錯誤」拿到一樣的懲罰,梯度訊號幾乎消失。TimeLens2 把預測和真值的區間集合都轉換成「合併支撐集上的均勻分布」,再計算精確的一維 Wasserstein 距離(W1),公式大致為 R_TW = exp(−W(Ŷ,Y)/|merge(Y)|+ε)。這個設計有兩個好處:一是「免匹配」(matching-free),不需要在預測區間和真值區間之間做脆弱的一對一配對;二是「碎片不變性」(fragmentation-invariant),只要合併後的支撐集相同,不管切成幾段分數都一樣。最終獎勵是 R_tIoU + R_TW 減去無效輸出的懲罰項,讓 tIoU 負責精準重疊的訊號,R_TW 負責近似程度的密集回饋。

訓練分兩階段:第一階段做監督微調(SFT),混合 TimeLens2-93K、TimeLens-100K 與 Ego4D-NLQ 的長上下文樣本,並用 27 種指令變體 × 28 種回應格式(共 756 種組合)強化模型對「協定無關」的區間語意理解;第二階段用 GRPO 強化學習,搭配「難例挖掘」(依平均 tIoU 反向加權採樣)、每個 prompt 生成 8 個候選、群組內去中心化獎勵,影片以 2 fps 取樣、最多 512 幀、16K token 預算。

實驗結果

TimeLens2 在七個 benchmark(Charades-STA、ActivityNet Captions、QVHighlights、VUE-TR、VUE-TR-V2、MomentSeeker、Ego4D-NLQ)上全面評測。以 Qwen3-VL 為骨幹的三個規格版本相較各自的骨幹模型,平均 mIoU 分別提升:2B 版 +14.2 分(達 44.5)、4B 版 +13.0 分(達 47.7)、8B 版 +18.1 分(達 48.0)。以 4B 版為例,在 Charades-STA 上從骨幹的 49.4 提升到 57.7,在 VUE-TR 上從 33.6 大幅躍升到 53.2,在長影片的 VUE-TR-V2 上更是接近翻倍(骨幹 20.3 → TimeLens2 提升幅度達 +27.8 mIoU)。

更值得注意的是規模效應:TimeLens2-2B 打敗了所有同尺寸的開源基線,而 4B、8B 版本更是刷新了整體 state-of-the-art,超越了參數量最高達 397B 的開源模型(如 Qwen3.5-397B-A17B,平均領先 7.5 mIoU 分),僅在 QVHighlights 上落後 Gemini 2.5 Pro 0.2 分。消融實驗也支持了設計選擇的必要性:R_TW 相較於「配對式」的 NGIoU 變體平均高出 0.6 分,在多區間 benchmark(VUE-TR)上差距擴大到 1.4 分;在完全零重疊的 4,332 個預測案例中,加入 R_TW 後,「近距離錯誤」有 21.9% 被成功挽救、「中距離」15.8%、「遠距離」5.7%,證明密集獎勵確實能提供有效的學習訊號。另外,儘管訓練只用陳述句查詢,模型在 MomentSeeker 的問句式定位任務上仍從 15.3 mIoU 提升到 25.8,顯示模型學到的是通用的「證據搜尋」能力,而非單純記憶特定格式。

意義

TimeLens2 的價值不只在於刷新 benchmark 分數,而在於重新定義了這個任務該怎麼被監督與優化。過去大家習慣把時序定位簡化成「找一段區間」的迴歸問題,但真實世界的查詢往往對應到影片中散落的多個片段——這正是論文強調的「集合式任務」本質。透過把區間集合視為一維分布並用 Wasserstein 距離衡量差異,TimeLens2 提供了一種數學上乾淨、且對非重疊預測依然有梯度的獎勵設計,這個思路未來很可能被推廣到其他「集合輸出」的多模態任務上,例如多目標偵測的時序版本或文件多段落證據抽取。

對產業應用而言,8B 這種中等規模的模型就能超越 397B 級別的巨型開源模型,意味著「影片證據定位」這類需要精細時間感知的任務,未必需要堆疊參數量,更關鍵的是資料品質與獎勵設計——這對想要落地部署影片理解系統(例如監控影片檢索、教學影片片段索引、長影片摘要配合引用)的團隊來說是個重要訊號:與其追求更大模型,不如投資在標註流程的可靠性與訓練目標的合理性上。論文作者也坦言,目前的資料集並非終點,若換用更強的專有模型做標註,品質還有進一步提升空間,而下一步的重點方向是把「時序定位」擴展到「時空定位」(同時回答何時與何地),這對需要持久化記憶與行動規劃的具身智能(embodied AI)系統將尤其重要。

EvolvingWorld:讓角色與世界一起「活過來」的開放式互動文學模擬框架

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

TencentQing Zong、Yue Guo、Mengxin Yang、Yiwen Guo、Yangqiu Song73Hugging FacearXiv
LLM Agent角色扮演World ModelLLM-as-Judge長時序模擬

背景

角色扮演(role-play)與互動小說一直是 LLM 應用的熱門場景,但現有系統大多把問題想得太簡單:要嘛只做「靜態人設模仿」——角色一開始設定好個性、口吻,之後就一成不變地照本宣科;要嘛只做「孤立場景生成」——每個場景各自獨立,前後不連貫,角色不會因為經歷過的事情而改變,世界也不會因為角色的行動留下痕跡。這兩種做法都無法反映真實小說世界的樣貌:角色會成長、動搖、黑化或重建信任,而世界本身(地點、物品、勢力關係)也會隨劇情推進而變化。

更棘手的是schema(資料結構)問題。過去的系統多半採用「固定欄位」來描述角色狀態(例如:好感度、HP、心情),這種設計在特定類型的遊戲裡好用,但換一本奇幻小說、換一本偵探小說,固定欄位立刻捉襟見肘——偵探小說需要追蹤「線索」與「嫌疑」,奇幻小說需要追蹤「魔力值」與「陣營忠誠」,不可能用同一套欄位打天下。

由香港科技大學、LIGHTSPEED 與華中科技大學團隊提出的 EvolvingWorld,正是針對這兩個痛點而設計:一套「開放式schema」框架,讓角色與世界的狀態描述可以隨著不同文學世界自由定義,同時把整個模擬過程建模成一個長時序(long-horizon)的、角色與世界「共同演化」(co-evolution)的持續過程。

方法

EvolvingWorld 的架構由兩個耦合模組構成:

Character Agent(角色代理):負責多角色的對話演出,以及角色檔案(profile)的持續演化。它不只是照著固定人設回話,還內建「隱藏追蹤器」(hidden trackers),用來捕捉那些還不足以觸發正式檔案更新的「弱訊號」(例如角色對某人萌生一絲懷疑,但還沒到「信任崩潰」的程度),等訊號累積夠了才顯式地更新角色檔案。這種設計讓角色的成長弧線不必侷限在預先定義好的欄位裡。

World Model(世界模型):基於 LLM,負責維護「全域狀態」(例如整體局勢、陣營關係)與「地點/實體層級狀態」(例如某個房間裡的物品是否被搬走,某座城市的守備是否加強),並推進場景演進。

基於這套架構,團隊把整個模擬流程拆解成 7 個可訓練任務,涵蓋三大階段:

  • 場景初始化:scene_cast(選角)、location_scenario(地點與情境設定)
  • 互動生成:motivation_update(動機更新)、next_character(決定下一位發言角色)、interaction_gen(生成互動內容)
  • 狀態更新:world_update(世界狀態更新)、character_update(角色狀態更新)

為了訓練與評測這套系統,團隊從 Project Gutenberg 上挑選 57 本按時間順序敘事的公版書籍,萃取出 9,763 個場景、132,800 次互動、3,311 個獨立角色與 1,888 個地點,並整理出 581 種角色維度與 136 種世界狀態維度的開放式schema描述。最終產出 138,596 筆監督訓練樣本222 個測試快照(其中 116 個為 in-domain、106 個為 out-of-domain,用來檢驗泛化能力)。

微調採用 LoRA(rank 64、alpha 128),學習率 2×10⁻⁵,序列長度拉到 32,768 tokens 以容納長時序上下文,有效 batch size 為 64,並以 1:1 比例混入 Tulu3 通用指令資料以避免過擬合角色扮演任務而喪失指令遵循能力。

評測方面,團隊設計了一套trajectory-level(軌跡層級)LLM-as-Judge 評估協定,涵蓋 10 個維度、20 個指標,採 0–100 分制。角色面向包括 Profile Fidelity(人設保真度)、Speaking Style Fidelity(口吻一致性)、Motivation-Driven Behavior(動機驅動行為)、Profile Update Fidelity/Smoothness(檔案更新的準確性與平滑度)、Environment Awareness/Utilization(環境感知與運用)等 11 項指標;世界面向則包括 Cast Selection Rationality(選角合理性)、Scene Continuity & Coherence(場景連貫性)、Global/Location State Accuracy(全域/地點狀態準確度)等 9 項指標。

實驗結果

團隊在超過 20 個模型上做了大規模比較,涵蓋閉源模型如 Claude-4.6-Opus、Claude-4.6-Sonnet、GPT-5.3-Chat、GPT-5-Chat、GPT-4o、Gemini-3.1-Pro、Gemini-2.5-Pro/Flash、Kimi-K2.5,以及開源模型如 Qwen(4B/7B/14B/32B)、Llama(8B/70B)、Mistral-Small、DeepSeek-V3。

閉源模型中表現最好的是 Claude-4.6-Opus,角色維度平均分 94.97、世界維度平均分 77.76,明顯領先第二名 GPT-5.3-Chat(角色 85.36、世界 72.61)與 Gemini-2.5-Pro(角色 85.20、世界 71.07)。這顯示即便是最強模型,「世界狀態維護」仍比「角色扮演」難得多——分數落差接近 20 分。

在開源陣營中,經過 EvolvingWorld 資料微調後的 Qwen-32B 表現最佳,角色維度 57.06、世界維度 59.87,雖然距離頂級閉源模型仍有一段差距,但相較未經微調的基礎模型有明顯提升。

更關鍵的對照實驗是與既有基準系統 BookWorld 的比較:以 Gemini-3.1-Pro 為底座,採用 EvolvingWorld 框架後,角色維度分數從 70.83 提升到 81.94(提升 11.11 分),世界維度分數從 70.83 提升到 72.95。這個提升幅度在所有測試的底座模型上都一致出現,證明開放式schema加上顯式的角色/世界更新機制確實有效。

另一個值得注意的發現是「長時序穩定性」:在 BookWorld 這類舊框架下,隨著模擬場景數增加,Profile Evolution Smoothness(角色演化的平滑度)會逐漸劣化——角色越模擬越「走鐘」。而在 EvolvingWorld 框架下,這項指標反而隨著軌跡拉長而改善,顯示隱藏追蹤器與顯式狀態更新機制確實能有效抑制長期漂移問題。

意義

EvolvingWorld 的價值不只在於刷新了一個新benchmark的分數,而在於它示範了一種思路轉變:互動式敘事模擬不該被當成「一次性生成」或「固定人設扮演」,而應該被建模成一個持續累積狀態、角色與環境相互塑造的動態系統。這對於AI陪伴應用、互動小說引擎、乃至遊戲NPC設計都有直接參考價值——角色記得住過去發生的事,世界也會因玩家/使用者的行動留下持續影響,而不是每輪對話都從零開始。

「開放式schema」的設計思路也值得其他領域借鏡:與其為每個應用場景手工設計固定資料結構,不如讓LLM在模擬過程中自行生成、擴充所需的狀態維度描述,這樣更容易泛化到千變萬化的敘事世界(本論文光是從57本書就萃取出581種角色維度與136種世界狀態維度,足見固定schema有多不切實際)。

不過作者也坦承幾項限制:目前的世界模型是「全知視角」,尚未處理不同角色主觀認知差異這種更複雜的情況;上下文長度限制了對大量實體的精細追蹤;而且評測資料全部來自公版古典小說,尚未驗證在現代小說或其他非文學領域(例如遊戲劇本、劇本殺)的適用性。整體而言,這篇論文提供了一個扎實的資料集、任務拆解方式與評測協定,為「角色與世界共同演化」這個尚屬新興的研究方向打下了可複現的基礎設施。

DeepSearch-World:用可驗證環境讓搜尋代理人自我進化

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

HKUSTXinyu Geng、Xuanhua He、Sixiang Chen、Yanjing Xiao、Fan Zhang、Shijue Huang、Haitao Mi、Zhenwen Liang72Hugging FacearXiv
AI agentself-distillationweb searchLLMbenchmark

背景

近年來,能自主上網搜尋、閱讀網頁、串連多步推理來回答複雜問題的「深度搜尋代理人」(deep search agent)成為 AI 領域的熱門方向。這類代理人需要具備長時間、多輪次(long-horizon)的工具使用能力——先搜尋、再判讀網頁內容、再決定下一步搜尋方向,反覆進行直到湊齊足夠證據回答問題。

然而訓練這類代理人一直存在兩難:

  1. 監督式微調(SFT):通常依賴由更強大的「教師模型」(teacher model)蒸餾出的固定軌跡(trajectory)。這代表學生模型的能力上限被教師模型鎖死,而且教師產生的軌跡往往缺乏多樣性,難以涵蓋真實世界中各種失敗與修正的情境。
  2. 稀疏獎勵強化學習(sparse-reward RL):對於需要十幾步甚至更多步驟才能拿到獎勵訊號的長鏈任務,獎勵訊號太稀疏,模型很難得知「哪一步做對、哪一步做錯」,訓練訊號非常弱。

換句話說,想讓代理人「從自己的經驗中變強」(self-evolving),既不能單靠模仿別人,也不能單靠終局才給一次分數的強化學習。這篇論文的作者(來自 HKUST 團隊,Xinyu Geng、Xuanhua He 等人共同掛名)提出了一個解法核心概念:如果環境本身是「確定性且可驗證的」(deterministic and verifiable),就能一步步核對代理人的每個行動是否正確,從而產生高品質、可自我生成的訓練訊號,不需要依賴更強的教師模型。

方法

論文提出兩個互相搭配的元件:DeepSearch-World 環境與 DeepSearch-Evolve 訓練框架。

DeepSearch-World 環境是一個確定性、可重現的模擬世界,內建可重複執行的搜尋(search)與網頁閱讀(page-reading)工具——也就是說,同樣的查詢永遠會得到一致、可驗證的結果,不像真實網路搜尋結果會隨時間變動,這讓訓練過程可以精確判斷代理人每一步的正確性。環境中包含 42 萬筆(420K)多跳問答任務(multi-hop QA),這些任務並非人工標註,而是透過「實體層級的隨機遊走」(entity-level random walk)自動建構——即在知識圖譜式的實體關聯鏈上隨機遊走,產生需要跨越多個實體、多次查證才能解答的問題,同時自動保留每一步的正確答案路徑作為可驗證的 ground truth。這個環境特別設計來支援幾種對「自我進化」至關重要的認知行為:進度驗證(progress verification,確認目前蒐集的證據是否足夠回答問題)、有根據的反思(grounded reflection,依據實際檢索結果修正思路而非憑空想像)、以及失敗恢復(failure recovery,搜尋走錯路後懂得回頭換方向)。

DeepSearch-Evolve 則是建立在此環境上的自我蒸餾(self-distillation)訓練迴圈,不依賴任何比自己更強的教師模型,反覆執行以下四步驟:

  1. 軌跡生成(trajectory generation):讓當前版本的代理人在 DeepSearch-World 環境中實際執行任務,產生大量搜尋—閱讀—推理的完整互動軌跡。
  2. 過濾(filtering):利用環境的可驗證性,自動判斷哪些軌跡最終得到正確答案、過程合理,篩掉品質差或走偏的軌跡。
  3. 資料混合(data mixing):將篩選後的高品質軌跡與既有訓練資料按一定比例混合,避免模型過度擬合單一批次資料或發生災難性遺忘。
  4. 微調(fine-tuning):用混合後的資料集對代理人模型進行下一輪微調。

如此反覆迭代,代理人等於是「用自己跑出來的最佳表現去教下一代的自己」,隨著迭代輪數增加持續進步,而不需要外部更強模型的蒸餾資料,這也是論文標題「self-distillation」的核心含義。最終訓練出的模型稱為 DeepSearch-World-9B,是一個 90 億參數量級的代理人模型。

實驗結果

論文在三個具代表性的深度搜尋/多跳問答 benchmark 上評估 DeepSearch-World-9B,且強調「未經過更強模型蒸餾」(without distillation from more capable models)這一前提:

  • BrowseComp(高難度、需要大量網頁瀏覽與比對的真實世界搜尋任務):31.2%
  • GAIA(涵蓋多模態、多工具、通用助理能力的高難度 benchmark):61.5%
  • HotpotQA(經典多跳問答 benchmark,需要跨兩篇以上文件推理):93.4%

論文指出,這樣的表現「與開源代理人相比具有競爭力」(competitive performance compared with open-source agents),意味著在完全不借助更強教師模型蒸餾的情況下,單靠 DeepSearch-World 環境提供的可驗證訓練訊號,9B 規模的模型就能追上甚至部分超越依賴教師蒸餾的同類開源系統。尤其在 HotpotQA 上高達 93.4% 的準確率,顯示模型在標準多跳問答任務上已相當成熟;而在難度更高、更貼近真實開放式網路搜尋情境的 BrowseComp(31.2%)與綜合任務型的 GAIA(61.5%)上,也達到可觀水準,說明訓練出的「進度驗證」「有根據反思」「失敗恢復」等能力確實能遷移到分佈外(out-of-distribution)、更接近真實使用場景的任務上。

作者也計畫釋出完整的環境程式碼、42 萬筆訓練資料池、驗證集、訓練好的模型權重與訓練程式碼,方便社群直接複現與延伸研究。

意義

這篇論文的核心貢獻,不只是又訓練出一個更強的搜尋代理人,而是提出了一條「不靠更強教師模型也能持續變強」的可行路徑。過去業界訓練 agent 常見的兩條路——用大模型蒸餾小模型,或用稀疏獎勵做 RL——分別受限於「上限被教師鎖死」和「長鏈任務訊號太弱難以收斂」。DeepSearch-World 透過把環境設計成確定性、可驗證的形式,巧妙地把「該給多少獎勵」這個難題,轉化為「軌跡是否可被驗證為正確」的相對簡單判斷,讓自我蒸餾迴圈得以穩定運作並持續迭代進步。

對開發長時程 agent(不論是搜尋、程式碼、自動化操作等領域)的研究者而言,這提供了一個可推廣的思路:與其花大量精力去標註人類示範軌跡,或設計複雜的獎勵模型,不如優先思考「能否把任務環境變得可驗證」。一旦環境可驗證,自我生成、自我篩選、自我訓練的迴圈就能取代對外部更強模型或大量人工標註的依賴,大幅降低訓練成本、同時保留持續擴展(scalable)的空間——正如論文所強調的「verifiable environments enable scalable self-evolution」。

此外,42 萬筆自動生成、無需人工標註的多跳問答資料池,加上即將開源的環境、模型與程式碼,也為社群提供了低門檻的研究起點,有機會催生更多針對「自我進化型 agent」的後續工作,例如將此方法擴展到更大模型規模、更多工具種類(如程式碼執行、資料庫查詢),或結合強化學習訊號做混合訓練,是值得持續關注的方向。