← 目錄

K1 論文詳解

2026-07-18


VideoChat3:4B參數如何全開源打敗更大模型的影片理解戰爭

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

Multimedia Computing Group-Nanjing UniversityXinhao Li、Yuhan Zhu、Xiangyu Zeng、Yuhao Dong、Haoning Wu、Zhiqiu Zhang、Yuandong Yang、Changlian Ma108Hugging FacearXiv
影片理解多模態大模型開源模型串流視覺長影片理解

背景

影片理解是多模態大模型(MLLM)裡公認最難啃的骨頭之一:一段影片除了空間資訊,還多了時間軸,模型得同時處理「動作是什麼」「發生多久」「現在講到哪」這幾層問題。近年學界把這個賽道拆成三塊——動作辨識、長影片理解、以及即時串流互動(edge case 是模型要邊看直播邊即時回答問題)。問題是,現有開源模型往往只在其中一塊表現不錯,換個場景就掉鏈子;而且不少所謂「開源」模型其實只放出權重,訓練程式碼、訓練策略、資料集全部藏起來,別人根本沒辦法複現或在其上做研究,對社群發展是很大的阻礙。另外,影片輸入的計算成本極高——一段長影片抽出的視覺 token 數量動輒是純文字的幾十倍,這讓很多模型在效率與泛化能力之間必須妥協。

上海 AI Lab 等機構聯合團隊(27 位作者,以 Zhiqiu Zhang 為聯絡人)提出的 VideoChat3,目標就是同時解決這三個問題:做一個「真開源」(訓練程式碼、策略、資料集全公開)、僅 4B 參數、卻能橫跨一般影片、長影片、串流影片三種場景都打得贏更大模型的通才(generalist)影片 MLLM。arXiv 編號為 2607.14935。

方法

VideoChat3 的核心是兩項互補設計。

第一是 I3D-ViT(Inflated 3D Vision Transformer)。傳統做法是把 2D 圖片 tokenizer 直接套用在每一影格上,再靠抽幀節省算力,但這樣容易丟失影格之間的動態資訊。I3D-ViT 改把預訓練圖片 tokenizer(初始化自 MoonViT)的 2D 空間自注意力「膨脹」成 3D 時空注意力:先把連續影格分組(預設每組 T=4 幀),在組內做時空自注意力做局部建模,再做時間池化壓縮輸出。結合空間 2×2 合併後,整體可達到約 16 倍的時空壓縮率,大幅減少影片輸入在訓練與推論階段要處理的 token 數。

第二是串流場景的自適應影格解析度(Adaptive Frame Resolution)。這是針對即時互動設計的:模型會依照畫面重要程度動態切換三種狀態——「靜默(Silence)」時只用 224×224 低解析度做低成本監看;偵測到潛在事件時進入「待命(Standby)」,把解析度拉高到 448×448 仔細檢視;真正該回應時才產生「回應(Response)」輸出。這種分層機制讓模型平時省算力,但關鍵時刻仍能看清細節。

效果的另一半來自資料。團隊打造了可規模化的影片資料合成管線,產出三組資料集:VideoChat3-Academic2M(227萬筆,整合 LLaVA-Video、Spoken-MIT、Vript 等六個學術來源,並用 Qwen3-VL-235B 重新生成更密集的標註、加上一致性過濾);VideoChat3-LV116K(11.62萬筆長影片資料,平均長度從一般資料的3-59秒拉長到156秒至約1300秒,經過篩選、時間分段、片段標註、品質控管四階段管線,專門訓練時間定位與跨片段推理);VideoChat3-OL617K(61.7萬筆串流互動資料,分成40個 JSONL shard,把一般影片問答轉換成帶有 Silence/Standby/Response 狀態標記的線上回應監督訊號)。訓練採四階段課程:視覺 tokenizer 預訓練(759萬樣本)、影片-語言對齊(347萬)、影片指令微調(1033萬樣本、約500億 token)、長影片與串流指令微調(341萬樣本、約100億 token)。

實驗結果

在僅 4B 參數的規模下,VideoChat3 在多項 benchmark 上超越同級甚至更大參數量的開源模型,也逼近部分閉源模型。一般影片理解方面:MotionBench 拿下 61.7 分(對比 Qwen3-VL-4B 的58.6)、TempCompass 75.6 分(對比 70.8)、Video-MME 70.1 分(對比69.3)、LVBench 56.7 分(對比 56.2)。時間定位任務更是拉開明顯差距:Charades 達 56.1 mIoU(+9.7)、ActivityNet 54.6 mIoU(+6.4)、QVHighlights 67.0 mIoU(+8.3),而在難度更高的 VUE-TR v1/v2 與 MomentSeeker 上,分別領先對手 15.0、20.6、12.1 分之多。

串流理解場景同樣全面領先:ODVBench 72.3 分(次佳的 StreamForest 為59.9)、OVO-Timing F1 35.5(次佳 Em-Garde 31.0)、StreamingBench 83.0 分(次佳 TimeChat-Online 為75.4)、River 42.8 分(次佳 Qwen3-VL-4B 為 37.8)。

效率方面,在 NVIDIA H200 上處理 256 幀輸入時,視覺 token 數僅 12,544,較 Qwen3-VL 的 25,088 少了一半;處理 2048 幀長影片時,總延遲僅 20.4 秒,對比對手的 44.4 秒快了 54%,同時省下超過 26GB 顯存,FLOPs 降幅超過六成。

意義

VideoChat3 的價值不只是刷榜,而是示範了「小模型也能通才」這件事在影片理解上是可行的——關鍵不在堆參數量,而在架構層面提早做時空壓縮(而非單靠抽幀犧牲時間解析度),以及用高品質、針對不同場景設計的合成資料彌補標註不足的問題。對於串流場景導入的 Silence/Standby/Response 狀態機制,也為「模型該在什麼時候開口說話」這個長期困擾即時互動系統的問題,提供了一個具體、可訓練的解法。

更重要的是,團隊承諾釋出完整訓練程式碼、訓練策略與三個資料集,這對社群而言意義重大:研究者不必再從零猜測別家模型怎麼訓練出來的,而可以直接在這套公開的資料合成管線與訓練課程之上做延伸實驗,加速整個開源影片 MLLM 生態的迭代速度。以 4B 參數就能打贏同級甚至更大的模型,也讓在消費級或邊緣裝置上部署即時影片理解應用變得更務實可行。

Ring-Zero:把 Zero RL 推向兆級參數,湧現出會「自我懷疑」的推理模型

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

inclusionAIXinyu Tang、Gangqiang Cao、Yurou Liu、Yuliang Zhan、Xiaochong Lan、Yifan Li、Yuchen Yan、Han Peng84Hugging FacearXiv
LLM強化學習Zero RL大型模型推理能力

背景

過去一年,「zero RL」成為激發大型語言模型 chain-of-thought(CoT)推理能力的顯學:不用人工標註的推理過程,只靠可驗證的獎勵訊號(例如數學題答案對不對),透過強化學習讓模型自己「悟」出推理策略。DeepSeek-R1 系列已經證明這條路可行,但受限於算力,幾乎所有相關研究都停留在數十億到百億參數等級的模型上,沒人真正驗證過:如果把 zero RL 推到「兆」(trillion)參數規模,會發生什麼事?

這正是螞蟻集團(Ling/Ring 系列模型背後團隊,論文顯示與 GSAI 相關)這篇論文想回答的問題。他們選擇以 Ling-2.5 作為底座,訓練出兩個對照組:參數量達 1 兆(激活參數 630 億)的 Ring-2.5-1T-Zero,以及參數量 1040 億(激活參數 74 億)的 Ring-2.5-flash-Zero,藉此觀察「純粹放大規模」對 zero RL 訓練動態與模型行為的影響。

作者一開始就發現,單純把模型做大並不會自動變好——naive scaling 反而會帶來三個副作用:推理過程可讀性差、token 冗餘嚴重(講廢話講很長)、以及推理深度不會隨題目難度自適應調整(簡單題也長篇大論,難題卻可能想得不夠)。這篇論文的核心貢獻,就是提出一套穩定且高效的訓練管線來克服這些問題,並藉由觀察兆級模型的訓練歷程,驗證 Richard Sutton 著名的「苦澀的教訓」(bitter lesson):堆算力、堆規模,終究會超越人工設計的啟發式技巧。

方法

整個訓練分成四個階段,在 320 張 H200 GPU 上進行,結合 Megatron(訓練)與 SGLang(推理 rollout),由 Areal 框架調度:

第一階段(推理誘發期):採用 token 級別的損失函數,搭配 KL 懲罰項(β=10⁻⁴)防止模型崩壞,參考模型每 400 步更新一次。上下文長度採漸進式擴展,從 4k token 開始,每 800 步翻倍,最終擴展到 64k。

自我蒸餾(壓縮穩定期):用第一階段產出的高品質推理軌跡,對基礎模型進行 3 個 epoch 的微調(學習率 7×10⁻⁵,序列長度 64k),並做「長度精煉」——挑選同一問題中最短的正確推理軌跡,過濾掉冗餘內容,藉此把模型的推理風格「校準」到簡潔且可讀。

第二階段(持續優化期):改用樣本級別損失(依序列長度正規化),拿掉 KL 懲罰,同時保留「裁剪重要性採樣」(clipped importance sampling)——這是論文重點技巧之一,只對重要性比率(importance ratio)做 stop-gradient 處理,並設定裁剪上界 ε_high=5.0,避免異常大的梯度更新破壞訓練穩定性。

第三階段(自適應推理深度):引入「分級訓練」(tier-based training),把推理長度分成 Low(4k)、Medium(16k)、High(64k)三個檔位,搭配不同系統提示詞,讓模型學會依題目難度自己選擇該想多久。

系統層面上,論文也做了不少工程優化,包括「訓練-推理比率校正」(讓 Megatron 訓練端與 SGLang 推理端的 logits 對齊,避免精度落差累積誤差)、混合精度控制(模型主體用 BF16,但 attention softmax 與 LM head 用 FP32 保精度),以及針對 MLA 層用 all-to-all、Lightning Attention 層用 AllGather 的上下文並行優化,這些都是撐起兆級參數穩定訓練不可或缺的細節。

超參數方面:batch size 從 512 逐步調整到 256,minibatch size 32,Adam 優化器(β₁=0.9, β₂=0.999),學習率固定 2×10⁻⁶,每題採樣 G=16 條 rollout,推理時溫度 0.6、top-k 0.95。

實驗結果

在七個數學 benchmark 上,Ring-2.5-1T-Zero 的第二階段 RL 結果相當亮眼:AIME 2024 達 93.5%、AIME 2025 為 91.6%、AIME 2026 為 92.5%,HMMT 2025年2月 87.4%、2025年11月 87.1%、2026年2月 78.1%,IMOAnswerBench 則是 72.7%。進入支援 128k 上下文的「High 模式」第三階段後,AIME 2024/2025/2026 分別微調至 93.2%、91.0%、91.4%,顯示長上下文推理模式在維持高分同時兼顧了效率。

最關鍵的發現是規模效應:1 兆參數的 Ring-2.5-1T-Zero 相較 1040 億參數的 Ring-2.5-flash-Zero,展現出「顯著更優的樣本效率」——也就是說,用同樣多的訓練樣本,大模型學得更快、且最終能達到的效能天花板也更高。論文透過 pass@1024(採樣 1024 次中至少一次答對的機率)與 pass@1 的變化曲線,劃分出訓練的兩個階段:早期是「探索期」(discovery phase),pass@1024 持續上升,代表模型在探索新解法;後期則進入「銳化期」(sharpening phase),pass@1024 趨於平緩,但 pass@1 仍持續提升,代表模型把已經探索到的正確解法,內化成更穩定、更常被採用的預設策略。

在 CoT 品質的三維評估框架上,Ring-2.5-1T-Zero 同樣表現突出:在「可理解性」(comprehensibility)的 LLM-as-a-Judge 兩兩比較中取得明顯勝率優勢;在「可複現性」(reproducibility)上,只用 10 萬筆蒸餾樣本,在 Qwen-32B 上就比 DeepSeek-R1 用 80 萬筆樣本蒸餾的效果還高出 5.8 分,在 Llama-70B 上高出 4.5 分;在「效率」(efficiency)上,平均推理 token 數僅 6,368 個,不到對照 baseline 的一半。消融實驗也證實了各項設計的必要性:例如拿掉格式獎勵(format reward)會導致推理長度失控增長卻沒有對應的分數提升;拿掉 KL 懲罰則會讓 log-probability 落差發散、熵崩潰、獎勵曲線崩盤。

意義

這篇論文最有意思的地方,不是刷新了幾個 benchmark 分數,而是記錄了模型在兆級參數規模下「自己想出來」的一系列認知行為,完全沒有經過人工設計或提示引導:模型會出現「擬人化」表現(在推理軌跡中模擬沮喪、偷懶、自我誇獎等情緒化語言)、自發採用結構化格式(自己編號步驟、劃分階段)、主動做自我驗證(檢查中間推導是否正確)、在單一次生成內做平行推理(類似 tree-of-thought 的多路徑探索),以及「情境焦慮」——當接近 token 長度上限時,模型會表現出策略性的「趕進度」行為。

這些湧現行為之所以重要,是因為它們原本都是研究者透過人工設計 prompt 或訓練技巧才能勉強誘導出來的能力,而在 1 兆參數規模下,模型是自發演化出這些行為的,這正是「bitter lesson」的具體例證:與其花心思設計精巧的啟發式規則,不如把算力和規模做上去,能力自然湧現。

對整個領域的意義在於三點:第一,它證明了 zero RL 這條路徑在超大規模下依然有效甚至更有效,樣本效率與效能天花板都隨規模提升,打消了「zero RL 只在小模型上好用」的疑慮;第二,它提出了一套實用的兆級穩定訓練配方(裁剪重要性採樣、訓練推理比率校正、混合精度控制、分級自適應推理深度),為後續想做超大規模 RL 訓練的團隊提供了可複製的工程藍圖;第三,提出的三維 CoT 評估框架(可理解性、可複現性、效率)彌補了目前業界只看最終答案正確率、忽略推理過程品質的評測盲點,對於想要蒸餾、複用大模型推理能力的下游應用尤其實用。當然,論文也坦承限制仍在,包括長尾資料分布、64k 上下文的容量瓶頸、以及預訓練知識邊界對 RL 探索空間的限制,這些都指向了下一步規模化與資料策略的研究方向。

SEED:讓語言模型代理人「事後複盤」自我進化的強化學習新框架

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Jinyang Wu、Shuo Yang、Zhengxi Lu、Fan Zhang、Yuhao Shen、Lang Feng、Haoran Luo、Zheng Lian69Hugging FacearXiv
LLM Agent強化學習知識蒸餾RLHFBenchmark

背景

近年來,大型語言模型(LLM)被越來越多地訓練成能執行「長時程任務」的互動式代理人(agent)——例如多輪對話、呼叫工具、根據環境回饋調整行動等。訓練這類代理人最常見的做法是「結果導向的強化學習」(outcome-based RL),也就是只看一整個任務軌跡(trajectory)最終是成功還是失敗,給予一個獎勵訊號,再用像 GRPO 這類演算法回傳更新策略。

問題在於,這種獎勵訊號非常「稀疏」——一整段可能包含幾十個決策步驟的軌跡,最終只換來一個 0 或 1 的分數。這導致「軌跡層級的結果」和「token 層級的策略學習」之間存在明顯的監督落差(supervision gap):模型很難知道究竟是哪一步做對了、哪一步做錯了,尤其是在中間的探索、觀察、試錯環節,幾乎得不到直接指導。

為了填補這個落差,SEED(SElf-Evolving on-policy Distillation)的作者提出:能不能讓模型「自己複盤」——把已經完成的軌跡,轉換成可重複使用的自然語言技能(hindsight skill),再把這些技能對行為的影響「蒸餾」回策略模型本身?這正是本篇論文的核心構想。

方法

SEED 的訓練分成兩個階段,整體思路是讓策略模型同時扮演「行動者」與「事後分析師」兩個角色,並讓兩者隨著訓練同步進化。

第一階段:Hindsight Skill SFT。 先用監督式微調(SFT)讓策略模型學會分析已完成的軌跡,並產出自然語言描述的「技能」——可能是可重複使用的工作流程(workflow)、關鍵的決定性觀察(decisive observation),或是避免失敗的規則(failure-avoidance rule)。這一階段用外部更強的模型(論文中使用 GLM 系列模型)協助產生高品質的技能標註資料,規模約為 180 個任務 × 8 次 rollout,共 1,440 條軌跡。

第二階段:Self-Evolving On-Policy Distillation(OPD)。 進入強化學習階段後,「目前這個策略模型」本身同時做兩件事:一是持續蒸餾樣本(rollout)收集新軌跡,二是充當分析師,從剛剛收集到的軌跡中提取 hindsight skill。關鍵設計是:策略每次更新後,「分析技能的能力」與「執行任務的能力」會一起被更新——這就是「自我進化」(self-evolving)的意義,讓事後監督訊號始終貼合當前策略的行為分佈,而不是用一個固定不變、逐漸過時的舊模型來分析。

再來是核心的蒸餾機制:SEED 把同一批已採樣的行動(action),分別在「一般情境」與「加入技能提示的情境」下重新計算機率(re-score)。兩者的 log-probability 差值 Δ(技能誘發的機率偏移量)會先做 stop-gradient 處理,再透過一個信心閾門(confidence gate,以 sigmoid 函數 g = σ(β_opd × Δ) 表示,β_opd 設為 5.0)轉換成一個 token 級的、密集的分佈式蒸餾訊號。這個訊號與結果導向的 RL 損失(係數 λ_opd 設為 0.01)一起聯合優化,使得原本只有軌跡層級的獎勵,能夠被拆解回每個 token 的決策上,做到更細緻的「credit assignment」(功勞歸屬)。整套方法在推論階段完全不需要額外提供技能提示,技能只在訓練時被用來塑造策略本身。

實驗涵蓋的骨幹模型包括 Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct、Qwen3-1.7B-Instruct,以及視覺-語言版本的 Qwen2.5-VL-3B-Instruct;RL 階段大約跑 150 次策略更新,batch size 在 16–128 之間,每組 rollout 數量 N=8,學習率為 1×10⁻⁶。

實驗結果

論文在文字型與視覺型的代理任務上都做了廣泛評測,並與 Vanilla prompting、Skill-Prompt、GRPO、Skill-GRPO、GRPO+OPSD、OPSD、Skill-SD、RLSD、SDAR 等多種基線方法比較。

ALFWorld(文字型具身任務)上,SEED 的提升最為顯著:Qwen2.5-3B 上從 GRPO 的 75.0% 提升到 91.8%(macro-average),提升幅度接近 17 個百分點;Qwen2.5-7B 上由 81.2% 提升到 96.1%;而在較小的 Qwen3-1.7B 上差距更懸殊,GRPO 只有 46.1%,SEED 則達到 92.0%,幾乎翻倍。

WebShop(網頁導航任務)上,Qwen2.5-3B 的成功率從 GRPO 的 63.3% 提升到 78.9%(綜合分數由 79.8 提升到 88.5);Qwen2.5-7B 則從 72.6% 提升到 78.1%。

在涵蓋 7 個資料集的 搜尋式問答(search-based QA)任務上,Qwen2.5-3B 的平均準確率由 36.4% 提升到 45.7%,Qwen2.5-7B 由 42.0% 提升到 48.6%。

在視覺型任務上,例如 Sokoban(推箱子)任務,成功率達到 82.0%,比 GRPO 高出 14.9 個百分點;紙牌遊戲 EZPoints 更達到 100.0% 的成功率,比 GRPO 高出 13.1 個百分點。

論文也做了消融實驗(以 ALFWorld、Qwen2.5-3B 為例):完整版 SEED 91.8%;去掉「Hindsight Skill SFT」階段掉到 86.0%(−5.8);去掉「Self-Evolving」機制(即技能分析師不隨策略更新)掉到 87.0%(−4.8);去掉「on-policy 技能」(即技能來源不是當前策略本身採樣的軌跡)掉到 84.4%(−7.4),是影響最大的因素,說明「分析師與行動者必須保持同步新鮮度」是整套框架能否發揮效果的關鍵。

此外,論文也驗證了樣本效率:只用 60% 的 ALFWorld 訓練資料,SEED 就能達到 80.7%,超過 GRPO 用 100% 資料訓練出的 75.0%。在泛化能力上,面對 ALFWorld 中未見過的任務,SEED 把 macro-average 從 70.9% 提升到 86.2%,提升 15.3 個百分點,顯示這套自我進化的技能監督機制並非單純記憶訓練分佈,而是真正學到可轉移的決策模式。

意義

SEED 提出的核心洞見,是把「事後複盤」這種人類常見的學習方式,系統化地嵌入到強化學習的訓練迴圈裡:讓同一個策略模型既是玩家,也是自己的教練,並且教練的能力隨著玩家的進步同步升級,而不是靠一個固定、逐漸過時的外部分析器。這解決了傳統 outcome-based RL 最大的痛點——獎勵訊號稀疏、無法定位到具體哪一步決策出了問題。

從實用角度看,SEED 的訊號完全來自訓練時的自我分析,推論階段不需要額外的技能提示,也不會拖慢部署後的推理速度,這對於希望在真實產品中部署代理人模型的團隊相當有吸引力。同時,它在小模型(如 1.7B)上帶來的提升尤其巨大,意味著這種方法有機會讓資源有限的團隊,用較小的模型達到接近大模型的代理人能力,是在算力與效果之間取得平衡的一個實際方向。

更廣義地說,SEED 展示了一種「監督訊號自產生」的範式——不依賴額外標註或更強大的外部教師模型,而是讓策略在強化學習過程中自己創造出更密集、更貼合自身行為分佈的訓練訊號。這種思路未來很可能被延伸到程式碼代理人、多模態代理人,甚至多智能體協作系統中,成為改善長時程任務訓練效率與泛化能力的通用工具。