VideoChat3:4B參數如何全開源打敗更大模型的影片理解戰爭
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
背景
影片理解是多模態大模型(MLLM)裡公認最難啃的骨頭之一:一段影片除了空間資訊,還多了時間軸,模型得同時處理「動作是什麼」「發生多久」「現在講到哪」這幾層問題。近年學界把這個賽道拆成三塊——動作辨識、長影片理解、以及即時串流互動(edge case 是模型要邊看直播邊即時回答問題)。問題是,現有開源模型往往只在其中一塊表現不錯,換個場景就掉鏈子;而且不少所謂「開源」模型其實只放出權重,訓練程式碼、訓練策略、資料集全部藏起來,別人根本沒辦法複現或在其上做研究,對社群發展是很大的阻礙。另外,影片輸入的計算成本極高——一段長影片抽出的視覺 token 數量動輒是純文字的幾十倍,這讓很多模型在效率與泛化能力之間必須妥協。
上海 AI Lab 等機構聯合團隊(27 位作者,以 Zhiqiu Zhang 為聯絡人)提出的 VideoChat3,目標就是同時解決這三個問題:做一個「真開源」(訓練程式碼、策略、資料集全公開)、僅 4B 參數、卻能橫跨一般影片、長影片、串流影片三種場景都打得贏更大模型的通才(generalist)影片 MLLM。arXiv 編號為 2607.14935。
方法
VideoChat3 的核心是兩項互補設計。
第一是 I3D-ViT(Inflated 3D Vision Transformer)。傳統做法是把 2D 圖片 tokenizer 直接套用在每一影格上,再靠抽幀節省算力,但這樣容易丟失影格之間的動態資訊。I3D-ViT 改把預訓練圖片 tokenizer(初始化自 MoonViT)的 2D 空間自注意力「膨脹」成 3D 時空注意力:先把連續影格分組(預設每組 T=4 幀),在組內做時空自注意力做局部建模,再做時間池化壓縮輸出。結合空間 2×2 合併後,整體可達到約 16 倍的時空壓縮率,大幅減少影片輸入在訓練與推論階段要處理的 token 數。
第二是串流場景的自適應影格解析度(Adaptive Frame Resolution)。這是針對即時互動設計的:模型會依照畫面重要程度動態切換三種狀態——「靜默(Silence)」時只用 224×224 低解析度做低成本監看;偵測到潛在事件時進入「待命(Standby)」,把解析度拉高到 448×448 仔細檢視;真正該回應時才產生「回應(Response)」輸出。這種分層機制讓模型平時省算力,但關鍵時刻仍能看清細節。
效果的另一半來自資料。團隊打造了可規模化的影片資料合成管線,產出三組資料集:VideoChat3-Academic2M(227萬筆,整合 LLaVA-Video、Spoken-MIT、Vript 等六個學術來源,並用 Qwen3-VL-235B 重新生成更密集的標註、加上一致性過濾);VideoChat3-LV116K(11.62萬筆長影片資料,平均長度從一般資料的3-59秒拉長到156秒至約1300秒,經過篩選、時間分段、片段標註、品質控管四階段管線,專門訓練時間定位與跨片段推理);VideoChat3-OL617K(61.7萬筆串流互動資料,分成40個 JSONL shard,把一般影片問答轉換成帶有 Silence/Standby/Response 狀態標記的線上回應監督訊號)。訓練採四階段課程:視覺 tokenizer 預訓練(759萬樣本)、影片-語言對齊(347萬)、影片指令微調(1033萬樣本、約500億 token)、長影片與串流指令微調(341萬樣本、約100億 token)。
實驗結果
在僅 4B 參數的規模下,VideoChat3 在多項 benchmark 上超越同級甚至更大參數量的開源模型,也逼近部分閉源模型。一般影片理解方面:MotionBench 拿下 61.7 分(對比 Qwen3-VL-4B 的58.6)、TempCompass 75.6 分(對比 70.8)、Video-MME 70.1 分(對比69.3)、LVBench 56.7 分(對比 56.2)。時間定位任務更是拉開明顯差距:Charades 達 56.1 mIoU(+9.7)、ActivityNet 54.6 mIoU(+6.4)、QVHighlights 67.0 mIoU(+8.3),而在難度更高的 VUE-TR v1/v2 與 MomentSeeker 上,分別領先對手 15.0、20.6、12.1 分之多。
串流理解場景同樣全面領先:ODVBench 72.3 分(次佳的 StreamForest 為59.9)、OVO-Timing F1 35.5(次佳 Em-Garde 31.0)、StreamingBench 83.0 分(次佳 TimeChat-Online 為75.4)、River 42.8 分(次佳 Qwen3-VL-4B 為 37.8)。
效率方面,在 NVIDIA H200 上處理 256 幀輸入時,視覺 token 數僅 12,544,較 Qwen3-VL 的 25,088 少了一半;處理 2048 幀長影片時,總延遲僅 20.4 秒,對比對手的 44.4 秒快了 54%,同時省下超過 26GB 顯存,FLOPs 降幅超過六成。
意義
VideoChat3 的價值不只是刷榜,而是示範了「小模型也能通才」這件事在影片理解上是可行的——關鍵不在堆參數量,而在架構層面提早做時空壓縮(而非單靠抽幀犧牲時間解析度),以及用高品質、針對不同場景設計的合成資料彌補標註不足的問題。對於串流場景導入的 Silence/Standby/Response 狀態機制,也為「模型該在什麼時候開口說話」這個長期困擾即時互動系統的問題,提供了一個具體、可訓練的解法。
更重要的是,團隊承諾釋出完整訓練程式碼、訓練策略與三個資料集,這對社群而言意義重大:研究者不必再從零猜測別家模型怎麼訓練出來的,而可以直接在這套公開的資料合成管線與訓練課程之上做延伸實驗,加速整個開源影片 MLLM 生態的迭代速度。以 4B 參數就能打贏同級甚至更大的模型,也讓在消費級或邊緣裝置上部署即時影片理解應用變得更務實可行。