← 目錄

K1 論文詳解

2026-07-16


SynthDocBench:用合成基準拆解視覺文件理解的失敗根源

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

ServiceNow-AIAbhigya Verma、Khyati Mahajan、Amit Kumar Saha、Shruthan Radhakrishna、Sagar Davasam、Vikas Yadav、Sai Rajeswar Mudumba53Hugging FacearXiv
VLM長文本理解Benchmark視覺文件理解多模態

背景

近年來 vision language models(VLM)在 DocVQA、ChartQA、MMLongBench-Doc 等視覺文件理解 benchmark 上表現亮眼,單頁文件的準確率常見於 85%~96% 之間,看起來已接近「解決」。但研究團隊指出一個根本問題:真實世界的文件同時混雜了長度、版面複雜度、模態組成(文字/圖表/表格)與問題難度等多個變因,一旦模型在某個 benchmark 上失分,幾乎無法判斷究竟是哪個因素造成的——是文件太長、圖表太密、還是問題本身太難?這種「多因素糾纏」讓現有 benchmark 難以真正診斷模型的長文本視覺理解能力,也讓研究者懷疑,現有的高分是否只是模型「過擬合」了特定 benchmark 的表面特徵(spurious correlation),而非真正具備穩健的長文本理解力。為了解決這個歸因問題,作者提出了 SynthDocBench:一個完全合成、可控制單一變因的長文本視覺文件理解基準。

方法

SynthDocBench 採用三階段生成流程。第一階段是內容生成:從主題種子擴展出語意骨架,並整理成能明確標示段落邊界與資料區塊的中間表示。第二階段是版面與視覺語法設計,系統定義了六種版面原型(雜誌、儀表板、學術論文、社論、資訊圖表、粗獸派),其中 60% 依主題條件選擇版面,40% 則完全隨機覆寫,目的是避免模型靠猜版面規律作弊、鑽 spurious correlation 的漏洞。第三階段是「雙層視覺化合成」:每張圖表同時存在一個用 D3.js 渲染的視覺畫面,以及一個記錄座標軸、資料點與洞見的結構化 metadata,確保 ground truth 完全確定,不需事後人工標註或 OCR 解析。

問題則分成三大類:圖表讀值(chart-reading)、跨模態推理(cross-modal,需同時讀取文字與圖表且證據不相鄰)、以及複雜多跳推理(complex multi-hop,證據需跨 2~4 個區塊組合,難度分五級 L1–L5)。所有問題經過數值重算、自動一致性過濾與人工複核三層驗證,標註者間一致性 κ=0.81,接受率 96%。

最終基準包含 200 份合成報告、共 1,788 題,平均每份文件 51.1 頁、20,568 字、16.7 張圖表,涵蓋 24 種圖表類型。評測時模型只能看到 144 DPI 的頁面截圖(以 5 頁為一組拼接成長條圖,不提供 HTML 原始碼或 OCR 文字),由 GPT-5 擔任裁判,以 0–10 分評分,取分數 ≥6 視為答對計算 ACC。

實驗結果

研究團隊評測了七個前沿 VLM(含 Gemini、GPT 系列、Claude-Sonnet-4.5、Qwen 系列與 InternVL3-78B 等)。整體 ACC 差距懸殊:表現最好的模型 overall ACC 約 0.725,而表現最差的模型僅 0.081,顯示長文本視覺理解遠未飽和。三個關鍵失敗模式浮現:第一,除少數模型外,幾乎所有模型隨難度從 L1 升到 L5 呈現單調下滑,某模型跌幅達 23 個百分點;第二,文件「中段」對五分之六的模型是最難的區段,五分之六模型呈現負向的 Early→Late 趨勢,最陡的下滑幅度達 8.3 個百分點,呼應長文本處理中著名的「lost-in-the-middle」現象;第三,圖表理解在長文件情境下明顯崩潰——同樣的模型在單獨圖表(如 ChartQA)上可達 85%~91%,但放進長文件後準確率大幅下滑。針對 109 個「所有模型都答錯」的困難案例分析,超過半數(58 例)集中在跨模態失誤,主要錯誤型態是「視覺幻覺」:模型給出看似合理卻與圖表實際數值不符的答案,尤其在資料密集圖表(如啞鈴圖、多序列比較圖)上更明顯。額外的 OCR 對照實驗顯示,若改用純文字 OCR 輸入,圖表題準確率反而下降(顯示像素級視覺解讀是瓶頸),但複雜多跳題準確率大幅提升,說明多跳推理的證據多可從文字還原,真正的瓶頸是視覺解碼而非推理本身。渲染長度的消融實驗也顯示,把單頁改成 5 頁甚至 10 頁一組輸入,跨模態題目的準確率明顯提升,證明適當的長上下文拼接反而有助於推理。與 MMLongBench-Doc 的排名相關性為 Spearman ρ=0.657,顯示兩者具互補而非完全重疊的診斷訊號。

意義

SynthDocBench 的核心貢獻在於用「組合式設計」把長度、版面、模態、難度這些糾纏的變因拆開,首次讓研究者能夠精確歸因模型在何種條件下失敗,而不是只看到一個籠統的低分數。研究結果也給整個領域一個警訊:模型在 DocVQA、ChartQA 等單頁 benchmark 上逼近飽和,很可能只是掌握了特定資料集的表面規律,而非真正具備穩健的長文本視覺推理能力;「lost-in-the-middle」式的位置偏誤與圖表理解在長文件中的崩潰,說明目前的多模態長上下文架構仍有結構性缺陷。對於實務應用(如財報、研究報告、法規文件的自動化理解)而言,這意味著在部署前必須用類似 SynthDocBench 這種可控合成資料做壓力測試,而不能只依賴現成 benchmark 分數。作者也坦承合成資料犧牲了部分生態效度(ecological validity),並提醒 D3.js 渲染風格可能與某些模型的訓練分佈較接近,構成潛在confound,未來需以不同渲染引擎驗證結論的穩健性。整體而言,這份工作為「診斷式」而非「排行榜式」的多模態評測提供了一個可複製的方法論範本。

讀圖如讀文:預訓練多模態大模型免訓練變身影像生成獎勵模型

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

ByteDance SeedRunhui Huang、Qihui Zhang、Zhe Liu、Yu Gao、Jie Wu、Hengshuang Zhao43Hugging FacearXiv
text-to-imageRLHFMLLMreward modeldiffusion

背景

近年文字生成圖像(text-to-image)模型愈來愈依賴強化學習(RL)來對齊使用者意圖,而 RL 的核心難題始終是「獎勵從哪裡來」。過去主流做法是找多模態大語言模型(MLLM)來當裁判:直接要求 MLLM 針對生成圖打分,或把 prompt 拆解成一連串是非題讓 MLLM 逐項驗證,再彙總成獎勵。這類方法有兩個先天問題:一是 MLLM 的「判斷/評分」能力其實不如它的「理解」能力可靠,容易產生偏誤或不穩定的評分;二是拆解式驗證依賴額外設計問題模板,對複雜構圖、隱含物理常識等場景覆蓋不全。另外,不少作法還需要蒐集偏好標註或對獎勵模型額外微調,成本高且難以泛化到新場景。這篇論文(arXiv 2607.11886,作者 Runhui Huang、Qihui Zhang、Zhe Liu、Yu Gao、Jie Wu、Hengshuang Zhao)提出的 SpectraReward,想解決的正是「如何不花一分訓練成本、直接把現成 MLLM 變成好用的獎勵模型」。

方法

SpectraReward 的核心想法很直觀:不讓 MLLM 去「評價」圖片好不好,而是讓它去做一件 MLLM 本來就擅長的事——「看圖說話」,具體來說是「看著生成的圖,把原始 prompt 重新念一遍」。技術上,把生成圖像當作條件輸入,對原始 prompt 做一次 teacher-forced 的前向傳播,計算 MLLM 在每個 token 上的條件對數機率(log-likelihood),再取全句平均作為獎勵值。如果生成圖確實忠實呈現了 prompt 描述的內容,MLLM 應該能「輕鬆」且高機率地重建出這段文字;反之,圖文不符的地方會在對應 token 上出現明顯的機率下降,形成一種逐 token 的「語義光譜(spectrum)」,可以精準定位圖片哪裡出錯(論文舉例:計數錯誤時,機率下降會集中在數字 token 上)。整個過程只需一次前向傳播,不需要額外標籤、不需要偏好資料、也不需要對 MLLM 做任何微調,直接複用其預訓練階段學到的圖文對齊能力。

在此基礎上,作者進一步提出 Self-SpectraReward,專門針對「統一多模態模型」(unified multimodal model, UMM,例如同時具備理解與生成分支的 BAGEL)。做法是讓策略模型自己的理解分支,直接扮演自己生成分支的獎勵模型,形成一個不依賴任何外部知識或外部獎勵模型的閉環自我提升系統。這樣做的關鍵優勢在於「分佈對齊」:理解分支與生成分支共享同一套 tokenizer、編碼器與預訓練資料分佈,獎勵訊號天然貼合策略模型自身的生成習慣,不會因為外部模型的評判標準與策略模型脫節而產生誤導性梯度。

實驗結果

作者做了相當大規模的驗證:2 個生成骨幹(BAGEL 這類 AR-Diffusion 統一模型,以及 SD3.5-M 純擴散模型)、3 種 RL 演算法(AWM、FlowGRPO、DiffusionNFT)、來自 4 個模型家族、參數量從 4B 到 235B 的 9 個 MLLM 獎勵骨幹(包括 Qwen3-VL 的 8B/30B/235B、Gemma3 的 4B/12B、InternVL3.5 的 8B/14B,以及 BAGEL 自身理解分支),並在 5 個分佈外(OOD)benchmark 上評測,包括 GenEval、TIIF-Bench、DPG-Bench、GenEval2、WISE。訓練在 512×512 解析度、32 張 A100、380 訓練步、batch size 2 的設定下完成。

結果顯示,SpectraReward 與 Self-SpectraReward 都能穩定且顯著提升生成效果,並優於先前以 MLLM 為基礎的獎勵訓練方法。以 Self-SpectraReward 相較 BAGEL 基線為例:TIIF-Bench 短/長 prompt 分別提升 10.0 與 6.2 分,GenEval 提升 5.5,GenEval2 提升 5.5,WISE(搭配 CoT)也有小幅提升。若與另一個對照方法 AlphaGRPO 比較,SpectraReward 在 TIIF 短/長上領先 6.3/5.3,GenEval 領先 3.3;Self-SpectraReward 則領先 6.2/4.8 與 4.5。更有意思的發現是「獎勵模型並非越大越好」:9 個骨幹中表現最好的外部模型是 30B 規模的 Qwen3-VL-30B-A3B,而參數量更大的 235B 版本反而出現效能下滑,呈現非單調的規模效應;與此同時,不依賴外部模型的 Self-SpectraReward 卻能追平甚至超越這些遠比自己大的外部獎勵模型。另外,作者也發現「預訓練階段的圖說模型」(如 Gemma3-12B-Pretrain)比同尺寸的指令微調版本更適合當獎勵模型,暗示大規模圖說式預訓練學到的圖文對齊能力,比多任務指令微調更貼合這個獎勵函數的需求。

意義

這篇論文的價值不只是提出一個更省成本的獎勵函數,更重要的是提出並驗證了一個新觀點:在 MLLM 當裁判的 RL 訓練裡,「獎勵模型與策略模型之間的分佈對齊程度」可能比「獎勵模型本身有多強大、參數量有多大」更關鍵。這對業界實務有直接啟發——與其一味追求更大的外部裁判模型(往往意味著更高的推論成本與更慢的訓練迴圈),不如優先考慮用策略模型自身的理解能力做獎勵,尤其對統一多模態模型而言,這條路徑幾乎零額外成本卻能拿到頂尖甚至更好的效果。同時,SpectraReward 完全免訓練、免標註的特性,也讓它容易被任何已有 MLLM 的團隊直接拿來套用在自己的圖像生成 RL 流程上,降低了研究與落地的門檻。當然,論文也坦言此方法仍受限於 MLLM 本身的視覺推理能力,對隱含物理常識的判斷可能不夠敏銳,也沒有直接優化美學或安全性,這些仍是後續工作可以延伸的方向。

StudioRecon:用擴散模型與可變形高斯,把稀疏鏡頭拍出的動態人物場景重建到極致

4D Human-Scene Reconstruction from Low-Overlap Captures

Seoul National UniversityMinhyuk Hwang、Sangmin Kim、Seunguk Do、Daneul Kim、Jaesik Park42Hugging FacearXiv
4D重建GaussianSplatting視訊擴散模型新視角合成電腦視覺

背景

想像片場只用 4、5 台攝影機從很分散的角度拍攝一場動態表演——這是實務上最常見的情境,因為架設數十台相機組成的密集陣列成本極高,一般工作室、獨立製作或消費級應用根本負擔不起。過去業界要做出高保真度的「4D」(隨時間變化的三維)人物與場景重建,幾乎都仰賴這種密集多攝影機陣列:鏡頭之間重疊視野夠大,任何一個角度沒拍到的區域,總有另一台相機補上。但當鏡頭數量少、彼此視野重疊度低(low-overlap)時,大片區域完全沒有任何相機觀測到,重建結果就會出現破洞、模糊或幾何扭曲等明顯瑕疵。

近年也有專門針對稀疏、低重疊設定設計的 4D 重建方法,試圖用更聰明的正規化或先驗知識填補空缺,但在完全沒被觀測到的區域仍然無法避免明顯的偽影(artifact)。另一條路是借助視訊擴散模型(video diffusion model)做新視角生成——這類生成模型近年在影像品質上突飛猛進,理論上可以「腦補」出沒拍到的畫面。問題是,擴散模型生成人體時常常出現幾何不一致的狀況,比如同一個人在不同影格或角度下的身形、姿勢對不起來,這對需要精確追蹤動態人體的應用(例如虛擬製作、運動分析、數位分身)是致命傷。

換句話說,背景與人體其實需要「不同的先驗知識」:背景是靜態或緩慢變化的結構,適合用生成模型去補全大範圍缺失視角;人體則是高度可變形、需要精確幾何一致性的物件,更適合用顯式的三維表示(如網格或點雲)搭配強幾何約束來建模。這正是韓國首爾大學(Seoul National University)研究團隊(Minhyuk Hwang、Sangmin Kim、Seunguk Do、Daneul Kim、Jaesik Park)提出 StudioRecon 的核心洞見,該論文已被 SIGGRAPH Conference Papers '26 接受。

方法

StudioRecon 的整體策略是「拆解問題」:不再用單一模型硬吃背景加人體的所有變化,而是把背景重建與人體重建分開處理,再用一個統整模組把兩者合成、修飾成一致的畫面。整套 pipeline 可分為三大模組:

第一,背景密集化(background densification)。 針對稀疏、低重疊相機拍到的背景,StudioRecon 利用視訊擴散模型,以「相機可控」(camera-controlled)的方式合成數百個新視角畫面,等於用生成模型人工「補拍」出原本沒有相機涵蓋到的視角與畫面,大幅增加背景監督訊號的密度。因為背景相對靜態、不需要精細的動態幾何一致性,用擴散模型生成即使有些微不完美也不太會被察覺,卻能有效填補原本完全空白的觀測區域,讓背景的新視角合成結果更完整、更少破洞。

第二,可變形高斯人體的穩健初始化。 人體不能靠生成模型隨意腦補,必須維持嚴謹的幾何一致性,因此團隊改用顯式的可變形三維高斯(deformable Gaussian)來表示人體,並透過「跨視角身份關聯」(cross-view identity association)技術,先把不同相機、不同時刻拍到的同一個人正確配對起來(在多人場景中避免張冠李戴),再用三角測量(triangulation)方式,把多視角偵測到的人體關鍵點(keypoint)融合成穩定的三維姿態估計,作為可變形高斯模型的初始化基礎。這一步確保即便輸入視角稀疏,人體的骨架與形變仍然有可靠的幾何錨點,而不是任由網路自由發揮導致變形失真。

第三,遞迴增強模組(recursive enhancement module)與動作自適應一致性注入(motion-adaptive consistency injection)。 背景(由擴散模型生成密集補全)與人體(由可變形高斯精確建模)分別完成後,兩者合成疊加時難免在邊界、光影、細節上出現不協調或殘留瑕疵。StudioRecon 設計了一個會反覆迭代精修的增強模組,依據人體動作的動態程度自適應地注入一致性約束,讓合成後的畫面在時間軸與空間上都更和諧,盡量消除拼接痕跡與殘留的偽影。

整體而言,這套方法巧妙地讓「生成式先驗」與「顯式幾何先驗」各司其職:生成模型負責解決背景視角覆蓋不足的問題,顯式高斯與多視角三角測量負責保證人體幾何的可信度,最後再用一個統一的精修步驟把兩者黏合起來。

實驗結果

研究團隊在四個真實世界拍攝的資料集上進行評測,涵蓋不同拍攝條件與場景型態:EgoHumans、Harmony4D、Mobile Stage,以及團隊自行拍攝的 SelfCap,總共在 8 個測試場景上做了系統性比較。

在新視角合成(novel view synthesis)品質這項核心指標上,StudioRecon 相較於目前最好的基準方法(best baselines),PSNR(峰值訊噪比,數值越高代表畫質越接近真實)提升了約 +1.5 到 +5.0 dB,提升幅度依場景難度不同而有落差,但在多數場景都取得明顯進步。同時,LPIPS(一種更貼近人類感知的影像相似度指標,數值越低代表視覺品質越好)在各場景上降低了 33% 到 74%,顯示合成畫面在人眼感知上的真實感與細節保真度有顯著改善。論文指出,StudioRecon 在全部 8 個測試場景中都達到了業界目前最佳(state-of-the-art)的表現,而不是僅在特定場景上取勝,說明這套「拆解式」策略在不同拍攝條件下具有一致的穩定性,不只是針對某類場景做過度調校的結果。

除了量化指標,研究團隊也展示了兩項延伸應用:一是「新軌跡渲染」(novel trajectory rendering),也就是讓虛擬攝影機沿著訓練時完全沒出現過的路徑自由移動拍攝,驗證重建出的 4D 場景具備足夠的空間完整性與幾何穩定性;二是「人物替換」(human replacement),把重建場景中的人物替換成另一個人或角色,這項應用直接受益於背景與人體被顯式拆解、各自獨立建模的設計——因為背景與人體本來就是分開儲存與渲染的,替換人物時不需要重新處理整個場景。

意義

這篇論文回應了一個長期存在、卻在學術研究裡容易被忽略的落差:多數表現亮眼的 4D 重建方法都假設有密集攝影機陣列可用,但現實中的片場、直播、體育賽事轉播、甚至消費級 3D 拍攝,大多只有少數幾台、彼此視角差異很大的相機。StudioRecon 的價值在於證明,只要用對策略——把「需要生成式腦補」和「需要精確幾何」這兩種截然不同性質的重建需求拆開處理,而不是硬塞進同一個模型裡——稀疏、低重疊的輸入條件也能達到接近甚至超越過去依賴密集陣列方法的視覺品質。

更廣的意義在於,這種「生成先驗補背景、顯式模型管人體」的混合式架構,提供了一種可能推廣到其他領域的設計範式:凡是場景中同時存在「大範圍靜態/半靜態結構」與「小範圍高度動態、需要精確追蹤的物件」的重建任務(例如自動駕駛的路況與行人、體育轉播的場地與運動員、遠距協作的房間與人物),都可以借鏡這種分而治之、再統一精修的思路。對內容產製與虛擬製作產業而言,PSNR 提升 1.5-5.0 dB、LPIPS 大幅下降的改善幅度,加上支援新軌跡渲染與人物替換等實用功能,意味著未來用少量攝影機就能產出媲美專業攝影棚等級的動態虛擬內容,大幅降低 4D 內容製作的硬體門檻與成本,也讓虛擬人合成、線上演出重製、體育賽事自由視角回放等應用更容易普及。