SynthDocBench:用合成基準拆解視覺文件理解的失敗根源
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
背景
近年來 vision language models(VLM)在 DocVQA、ChartQA、MMLongBench-Doc 等視覺文件理解 benchmark 上表現亮眼,單頁文件的準確率常見於 85%~96% 之間,看起來已接近「解決」。但研究團隊指出一個根本問題:真實世界的文件同時混雜了長度、版面複雜度、模態組成(文字/圖表/表格)與問題難度等多個變因,一旦模型在某個 benchmark 上失分,幾乎無法判斷究竟是哪個因素造成的——是文件太長、圖表太密、還是問題本身太難?這種「多因素糾纏」讓現有 benchmark 難以真正診斷模型的長文本視覺理解能力,也讓研究者懷疑,現有的高分是否只是模型「過擬合」了特定 benchmark 的表面特徵(spurious correlation),而非真正具備穩健的長文本理解力。為了解決這個歸因問題,作者提出了 SynthDocBench:一個完全合成、可控制單一變因的長文本視覺文件理解基準。
方法
SynthDocBench 採用三階段生成流程。第一階段是內容生成:從主題種子擴展出語意骨架,並整理成能明確標示段落邊界與資料區塊的中間表示。第二階段是版面與視覺語法設計,系統定義了六種版面原型(雜誌、儀表板、學術論文、社論、資訊圖表、粗獸派),其中 60% 依主題條件選擇版面,40% 則完全隨機覆寫,目的是避免模型靠猜版面規律作弊、鑽 spurious correlation 的漏洞。第三階段是「雙層視覺化合成」:每張圖表同時存在一個用 D3.js 渲染的視覺畫面,以及一個記錄座標軸、資料點與洞見的結構化 metadata,確保 ground truth 完全確定,不需事後人工標註或 OCR 解析。
問題則分成三大類:圖表讀值(chart-reading)、跨模態推理(cross-modal,需同時讀取文字與圖表且證據不相鄰)、以及複雜多跳推理(complex multi-hop,證據需跨 2~4 個區塊組合,難度分五級 L1–L5)。所有問題經過數值重算、自動一致性過濾與人工複核三層驗證,標註者間一致性 κ=0.81,接受率 96%。
最終基準包含 200 份合成報告、共 1,788 題,平均每份文件 51.1 頁、20,568 字、16.7 張圖表,涵蓋 24 種圖表類型。評測時模型只能看到 144 DPI 的頁面截圖(以 5 頁為一組拼接成長條圖,不提供 HTML 原始碼或 OCR 文字),由 GPT-5 擔任裁判,以 0–10 分評分,取分數 ≥6 視為答對計算 ACC。
實驗結果
研究團隊評測了七個前沿 VLM(含 Gemini、GPT 系列、Claude-Sonnet-4.5、Qwen 系列與 InternVL3-78B 等)。整體 ACC 差距懸殊:表現最好的模型 overall ACC 約 0.725,而表現最差的模型僅 0.081,顯示長文本視覺理解遠未飽和。三個關鍵失敗模式浮現:第一,除少數模型外,幾乎所有模型隨難度從 L1 升到 L5 呈現單調下滑,某模型跌幅達 23 個百分點;第二,文件「中段」對五分之六的模型是最難的區段,五分之六模型呈現負向的 Early→Late 趨勢,最陡的下滑幅度達 8.3 個百分點,呼應長文本處理中著名的「lost-in-the-middle」現象;第三,圖表理解在長文件情境下明顯崩潰——同樣的模型在單獨圖表(如 ChartQA)上可達 85%~91%,但放進長文件後準確率大幅下滑。針對 109 個「所有模型都答錯」的困難案例分析,超過半數(58 例)集中在跨模態失誤,主要錯誤型態是「視覺幻覺」:模型給出看似合理卻與圖表實際數值不符的答案,尤其在資料密集圖表(如啞鈴圖、多序列比較圖)上更明顯。額外的 OCR 對照實驗顯示,若改用純文字 OCR 輸入,圖表題準確率反而下降(顯示像素級視覺解讀是瓶頸),但複雜多跳題準確率大幅提升,說明多跳推理的證據多可從文字還原,真正的瓶頸是視覺解碼而非推理本身。渲染長度的消融實驗也顯示,把單頁改成 5 頁甚至 10 頁一組輸入,跨模態題目的準確率明顯提升,證明適當的長上下文拼接反而有助於推理。與 MMLongBench-Doc 的排名相關性為 Spearman ρ=0.657,顯示兩者具互補而非完全重疊的診斷訊號。
意義
SynthDocBench 的核心貢獻在於用「組合式設計」把長度、版面、模態、難度這些糾纏的變因拆開,首次讓研究者能夠精確歸因模型在何種條件下失敗,而不是只看到一個籠統的低分數。研究結果也給整個領域一個警訊:模型在 DocVQA、ChartQA 等單頁 benchmark 上逼近飽和,很可能只是掌握了特定資料集的表面規律,而非真正具備穩健的長文本視覺推理能力;「lost-in-the-middle」式的位置偏誤與圖表理解在長文件中的崩潰,說明目前的多模態長上下文架構仍有結構性缺陷。對於實務應用(如財報、研究報告、法規文件的自動化理解)而言,這意味著在部署前必須用類似 SynthDocBench 這種可控合成資料做壓力測試,而不能只依賴現成 benchmark 分數。作者也坦承合成資料犧牲了部分生態效度(ecological validity),並提醒 D3.js 渲染風格可能與某些模型的訓練分佈較接近,構成潛在confound,未來需以不同渲染引擎驗證結論的穩健性。整體而言,這份工作為「診斷式」而非「排行榜式」的多模態評測提供了一個可複製的方法論範本。