← 目錄

K1 論文詳解

2026-07-27


Show, Don't Tell:當圖像生成模型也能「用畫的」回答空間問題

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

ZJU-OmniAIXu Wang、Kaixiang Yao、Miao Pan、Xiaohe Zhou、Xuanyu Liu、Wenqi Zhang、Xuhong Zhang35Hugging FacearXiv
空間推理VLM圖像生成benchmark多模態評測

背景

空間智能(spatial intelligence)一直被視為 AI 從「看懂語意」邁向「理解物理世界」的關鍵能力——判斷物體距離多遠、朝哪個方向、路徑怎麼走,這些任務大多發生在連續的視覺場景裡。問題是,現有的空間推理 benchmark 幾乎都要求模型用文字、座標或選項作答,例如「請輸出物體中心點的 (x, y) 座標」。這種答題介面對以文字輸出為主的 VLM(vision-language model)很自然,但對圖像生成模型卻是一種錯位——圖像生成模型的天賦本來就是直接在像素空間裡「畫出」答案,比如在圖上標記一個點、畫一條路徑、塗一塊區域,而不是報一串數字。

這篇來自 ZJU-OmniAI 團隊的論文指出,這種「答案介面不匹配」讓圖像生成模型長期無法在同一套任務語意下,和文字輸出的 VLM 進行公平比較——即便前者理論上更擅長把空間判斷「外顯化」成圖片。論文作者因此提出 ProVisE(Protocolized Visual Evaluation)框架,以及配套的診斷型 benchmark:SpatialGen-Bench,試圖第一次把「用畫的回答」和「用寫的回答」放在同一把尺上評測。

方法

ProVisE 的核心是三層機制。第一層是「視覺協定與路由(Visual Protocols & Routing)」:把引導提示詞(guidance prompt)和對應的解析器(parser)配成一組協定,協定池涵蓋標記(marking)、方向網格、深度圖、區域遮罩、軌跡繪製等多種答題形式。第二層是「Agentic 協定建構器」,能自動為新的 benchmark 生成並驗證任務專屬協定,做法是把任務規格標準化後,從三條路線中選擇:直接沿用既有協定(Reuse)、從 41 個已註冊的解析運算子中組裝新協定(Build),或在前兩者都不夠用時退回一個受約束的輔助解析器(Fallback)。第三層則是「metric 相容評測」——把圖像生成模型畫出來的視覺答案,解析回原始 benchmark 所要求的答案格式(座標、遮罩、選項等),讓文字輸出與視覺輸出模型可以套用完全相同的評分方式。

在此框架上,作者建構了 SpatialGen-Bench:一個精選的診斷型 benchmark,共 470 筆樣本,橫跨 14 個空間子任務與四個能力層級——感知(Perception,145 筆,含計數、深度估計、朝向、大小比較)、理解(Understanding,140 筆,含關係驗證、視角判斷、心智建模、空間定位)、推理(Reasoning,90 筆,含多跳推理、狀態預測、幾何可行性)、互動(Interaction,95 筆,含可供性定位、導航、軌跡規劃)。樣本取材自 BLINK、ViewSpatial、MindCube、RefCOCOg、PhysBench 等既有資料集,並經人工複核確保標註一致性。解析規則相當具體,例如物件標記用 HSV 色域門檻(綠色 H=35–90)配合形態學處理,方向網格用藍色像素在 3×3 網格中的聚合,深度用座標周圍 5×5 灰階取樣,軌跡則用紅色路徑萃取後骨架化並取 20 個取樣點,再以 Discrete Fréchet Distance(門檻 0.4)計分。

實驗結果

作者總共評測了 20 個文字輸出系統與 11 個視覺輸出系統。文字端表現最好的是 GPT-5.4,整體得分 61.04%;視覺端最佳是 GPT Image 2,整體 54.49%,其次是 Nano Banana 2 的 48.63%。作為對照組的人類表現則高達 87.79%,顯示現有模型與人類仍有相當大差距,尤其在「理解」層級落後人類達 38.57 分。

分能力層級來看結果十分有趣:在「感知」任務上,文字模型(76.82%)略勝視覺模型(72.92%),差距僅 3.9 分;「理解」任務兩者幾乎打平,視覺模型甚至以 47.14% 對 45.71% 小勝;但在「推理」任務上,文字模型的優勢一口氣拉開到 20.6 分(62.45% 對 41.83%);「互動」任務文字也領先 12.9 分(69.70% 對 56.80%)。同一模型家族的直接對照(SenseNova 雙模式)顯示,視覺答題能「救回」約 30.6% 文字答錯的題目,說明兩種介面確實存在互補而非單純替代關係——視覺模型能答對的 71 道題(佔 GPT-5.4 失誤題目的 37%)恰恰是文字模型答錯的。

失誤歸因分析同樣關鍵:視覺模型的失敗中,88.03% 屬於「格式正確但答案錯誤」,只有 8.46% 是協定不符規範、3.45% 是解析失敗、0.06% 是生成失敗——意味著瓶頸主要在空間推理能力本身,而非圖文轉換的技術性溝通問題。另外,作者也測試了解析器本身的敏感度:若把任務專屬解析器換成通用的 Qwen3-VL-8B,模型排名相關性只剩 0.60(換成 Qwen2.5-VL-72B 則是 0.31),平均分數位移達 5.87 分,甚至讓原本排名第一的 GPT Image 2 被 JoyAI-Image 反超,證明用「黑箱 VLM 當裁判」本身就會引入額外的解讀誤差。在六個外部 benchmark(EmbSpatial、OmniSpatial、Q-Spatial+、RoboSpatial、SAT、RoboAfford)的小規模驗證(各 50 筆)中,Agentic 建構器分別採用 4 次 Reuse、11 次 Build、8 次 Fallback 路線,整體驗證成功率達 95%,且沒有任何單一介面能在六個 benchmark 中全面稱霸——文字在四個上領先,視覺則在 SAT 與 RoboAfford 上勝出。

意義

這篇論文最重要的貢獻不是「證明圖像生成模型比較強或比較弱」,而是第一次搭建出一個 metric 相容的測試平台,讓兩種截然不同的答題介面可以在同一套任務語意下被公平比較。過去圖像生成模型在空間推理評測中天生吃虧,不是因為能力不足,而是因為評測本身只認得文字座標這種「單一語言」。ProVisE 的協定化解析機制證明,只要把答案介面的落差解決掉,圖像生成模型在「可直接外顯為像素」的任務(如深度、關係判斷)上其實相當有競爭力,深度任務甚至反超文字模型近 19 分。

同時,結果也劃出了清楚的能力邊界:一旦任務需要組合多重約束、做視角變換或精確的數值狀態更新,文字推理仍然明顯占優。這對未來系統設計有直接啟示——與其爭論「該用文字還是該用圖像做空間推理」,不如依任務與推理階段動態選擇表徵形式:用圖像生成外顯幾何結構,用文字做約束組合與邏輯推理,再用確定性的解析運算子驗證結果。對於正在打造具身智能(embodied AI)、機器人導航或多模態 agent 的團隊來說,這意味著混合式架構(文字推理 + 視覺外顯)可能比單一模態更貼近真實世界的空間認知需求,而 SpatialGen-Bench 與 ProVisE 也為後續研究提供了一把可重複使用、可延伸到新 benchmark 的評測尺規。

Self Gradient Forcing:只用 5 秒訓練窗,讓影片生成模型「自己記住自己」

Self Gradient Forcing: Native Long Video Extrapolation

Junhao Zhuang、Shiyi Zhang、Yuxuan Bian、Yaowei Li、Yawen Luo、Yijun Liu、Weiyang Jin、Songchun Zhang30Hugging FacearXiv
影片生成diffusion modelautoregressiveSelf Forcing長影片生成

背景

近年自迴歸(autoregressive)影片擴散模型的訓練方式,越來越多採用一種叫 Self Forcing 的技巧。傳統做法會讓模型在訓練時「看」真實影片的歷史畫面來預測下一段,但這樣訓練出來的模型在真正推論(inference)時,因為手上只有自己先前生成的畫面而非真實畫面,品質會隨著時間推移逐漸崩壞,這就是所謂的「exposure bias(曝光偏差)」問題。Self Forcing 的解法很直觀:訓練時就讓模型吃自己 rollout(自我展開)生成出來的歷史畫面,這樣訓練和推論的輸入分布就一致了,長影片生成的穩定性因此大幅提升,也成為目前業界主流做法的基礎。

但這篇來自 Joy Future Academy(京東 JD)的論文指出,Self Forcing 其實留下一個沒被注意到的漏洞:模型會把過去生成的畫面壓縮成 key-value(KV)快取,供後面的畫面透過因果注意力(causal attention)讀取;然而在訓練時,這個歷史 KV 快取被當成「凍結」的既定事實使用——未來畫面產生的 loss 只會回頭教模型「怎麼讀」這份記憶,卻無法回頭教模型「怎麼寫」這份記憶,也就是無法指導模型把先前生成的 latent 編碼成對後續生成更有用的 key/value 表示。作者將這個現象稱為「historical context-gradient gap(歷史上下文梯度缺口)」。這正是長影片生成中,主角身份漂移、背景/版面不一致、鏡頭邏輯崩壞等問題的一個重要成因——模型從未真正被訓練去把記憶寫好。

方法

論文提出的 Self Gradient Forcing(SGF)是一套兩階段(two-pass)訓練策略,目標是在不需要對整條序列 rollout 做完整反向傳播(backpropagation)的前提下,補回這個遺失的「記憶寫入」監督訊號。

Pass 1(無梯度序列展開):完全比照推論流程,做一次不追蹤梯度的自迴歸 rollout,並在去噪過程中,於採樣到的某個「退出步驟」(exit step,從 t*∈{1000, 750, 500, 250} 中取樣)記錄下兩樣東西:模型自己生成的上下文(context)畫面,以及當時餵給模型的帶噪 latent。

Pass 2(平行上下文梯度重建):針對記錄下來的那個退出步驟,做一次平行重建計算。這裡的關鍵設計是:把 Pass 1 生成的上下文當作「stop-gradient」的乾淨 latent 輸入(也就是數值上固定、但重新讓模型計算),讓模型重新計算這段上下文的 KV 表示,以及未來畫面對這段上下文的因果注意力。因為這次計算是可微分的,未來畫面的 loss 就能夠一路傳回去,教模型如何把歷史畫面「編碼」成更有效的記憶,而不只是教它怎麼讀取記憶。

技術上,這個方法建立在 causal diffusion transformer(DiT)架構、以雙向教師模型做 distribution-matching distillation(DMD)、以及 Wan 影片 VAE(其 latent 分組為不對稱的 1 幀+4 幀結構)之上,並用 FlexAttention 搭配編譯過的區塊稀疏因果遮罩來讓 Pass 2 的平行重建更有效率。訓練時 fake-score 與 generator 更新比例為 5:1,全程只用 5 秒長度的訓練窗(frame-wise 設定為 sink 4、總視窗 21、FIFO 16;chunk-wise 設定為 sink 3、總視窗 12、FIFO 6,chunk size 3)。

值得一提的是,作者在附錄中驗證了 Pass 2 重建的保真度:在 96 組 prompt / exit-step 組合下,重建結果與真實序列計算的相對 L2 誤差僅 1.41%,平均餘弦相似度高達 0.999886,證明這個「平行近似」確實忠實還原了序列計算的結果,而非引入額外偏差。

實驗結果

論文用同一組僅 5 秒的訓練窗,測試模型能否外推(extrapolate)到遠超訓練長度的影片,並在 frame-wise 與 chunk-wise 兩種自迴歸設定、以及不同初始化下做了大量比較。

  • 60 秒外推:在 VBench-Long 協定下,SGF 在美學品質、背景一致性、成像品質、動作平滑度、主體一致性、閃爍等多項指標上都優於 Self Forcing 基線。
  • 240 秒(4 分鐘)外推:在 MovieGen 隨機抽取的 128 條 prompt 上測試,SGF 在一致性相關指標上大幅領先對照的 Self Forcing 模型,證實僅用 5 秒訓練資料,就能穩定生成長達數分鐘的影片——這也是論文標題「native long video extrapolation」的核心賣點。
  • Chunk-wise 60 秒與 240 秒:同樣呈現一致的提升趨勢,其中主體一致性與背景一致性的增益最為明顯。
  • 人類偏好評測:透過超過 1,900 組配對盲測(相同 prompt、種子、初始化與推論設定,僅訓練方法不同),以 GSB(Good-Same-Bad)評分計算淨偏好,結果在全部 10 組比較中都是正分,代表評測者一致偏好 SGF 生成的長影片。
  • 短影片(5 秒)基準測試:在與訓練窗同長度的情況下,SGF 與 Self Forcing 表現「大致相當」,證明新方法不會犧牲短影片品質。
  • 訓練成本:以每 5 個訓練步驟計,SGF 的峰值顯存從 79.01GB 增加到 87.01GB,耗時從 10.39 秒增加到 11.71 秒,屬於可接受範圍;相較之下,直接對整條可微分快取做反傳的方案則直接記憶體溢位(OOM),無法訓練。

質化分析顯示,Self Forcing 在長 rollout 下容易出現場景跳變、鏡頭幾何斷裂、物體變形、身份漂移、裁切漂移、背景/版面被替換等問題;SGF 則能更好地維持主角身份、姿態與場景版面的一致性,鏡頭運動也更合理連貫。

意義

這篇論文的貢獻,本質上是把長影片自迴歸生成中一個長期被忽略的訓練盲區給補上了:模型不只要學會「讀」歷史記憶,更要學會「寫」出對未來有用的記憶。透過兩階段設計,SGF 用一次無梯度 rollout 加上一次針對單一退出步驟的平行可微重建,巧妙避開了對整條長序列做反傳的高昂算力成本,卻依然把「未來的 loss」接回「過去畫面該怎麼編碼」這個因果鏈上。

最值得注意的實用價值在於:只用 5 秒訓練窗就能外推到數分鐘影片,且方法與具體架構解耦,作者也強調 SGF 是「正交(orthogonal)」於其他長影片生成技巧的——可以直接疊加在串流長 rollout 微調、檢索增強記憶、稀疏注意力、更強的因果初始化等現有技術之上,而不是取代它們。這對於降低長影片模型的訓練資料與算力門檻、加速自迴歸影片生成的產業化落地,具有相當實際的意義。作者也坦承其侷限:這是一個「有界的替代方案(bounded surrogate)」,並未真正對序列採樣路徑本身做反傳優化,且高度依賴 Pass 2 重建必須精確對齊 Pass 1 的因果遮罩、sink 位置、FIFO 視窗、RoPE 處理與 chunk 對齊等細節,一旦錯位就可能訓練出「另一個記憶寫入方式」而非原本想要監督的那個。整體而言,SGF 提供了一個相對輕量、可即插即用的訓練目標修正,為後續自迴歸影片擴散模型的長時間穩定性研究打開了新的切入點。

跳脫「相關性至上」:當檢索評估開始關心文件之間怎麼互動

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

TencentKailin Jiang、Lei Liu、Jian Xi、Hui Xu、Junlin Liu、Baochen Fu、Shaoqing Ren、Bin Li29Hugging FacearXiv
檢索增強生成RAGrerankerbenchmarkLLM評估

背景

過去二十年,搜尋引擎與檢索系統的評估標準幾乎都建立在「相關性」這一單一維度上:每份文件獨立打分,再用 nDCG 之類的指標加總排序品質。這套邏輯在人類直接閱讀搜尋結果的時代還算合理,但現在情況變了——大型語言模型(LLM)與 AI agent 已經成為搜尋結果的主要消費者,它們不是逐篇「看」文件,而是把整組被檢索回來的「文件集合」一起餵進上下文,再生成答案。這意味著決定下游生成品質上限的,其實是整個文件集合的組成方式,而不是單篇文件的相關程度。

問題在於,現有評估體系完全沒有能力回答一個關鍵問題:「為什麼這組文件集合比那組更好?」如果 A 集合裡有五篇高度相關但彼此重複的文件,B 集合裡是五篇相關性略低但互補、能覆蓋問題不同面向的文件,傳統的獨立評分+nDCG 聚合方式很可能會判 A 贏,但實際餵給 LLM 生成答案時,B 往往表現更好。這種文件之間的「冗餘(redundancy)」「衝突(conflict)」「互補性(complementarity)」等交互作用,一直是評估體系的盲區。本篇論文(arXiv:2607.19747)正是針對這個缺口提出了一整套「評估—診斷—優化」(evaluate-diagnose-optimize)閉環框架。

方法

論文的第一個核心產出是 SetwiseEvalKit,一套三層、九維度的文件集合評估基準,總共包含約 28,000 條高品質的評估準則(rubrics)。三層結構分別是:

  • 文件層級(Document-level):相關性(Relevance)、真實性(Authenticity)、品質(Quality)——這是傳統評估延續下來的部分;
  • 集合層級(Set-level):互補性(Complementarity)、冗餘(Redundancy)、衝突(Conflict)——這是本篇論文新引入、專門刻畫文件之間交互作用的維度;
  • 全域層級(Global-level):完整性(Completeness)、密度(Density)、可達性(Reachability)——衡量整組文件集合作為一個整體,能否充分且高效地支撐問題的回答。

基準同時覆蓋短文本(short-form)與長文本(long-form)兩種場景。短文本資料取自 HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle 四個多跳問答資料集,共 2,061 筆樣本;長文本則來自 ResearchQA,包含 200 個帶有多輪搜尋軌跡(multi-turn search trajectories)的實例,更貼近真實 agent 搜尋場景。作者還做了人工研究驗證 rubrics 的品質,結果顯示約 70% 的聚合準則被評為「高度具區分度」,浪費率(waste rate,即無效或冗餘準則的比例)僅 8%,證明這套 rubric 體系本身是可靠、可用的評估工具。

第二個核心產出是 Rubric4Setwise——一種無需訓練(training-free)的方法,把 rubric 式的評估準則直接轉換為文件集合的選擇訊號。換句話說,與其先用傳統 reranker 對文件逐一打分再挑 top-K,Rubric4Setwise 讓每條評估準則本身參與「該不該選這篇文件加入集合」的決策過程,直接針對「集合層級」與「全域層級」的指標做優化,把評估與優化串成一個閉環,而不是評估完了就結束。

實驗結果

研究團隊系統性評估了 12 種主流 reranker 方法在 SetwiseEvalKit 上的表現,結果相當令人意外:即便是表現最好的方法,在九維度上的整體覆蓋率(coverage)也不超過 45%。更值得注意的是,「跨文件協調」相關的維度(互補性、冗餘、衝突)普遍表現疲弱,幾乎所有方法都在這裡失分,顯示現有 reranker 設計本質上仍停留在「逐篇打分」的思維,沒有真正考慮文件之間如何配合。此外,沒有任何一種方法能同時在短文本與長文本兩種場景都維持頂尖表現——短文本場景由 setwise reranking 類方法主導,長文本場景則由具備推理能力(reasoning-enhanced)的方法領先,顯示兩種場景需要的能力並不完全重疊。

論文也驗證了 rubric 覆蓋分數與下游生成品質之間存在很強的相關性,Pearson 相關係數達到 0.92,說明這套評估體系不只是「理論上合理」,而是真的能預測實際生成效果,這也是後續把評估轉化為優化訊號(即 Rubric4Setwise)的基礎。

在下游生成表現上,Rubric4Setwise 全面勝出:短文本場景下,它以平均僅 2.66 篇文件就達到 26.10 的 EM(exact match)分數,優於次佳方法 SetR 的 25.13分,且用的文件數量更少、代表效率更高;長文本場景下,Rubric4Setwise 用平均 20.52 篇文件取得 70.57 分的 LLM-judge 評分,遠勝其他方法(約 29.23 分)。更關鍵的是,它是唯一一個在短文本與長文本兩種場景下都維持 state-of-the-art 表現的方法,同時所需的文件數與搜尋輪數都比對手更少,證明「評估—優化」閉環的設計思路確實有效。

意義

這篇論文的意義不只是又提出一個新 benchmark,而是指出了整個檢索評估範式的一個結構性缺陷:在 LLM 與 agent 已經取代人類成為搜尋結果主要消費者的今天,繼續用「逐篇打分+nDCG」的老方法評估檢索系統,可能從根本上量錯了東西。文件集合內部的冗餘、衝突與互補關係,直接決定了 RAG(檢索增強生成)系統下游生成的品質上限,而這正是現有 12 種主流 reranker 普遍薄弱的地方(最高覆蓋率不到 45%)。

對於實務工作者而言,這意味著未來設計檢索或 reranking 系統時,不能只優化「這篇文件跟問題有多相關」,還必須考慮「這篇文件放進目前這組候選集合後,會不會跟其他文件重複、衝突,或者填補了資訊缺口」。Rubric4Setwise 展示了一條可行路徑——把評估準則直接變成選文件的訊號,不需要額外訓練模型,就能用更少的文件、更少的搜尋輪數拿到更好的生成結果,這對於需要控制 token 成本與延遲的 agent 系統尤其有吸引力。整體而言,這篇論文把「文件集合品質」正式提升為一個可測量、可優化的獨立問題,為下一代 RAG 與搜尋系統的評估與設計提供了新的基礎工具與方法論。