Show, Don't Tell:當圖像生成模型也能「用畫的」回答空間問題
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
背景
空間智能(spatial intelligence)一直被視為 AI 從「看懂語意」邁向「理解物理世界」的關鍵能力——判斷物體距離多遠、朝哪個方向、路徑怎麼走,這些任務大多發生在連續的視覺場景裡。問題是,現有的空間推理 benchmark 幾乎都要求模型用文字、座標或選項作答,例如「請輸出物體中心點的 (x, y) 座標」。這種答題介面對以文字輸出為主的 VLM(vision-language model)很自然,但對圖像生成模型卻是一種錯位——圖像生成模型的天賦本來就是直接在像素空間裡「畫出」答案,比如在圖上標記一個點、畫一條路徑、塗一塊區域,而不是報一串數字。
這篇來自 ZJU-OmniAI 團隊的論文指出,這種「答案介面不匹配」讓圖像生成模型長期無法在同一套任務語意下,和文字輸出的 VLM 進行公平比較——即便前者理論上更擅長把空間判斷「外顯化」成圖片。論文作者因此提出 ProVisE(Protocolized Visual Evaluation)框架,以及配套的診斷型 benchmark:SpatialGen-Bench,試圖第一次把「用畫的回答」和「用寫的回答」放在同一把尺上評測。
方法
ProVisE 的核心是三層機制。第一層是「視覺協定與路由(Visual Protocols & Routing)」:把引導提示詞(guidance prompt)和對應的解析器(parser)配成一組協定,協定池涵蓋標記(marking)、方向網格、深度圖、區域遮罩、軌跡繪製等多種答題形式。第二層是「Agentic 協定建構器」,能自動為新的 benchmark 生成並驗證任務專屬協定,做法是把任務規格標準化後,從三條路線中選擇:直接沿用既有協定(Reuse)、從 41 個已註冊的解析運算子中組裝新協定(Build),或在前兩者都不夠用時退回一個受約束的輔助解析器(Fallback)。第三層則是「metric 相容評測」——把圖像生成模型畫出來的視覺答案,解析回原始 benchmark 所要求的答案格式(座標、遮罩、選項等),讓文字輸出與視覺輸出模型可以套用完全相同的評分方式。
在此框架上,作者建構了 SpatialGen-Bench:一個精選的診斷型 benchmark,共 470 筆樣本,橫跨 14 個空間子任務與四個能力層級——感知(Perception,145 筆,含計數、深度估計、朝向、大小比較)、理解(Understanding,140 筆,含關係驗證、視角判斷、心智建模、空間定位)、推理(Reasoning,90 筆,含多跳推理、狀態預測、幾何可行性)、互動(Interaction,95 筆,含可供性定位、導航、軌跡規劃)。樣本取材自 BLINK、ViewSpatial、MindCube、RefCOCOg、PhysBench 等既有資料集,並經人工複核確保標註一致性。解析規則相當具體,例如物件標記用 HSV 色域門檻(綠色 H=35–90)配合形態學處理,方向網格用藍色像素在 3×3 網格中的聚合,深度用座標周圍 5×5 灰階取樣,軌跡則用紅色路徑萃取後骨架化並取 20 個取樣點,再以 Discrete Fréchet Distance(門檻 0.4)計分。
實驗結果
作者總共評測了 20 個文字輸出系統與 11 個視覺輸出系統。文字端表現最好的是 GPT-5.4,整體得分 61.04%;視覺端最佳是 GPT Image 2,整體 54.49%,其次是 Nano Banana 2 的 48.63%。作為對照組的人類表現則高達 87.79%,顯示現有模型與人類仍有相當大差距,尤其在「理解」層級落後人類達 38.57 分。
分能力層級來看結果十分有趣:在「感知」任務上,文字模型(76.82%)略勝視覺模型(72.92%),差距僅 3.9 分;「理解」任務兩者幾乎打平,視覺模型甚至以 47.14% 對 45.71% 小勝;但在「推理」任務上,文字模型的優勢一口氣拉開到 20.6 分(62.45% 對 41.83%);「互動」任務文字也領先 12.9 分(69.70% 對 56.80%)。同一模型家族的直接對照(SenseNova 雙模式)顯示,視覺答題能「救回」約 30.6% 文字答錯的題目,說明兩種介面確實存在互補而非單純替代關係——視覺模型能答對的 71 道題(佔 GPT-5.4 失誤題目的 37%)恰恰是文字模型答錯的。
失誤歸因分析同樣關鍵:視覺模型的失敗中,88.03% 屬於「格式正確但答案錯誤」,只有 8.46% 是協定不符規範、3.45% 是解析失敗、0.06% 是生成失敗——意味著瓶頸主要在空間推理能力本身,而非圖文轉換的技術性溝通問題。另外,作者也測試了解析器本身的敏感度:若把任務專屬解析器換成通用的 Qwen3-VL-8B,模型排名相關性只剩 0.60(換成 Qwen2.5-VL-72B 則是 0.31),平均分數位移達 5.87 分,甚至讓原本排名第一的 GPT Image 2 被 JoyAI-Image 反超,證明用「黑箱 VLM 當裁判」本身就會引入額外的解讀誤差。在六個外部 benchmark(EmbSpatial、OmniSpatial、Q-Spatial+、RoboSpatial、SAT、RoboAfford)的小規模驗證(各 50 筆)中,Agentic 建構器分別採用 4 次 Reuse、11 次 Build、8 次 Fallback 路線,整體驗證成功率達 95%,且沒有任何單一介面能在六個 benchmark 中全面稱霸——文字在四個上領先,視覺則在 SAT 與 RoboAfford 上勝出。
意義
這篇論文最重要的貢獻不是「證明圖像生成模型比較強或比較弱」,而是第一次搭建出一個 metric 相容的測試平台,讓兩種截然不同的答題介面可以在同一套任務語意下被公平比較。過去圖像生成模型在空間推理評測中天生吃虧,不是因為能力不足,而是因為評測本身只認得文字座標這種「單一語言」。ProVisE 的協定化解析機制證明,只要把答案介面的落差解決掉,圖像生成模型在「可直接外顯為像素」的任務(如深度、關係判斷)上其實相當有競爭力,深度任務甚至反超文字模型近 19 分。
同時,結果也劃出了清楚的能力邊界:一旦任務需要組合多重約束、做視角變換或精確的數值狀態更新,文字推理仍然明顯占優。這對未來系統設計有直接啟示——與其爭論「該用文字還是該用圖像做空間推理」,不如依任務與推理階段動態選擇表徵形式:用圖像生成外顯幾何結構,用文字做約束組合與邏輯推理,再用確定性的解析運算子驗證結果。對於正在打造具身智能(embodied AI)、機器人導航或多模態 agent 的團隊來說,這意味著混合式架構(文字推理 + 視覺外顯)可能比單一模態更貼近真實世界的空間認知需求,而 SpatialGen-Bench 與 ProVisE 也為後續研究提供了一把可重複使用、可延伸到新 benchmark 的評測尺規。