← 目錄

K1 論文詳解

2026-07-12


為什麼打不開抽屜?破解零樣本組合動作辨識中的「物件捷徑」陷阱

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

NAVERGeo Ahn、Inwoong Lee、Taeoh Kim、Minho Shim、Dongyoon Wee、Jinwoo Choi47Hugging FacearXiv
動作辨識零樣本學習多模態影片理解CLIP

背景

想像一個影片辨識模型從未見過「打開抽屜(open drawer)」這個動作,但它在訓練中看過「打開冰箱(open fridge)」和「拿起抽屜(take drawer)」。理論上,只要模型真正學會「打開」這個動作代表的時間性動作模式,加上「抽屜」這個物件的視覺特徵,就能把兩者組合起來,正確認出全新的「打開抽屜」。這正是 Zero-Shot Compositional Action Recognition(ZS-CAR,零樣本組合動作辨識)想解決的問題:辨識由已知的動詞(verb)與物件(object)基本元素組成、但從未在訓練中出現過的新組合。

然而這篇論文(arXiv:2601.16211,作者 Geo Ahn、Inwoong Lee、Taeoh Kim、Minho Shim、Dongyoon Wee、Jinwoo Choi)指出,現有模型其實常常「作弊」:它們並非真的透過時間性證據判斷動詞,而是學會了「物件驅動的捷徑(object-driven shortcuts)」——也就是看到某個物件標籤,就直接猜測與該物件最常見共同出現的動詞,完全略過影片中真正的動作線索。

論文分析認為,這種捷徑之所以會出現,來自兩個根本原因。第一是「組合監督稀疏(sparse compositional supervision)」:訓練資料集裡動詞與物件的組合覆蓋率極低。以論文使用的兩個基準為例,Sth-com(改編自 Something-Something 系列)包含 161 個動詞、248 個物件,但實際出現的組合只涵蓋所有可能組合的 12.8%;而論文新提出的 EK100-com(改編自 Epic-Kitchens-100)有 81 個動詞、216 個物件,組合只有 1,320 種,覆蓋率僅 7.5%,稀疏程度更嚴重。第二是「動詞—物件學習難度不對稱」:物件通常只看單一畫面就能辨識出來,但動詞需要跨多幀的時間推理才能判斷,這種難易差距讓模型傾向優先學會「偷懶」的物件線索,而非費力氣學習真正的動作語意。

方法

為了診斷並量化這個捷徑問題,作者先提出三個診斷指標:False Seen Prediction(FSP,衡量未見組合被誤判為已見組合的比例)、False Co-occurrence Prediction(FCP,衡量錯誤預測collapse到訓練中常見配對的比例),以及 Compositional Gap(ΔCG = 聯合準確率 − 動詞準確率×物件準確率,用來衡量模型是否真的做到「組合」推理而非各自獨立猜測)。用這些指標分析現有方法(如 baseline C2C)發現,訓練過程中 FSP 從 53% 一路攀升到 63%,FCP 也從 26% 升到 29%,且動詞特徵在時間軸正向與反向播放時的餘弦相似度高達 0.92——代表模型幾乎不在乎影片的時間順序,物件捷徑越訓練越嚴重。

針對此問題,作者提出 RCORE(Robust COmpositional REpresentations),包含兩個互補模組:

Co-occurrence Prior Regularization(CPR):透過把其他影片中的物件「移植」進動作區域,人工合成訓練中未出現過的動詞—物件組合,作為額外監督訊號;同時對訓練資料中頻繁共現的配對施加margin-based懲罰,把它們當作「困難負樣本(hard negatives)」加以抑制,逼模型不能只靠記憶常見搭配。為避免把太多未見組合誤判為負樣本而傷害訓練穩定性,CPR 採用「batch-adaptive 標籤空間擴增」策略,只在每個批次內動態調整需要懲罰的組合範圍。

Temporal Order Regularization for Composition(TORC):強制模型對時間順序敏感——具體做法是最小化原始影片與時間反轉影片之間動詞特徵的餘弦相似度,並在時間結構被打亂時最大化預測的不確定性(熵),藉此讓動詞表徵真正紮根於時間證據,而非靜態畫面線索。

模型骨幹方面,作者分別在 CLIP-B/16(搭配 AIM adapter)與 InternVideo2-CLIP-B/14(搭配 LoRA)兩種 backbone 上驗證方法有效性,動詞編碼器使用兩層時間卷積加 ReLU,物件編碼器則用時間平均池化加兩層 MLP。訓練在 8 張 V100 GPU 上進行,batch size 128,訓練 40–50 epoch。

實驗結果

在 Sth-com 開放世界(open-world)設定下,使用 CLIP backbone 時,RCORE 的未見組合準確率達到 33.90%,優於 baseline C2C 的 30.08%;動詞在未見組合上的準確率為 59.00%,高於 C2C 的 54.36%。更關鍵的是 ΔCG 指標由 C2C 的 −0.42(負值代表模型組合能力反而比獨立猜測還差)轉為 RCORE 的 +0.66,顯示模型真正學會了「組合式推理」。換成更強的 InternVideo2 backbone 後,RCORE 在未見組合上達到 43.98%,比 C2C 的 39.53% 提升 4.5 個百分點,ΔCG 也從 −0.63 轉正為 +0.95。

在稀疏程度更高、更具挑戰性的 EK100-com 上,效果更明顯:CLIP backbone 下未見組合準確率提升 6.9 個百分點,ΔCG 轉正達 +1.32;InternVideo2 backbone 下未見組合提升 7.0 個百分點,ΔCG 更達到 +3.83,顯示在資料極度稀疏的場景下,RCORE 的捷徑抑制效果特別顯著。

診斷指標的變化也印證了方法有效:導入 RCORE 後,FSP 從 47% 微降至 44%(相較 C2C 的 53%→63% 持續惡化形成鮮明對比),FCP 穩定維持在約 23%(C2C 則持續上升到 29%),而反轉影片與正向影片動詞特徵的餘弦相似度變成 −0.79(原本 C2C 是 +0.92),代表模型現在確實能區分時間順序而非忽略它。消融實驗顯示,單獨使用 TORC 對動詞準確率提升最大(+3.5 點),單獨使用 CPR 對未見組合準確率提升 3.1 點,兩者合併使用效果最佳(+5.0 點);此外,batch-adaptive 標籤空間擴增策略被證實至關重要——若直接對所有未見組合做完全開放式訓練,效果反而大幅下降。

意義

這篇論文的貢獻不只是提出一個新方法,更重要的是揭露了一個容易被忽視、卻普遍存在於組合式辨識任務中的「隱性作弊」現象:模型在標準指標上表現不錯,很可能只是因為訓練集和測試集的共現分佈相近,而非真正學會了組合推理能力。這對所有涉及「已知元素重組」的多模態任務(不只是動作辨識,也包括組合式屬性辨識、場景理解等)都有警示意義——僅看整體準確率可能掩蓋模型的捷徑學習問題,必須搭配像 FSP、FCP、ΔCG 這類專門診斷指標,才能真正檢驗泛化能力。

此外,作者特別採用「開放世界評測、不做測試集偏差校準」的評估協定,比起過去許多方法在封閉世界設定下人為校準預測偏好、掩蓋掉模型過度預測常見組合的傾向,這種更嚴格的評測方式,更貼近真實部署場景中模型會遇到的各種未知組合。對於希望將動作辨識系統應用在機器人、智慧居家或影片檢索等真實場景的工程師而言,RCORE 提供了一套可以直接複用的正則化技巧(合成困難負樣本、時間順序敏感的自監督訊號),有助於打造真正理解「動作」而非僅僅記憶「物件—動詞搭配表」的系統,這對安全攸關的應用(例如判斷使用者是否正確操作設備)尤其重要。

當科學點子也有基因:IdeaGene-Bench 如何檢驗 AI 是否讀懂研究傳承

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

Shanghai Jiao Tong UniversityYifan Zhou、Qihao Yang、Yan Li、Donggang Li、Xiru Hu、Hokin Deng、Ziyang Gong、Xuanyi Zhou30Hugging FacearXiv
AI benchmark科學創新LLM推理idea generationarXiv

背景

科學研究很少憑空出現。一篇新論文通常會繼承前人的核心機制、修補既有方法的已知缺陷、或是把兩三個不同領域的元件重新組合起來,形成新提案——這個過程其實很像生物演化裡的基因遺傳、突變與重組。然而,現有評測 AI 科學能力的 benchmark,大多只關心「這個點子好不好、新不新」,卻幾乎沒有工具能檢驗一個 AI 系統是否真的理解「這個點子是從哪裡來的、繼承了什麼、又改動了什麼」。

這正是本篇論文(arXiv:2607.08758,由 Yifan Zhou、Qihao Yang 等 17 位作者共同完成)想要填補的空白。作者提出 IdeaGene-Bench(簡稱 IG-Bench),第一個系統性評測「科學脈絡(lineage)推理」與「基於脈絡生成新點子」能力的 benchmark。其核心洞見是:如果一個 AI 系統要成為真正有用的「AI 科學家」,它不能只會產生看起來新穎的文字,而必須能像資深研究者一樣,看出一篇論文和其前驅工作之間的繼承關係、判斷一個新提案在整個研究族群(population)中處於什麼演化位置。

方法

論文設計了一套稱為 IdeaGene 的框架,把每一篇論文或研究提案拆解成一組「Idea Genome 物件」——這些物件是最小化、有類型標註、且都有證據支撐的知識單元(例如問題設定、核心機制、關鍵假設、實驗設計等),類似生物學裡的「基因」。

接著,作者引入 GenomeDiff 機制,用來對齊兩篇有親緣關係論文(父代與子代)之間的 Idea Genome 物件,並標註六種「演化動態(operational evolutionary dynamics)」:繼承(inheritance)、突變(mutation)、遺失(loss)、外部引入(external import)、全新插入(novel insertion),以及重組(recombination)。這套標註法讓「A 論文如何演變成 B 論文」變成一組可核對、可量化的結構化資料,而不是模糊的「受啟發於」描述。

基於這套框架,作者建構了規模不小的資料集:1,961 條黃金脈絡軌跡(golden lineage traces)1,085 個經人工整理的 Idea Genome 物件、以及 920 筆成對的 GenomeDiff 記錄,橫跨 10 個科學領域

評測分成兩大部分:

  1. IG-Exam:閉式(closed-form)推理測驗,涵蓋 42 種任務類型、共 1,029 個測試實例,測試四個層面的能力——Idea Genome 抽象化(能否從論文中萃取出正確的基因物件)、繼承追蹤(能否找出某個機制的來源)、演化推理(能否判斷某個改動屬於六種動態中的哪一種)、以及脈絡驗證(能否判斷一個宣稱的親緣關係是否成立)。

  2. IG-Arena:生成式評測,要求系統根據給定的一群「研究族群」脈絡,產出一個新的研究提案,並用 Population-Evolution Score(PES) 打分。PES 具體檢查三件事:新提案是否正確繼承了該有的 Idea Genome 物件、是否與鄰近既有工作有實質差異(而非換句話說)、以及是否對未來研究有「選擇價值」(selection value)——也就是這個突變是否值得被後續研究者繼續繼承下去。這種設計把達爾文式的「變異+選擇」邏輯直接搬進了生成評測的評分標準裡。

實驗結果

作者對 14 個 LLM-based「科學家」系統進行了完整測試(涵蓋主流大型語言模型與部分具備科學研究能力的 agent 系統)。結果顯示出明顯的「組合性瓶頸(compositional bottleneck)」:

  • 在 IG-Exam 的脈絡推理任務上,表現最好的系統精確準確率也只有 27.3%,遠低於一般語言理解類 benchmark 動輒 80-90% 的水準,顯示 AI 系統在「拆解基因、追蹤繼承、判斷演化類型」這類需要多步驟結構化推理的任務上仍非常吃力。
  • 更值得注意的是,當研究者提供「結構化的脈絡上下文」(也就是先把 Idea Genome 和 GenomeDiff 資訊整理好餵給模型)時,並非所有系統都因此獲益——有些模型的表現因此提升,有些反而下降或無感,導致整體排名發生重新洗牌(reshuffle)。這意味著「給更多結構化資訊」並不是放諸四海皆準的萬靈藥,不同模型消化、利用結構化上下文的能力差異很大。
  • 在 42 種任務類型中,不同能力維度的表現也高度不均:模型在「單點抽象化」(識別單一機制或概念)上相對較好,但在需要跨多篇論文比對、判斷演化路徑的任務上明顯掉分,凸顯出「多步驟串接式推理」是目前 LLM 的共同弱點,而不只是某個特定模型的問題。

Hugging Face 論文頁面的社群討論也提到一個延伸方向:未來或許可以量化「親代到子代的資訊轉換成本(step length)」,作為衡量一個科學突破「創新幅度」的客觀指標,這被認為是很有潛力的後續研究題目。

意義

IG-Bench 的貢獻不只是又一個「AI 生成論文點子」的評測,而是把「科學創新」這件事從單純的「新穎度打分」,往前推進到「演化脈絡是否合理」的層次。這個轉變很重要:一個看似新穎的提案,如果既無法追溯到任何合理的知識繼承,也說不清自己改動了前人工作的哪個部分,那麼它更可能是幻覺(hallucination)拼湊出的假新穎,而非真正紮根於既有知識體系的漸進式創新。

27.3% 的最高準確率也給整個「AI 科學家」(AI Scientist)研究方向敲了警鐘:目前業界許多宣稱能自動生成研究想法、甚至自動寫論文的系統,可能在「表面流暢度」上表現不錯,但在最基礎的「這個想法從哪裡來、繼承了誰」這種結構化溯源能力上,其實相當薄弱。這對於想把 LLM 用於文獻綜述、自動化科研輔助、甚至同儕審查輔助的團隊來說,是一個非常具體的能力缺口提示——在部署這類系統前,或許需要先用類似 IG-Exam 的脈絡推理測驗做把關,而不能只看生成內容是否「讀起來像一篇好論文」。

此外,結構化上下文「重新洗牌排名」而非「齊頭提升」的發現,也提醒開發者:单純堆疊 RAG 式的背景資料,並不保證模型能正確利用它。如何讓模型「消化」結構化的科學脈絡資訊,本身就是一個值得投入的模型能力面向,可能需要專門的訓練或 prompting 策略,而不是通用能力的自然延伸。整體而言,IG-Bench 為「讓 AI 真正理解科學是怎麼演化出來的」這個目標,提供了一把可量化、可重複驗證的尺,也讓後續研究者有了明確的改進標的與比較基準。

LingBot-World 2.0:打造無限延展、可即時互動的世界模擬器

Infinite Worlds with Versatile Interactions

RobbyantZelin Gao、Qiuyu Wang、Jiapeng Zhu、Jingye Chen、Zichen Liu、Qingyan Bai、Jiahao Wang、Yufeng Yuan29Hugging FacearXiv
世界模型影片生成diffusion transformeragentic AI即時互動

背景

近年來「世界模型」(world model) 成為生成式 AI 的熱門方向,目標是讓模型不只生成單張圖片或短片,而是能持續模擬一個可互動、可探索的虛擬世界,如同一款即時運算的遊戲引擎。此前版本 LingBot-World 已展示了基本的影片式世界模擬能力,但普遍面臨三個瓶頸:互動時間一長畫質就會劣化、回應速度跟不上即時操作的需求、可支援的互動動作種類有限。這次公布的 LingBot-World 2.0(又稱 LingBot-World-Infinity)由 Zelin Gao 領銜、Yujun Shen 等共 20 位研究者提出,arXiv 編號 2607.07534,論文於 2026 年 7 月 8 日提交,目標就是一次解決上述問題,並進一步把「代理人(agent)」的概念帶進世界建模領域。相較於 Google 的 Genie 3、HappyOyster 等同期系統,LingBot-World 2.0 宣稱是目前唯一能在通用領域(而非單一遊戲場景)做到「小時級無限生成時長」,同時兼顧高動態度、語意互動與即時效能的模型。

方法

系統核心是一個具因果注意力機制的 Diffusion Transformer(DiT),搭配 flow-matching 目標函式訓練,並設計了一種混合雙向與自迴歸注意力的機制(論文稱為 MoBA),讓自注意力層以下三角遮罩防止「偷看未來畫面」,同時避免因過度依賴長歷史脈絡而導致畫質崩壞。整體訓練分兩階段:第一階段是因果預訓練,讓每個影格只依賴其歷史內容生成,並整合相機姿態(以 Plücker embedding 表示)與逐段文字提示作為動作條件,搭配背景與全域提示路由做語意控制;第二階段是後訓練蒸餾,結合一致性蒸餾(Consistency Distillation)將多步驟擴散壓縮成少步生成,以及分布匹配蒸餾(DMD)透過 KL 散度梯度優化,特別加強長時自我 rollout 軌跡以減少誤差累積漂移。訓練資料則採三段式管線:蒐集第一人稱影片、Unreal Engine 合成遊戲畫面與網路影片;再以畫質、亮度、OCR 文字占比、運動統計等技術指標搭配視覺語言模型做語意篩選;最後產出全域字幕與逐段時序標註。最大亮點是「導演-駕駛員」雙代理人架構:導演代理人(VLM)負責因果推理、提出新的語意事件與合理的時空進場點;駕駛員代理人則將這些語意決策落實為物理一致的影片畫面,執行角色行為,並支援兩種互動模式——直接語意互動,以及結合 SAM(Segment Anything Model)的追蹤式物件互動,讓使用者能精準操控特定物體。此外也開發了讓多名玩家同時進入同一世界的介面,操作方式包含 WASD 移動、IJKL 視角控制、空白鍵跳躍、P 鍵滑翔,以及右側顯示 VLM 提議事件的快捷鍵綁定區。

實驗結果

模型分為兩個規模:主力 14B 參數版本,以及 1.3B 輕量版本可在單張 GPU 上輕鬆部署。透過從基礎模型蒸餾出即時版本,系統可驅動 720p、60fps 的影片串流,並在推論端結合編譯器最佳化注意力核心、多 GPU 混合平行推論、動態 KV 快取排程,以及以 TensorRT 進行的空間超解析與時間插幀,以降低首幀延遲。實測顯示模型能連續生成超過 60 分鐘而不出現明顯畫質劣化,支援攻擊、射箭、施法、射擊等多樣動作與更豐富的文字驅動事件。與 HappyOyster、Genie 3 及開源系統(如 M-G 3.0、D-W)相比,論文強調 LingBot-World 2.0 是唯一能同時達成小時級無限生成、高動態度、語意互動與即時效能的通用領域模型;相較於同屬因果生成路線的 MAGI-1、Worldplay,在長時間生成下的紋理清晰度與幾何穩定性也更具優勢。不過論文也坦承限制:模型缺乏真正的世界記憶,重新造訪同一區域時是「重新生成」而非「回憶」原本狀態;長時間 rollout 下角色外觀會有輕微漂移;由於是像素級學習而非顯式幾何/碰撞建模,偶爾會出現物體穿插等不合理物理現象;即時運行仍需要相當可觀的算力支援。

意義

LingBot-World 2.0 的價值不只在於把生成時長從「幾秒到幾分鐘」推進到「小時級無限」,更關鍵的是它示範了如何把 agent 架構嵌入世界模型:導演代理人負責敘事與環境演化的高層規劃,駕駛員代理人負責低層的視覺與物理落地,這種分工讓世界模擬器第一次具備類似遊戲引擎「劇情/AI 導演」的能力,而非單純被動回應玩家輸入。搭配 14B/1.3B 雙規格與多人共享介面,也讓這類技術從研究原型往可實際部署的互動娛樂產品邁進一步——1.3B 版本的單 GPU 部署門檻,意味著未來獨立開發者或中小型工作室也有機會用得起這類世界模擬技術。對整個生成式世界模型領域而言,這篇工作提供了一套完整的因果預訓練 + 蒸餾 + agentic harness 範式,後續研究者可以在此基礎上進一步解決記憶一致性與物理正確性的問題,朝向真正「可持久存在、可信賴互動」的虛擬世界邁進。