LongE2V:借助影片擴散模型,重建、預測與補幀事件相機的長時間影片
LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
背景
事件相機(event camera)是一種與傳統相機截然不同的感光元件:它不會像一般攝影機那樣每隔固定時間輸出一張完整畫面,而是只在畫面亮度發生變化時,針對「有變化的像素」非同步地送出訊號(事件流)。這種機制讓事件相機擁有極高的時間解析度、極低延遲、以及在強光/暗處都不容易過曝或死黑的優勢,因此在高速攝影、機器人視覺、自動駕駛等場景很受青睞。但事件流本身是稀疏、離散的訊號,並不是人眼習慣的「影片」,如何把事件流「翻譯」回高品質、連續的畫面,一直是這個領域的核心難題,一般稱為 E2V(Event-to-Video)任務。
過去主流做法分成兩派。一派是「回歸式」(regression)方法,例如 E2VID、FireNet 等,用類神經網路直接從事件體素(voxel)回歸出畫面像素值。這類方法穩定、速度快,但因為是逐像素的確定性預測,容易產生模糊、缺乏細節紋理的畫面,尤其在事件稀疏、資訊不足的區域特別明顯。另一派是近年興起的「生成式」方法,借助擴散模型(diffusion model)強大的紋理生成能力來補足細節,例如 VDM-EVFI 這類以影片擴散模型為基礎的方法。生成式方法畫面更清晰真實,但一旦要生成長影片(例如幾百甚至上千幀),就容易發生「時間漂移」(temporal drift):畫面內容會逐漸失真、物件身分漂移、或前後幀不連貫。此外,事件相機的三個常見任務——從事件重建影片(reconstruction)、往未來預測影片(prediction)、以及在兩幀之間補幀(frame interpolation)——過去通常各自訓練專屬模型,缺乏一個統一、高效率又能長時間穩定運作的框架。
這篇論文由陽明交通大學團隊(劉育綸為通訊作者)提出 LongE2V,發表於 SIGGRAPH 2026,正是要解決「生成式方法長時間不穩定」與「三任務各自為政」這兩個痛點,目標是用同一套基於預訓練影片擴散模型的框架,同時處理重建、預測、補幀三項任務,並且能穩定生成長達上千幀的高品質影片。
方法
LongE2V 的基礎骨幹是 CogVideoX 這款影片擴散 Transformer(I2V,image-to-video 版本),每次輸出 49 幀、解析度 720×480 的片段。作者沒有從零訓練整個大模型,而是用 LoRA(rank 64)微調 DiT 區塊,並額外全參數微調第一層投影層,這讓模型能在資料量有限的情況下(訓練集僅用 BS-ERGB 訓練集的 7,636 幀)高效地把「事件流條件」注入到原本以文字/影像為條件的影片擴散先驗中。
為了解決長影片生成的時間漂移問題,論文提出兩個關鍵技巧:
Autoregressive Unrolling(自迴歸展開訓練):一般訓練時模型看到的「上下文幀」都是真實(ground truth)畫面,但推論時上下文其實是模型自己先前生成的預測畫面,兩者存在明顯的訓練/推論落差(exposure bias)。作者的做法是先用 3,000 步以真實幀作為上下文訓練,之後再進行三輪、每輪 3,000 步的訓練,逐步把上下文替換成模型自己生成的預測結果,讓模型提前「適應」自己會犯的錯誤,而不是等到推論時才第一次面對誤差累積。
Adaptive Context Switching(自適應上下文切換):模型維持一個 20 幀的上下文視窗,但不是每產生一個新片段就無腦更新上下文,而是計算當前 token 對上下文 token 的平均注意力權重,只有當這個相關性低於門檻值 τ=0.05 時才觸發上下文更新。這樣可以避免因為「每個片段都強制切換上下文」而產生的網格狀接縫瑕疵(grid artifacts),同時避免上下文太舊而導致內容漂移。
在補幀任務上,兩幀之間常見的做法是分別做「前向生成」與「反向生成」再融合,但在 3D VAE 的潛在空間(latent space)裡,正向與反向的隱表示存在時間上的不對齊問題。作者提出 Reencoding Alignment with Cross Residual Correction:先把預測出的潛在向量解碼回像素空間,在像素空間做時間軸翻轉後重新編碼(re-encode),藉此讓正反向分支對齊;再透過 Cross Residual Correction,把正向、反向分支各自遺漏、但對方保留下來的殘差細節互相補回去,避免重編碼過程造成的資訊流失與重影(ghosting)。實驗顯示這個殘差修正模組能讓 LPIPS(感知相似度指標,數值越低越好)改善 0.037,足見其對畫質細節的貢獻。
最後,考慮到不同事件相機感測器解析度差異很大,作者設計 Event Voxel Density Augmentation:訓練時在保持長寬比與稀疏統計特性的前提下,把事件體素隨機縮放到 [Sₘᵢₙ, Sₘₐₓ] 範圍內,讓模型見過各種密度的事件輸入,推論時遇到訓練集沒看過的感測器解析度也不容易出現色偏或偽影。
實驗結果
作者在四個真實世界資料集上驗證:ECD(1,855 幀)、MVSEC(11,321 幀)、HQF(15,499 幀),以及 BS-ERGB 測試集(4,546 幀)。
在重建任務上,LongE2V 在 ECD、MVSEC、HQF 三個資料集的 LPIPS 分數上全面超越既有 SOTA 方法,包括 E2VID+、FireNet+、HyperE2VID 等回歸式方法,顯示在感知畫質(而非單純像素誤差)上有明顯優勢。
在預測任務上,與同樣基於影片擴散模型的 VDM-EVFI 相比,LongE2V「在所有指標、所有資料集上」都顯著勝出,而且在長達 2,740 幀的超長序列生成中,依然維持良好的時間穩定性——這正是論文標題強調的 "Long-Horizon" 能力所在。用 VBench 的 Subject Consistency(主體一致性)指標衡量長期時間一致性,LongE2V 的重建任務得分達到 0.7204,明顯優於 VDM-EVFI 基準,說明畫面中的物件身分與結構在長時間生成過程中不會逐漸走樣。
在補幀任務上(以 31 幀跳幀的高難度零樣本設定測試),LongE2V 甚至超越了專門針對補幀訓練的監督式方法 CBMNet-Large 與 TLXNet+,LPIPS 分數更佳、紋理保留更好。論文特別提到,在含有動態文字的場景中,LongE2V 是唯一能重建出「清晰可辨識文字」的方法,這對評估細節保真度是很直觀的示範。
消融實驗(ablation study)方面也驗證了各模組的必要性:完全不用預訓練擴散先驗、從零訓練會直接無法收斂;拿掉上下文機制會造成嚴重誤差累積;拿掉 Autoregressive Unrolling 則訓練/推論落差明顯拖累品質;拿掉 Adaptive Context Switching 會出現前面提到的網格狀接縫瑕疵。在補幀部分,拿掉 Reencoding Alignment 會導致明顯模糊,拿掉 Cross Residual Correction 則出現重影。此外作者也展示了一個額外能力:在訓練時以 20% 機率加入文字提示詞,模型可以做到「事件流決定動作結構、文字決定色彩風格」的文字引導上色生成,把幾何結構與色彩風格解耦。效率方面,LongE2V 在同為擴散模型的框架中推論效率較佳,雖仍比非擴散的 E2VID 慢,但相較 VDM-EVFI 有明顯優勢。
論文也誠實列出限制:對於事件流過於稀疏或品質很差的輸入,模型表現會下降;此外對「熱像素」(hot pixel,感測器雜訊)較敏感,重建結果有時會保留甚至放大這些雜訊點。
意義
LongE2V 的價值不只在於刷新了幾個 benchmark 的分數,更在於它示範了一條可行路線:與其為事件相機的重建、預測、補幀三個任務分別訓練專用模型,不如站在強大的預訓練影片擴散先驗肩膀上,用少量資料(僅 7,636 幀訓練集)透過 LoRA 微調,就能同時打通三個任務,並在效率與畫質之間取得平衡。這對資料量普遍稀缺的事件相機領域特別重要,因為真實世界的高品質事件-影片配對資料採集成本很高。
更關鍵的是,Autoregressive Unrolling 與 Adaptive Context Switching 這兩個技巧針對的是「生成式長影片穩定性」這個更廣泛的問題——不只事件相機,任何需要自迴歸生成超長影片的任務(如世界模型、長時間影片生成、機器人規劃模擬)都會遇到類似的訓練/推論落差與上下文漂移問題。這篇論文提出的解法思路簡單、可操作性強,有機會被其他長影片生成研究借鏡。而 Reencoding Alignment 與 Cross Residual Correction 針對 3D VAE 潛在空間中前後向不對齊的觀察,也為使用影片擴散模型做時間軸雙向任務(如補幀、影片修復)提供了新的技術視角。
對於自動駕駛感知、高速機器人視覺、AR/VR 內容重建等下游應用而言,一個能穩定生成長時間、高感知品質影片的事件相機重建系統,意味著事件相機的資料可以更容易地被人類使用者觀看、被既有的電腦視覺 pipeline(通常以標準影片為輸入)直接複用,進一步降低事件相機技術落地的門檻。這篇被 SIGGRAPH 2026 接受的工作,某種程度上也反映了「影片擴散模型作為通用視覺先驗」這個趨勢正在從單純的內容生成,擴展到感測器訊號重建這類更偏工程應用的領域。