← 目錄

K1 論文詳解

2026-07-11


Vidu S1:讓數位角色即時聽懂你說話的影片生成模型

Vidu S1: A Real-Time Interactive Video Generation Model

Tsinghua UniversityJintao Zhang、Kai Jiang、Jintao Chen、Xu Wang、Yang Luo、Yuji Wang、Dechuang Chen、Jungang Li108Hugging FacearXiv
視訊生成即時互動diffusion model語音控制AIGC

背景

過去兩年,文字轉影片(text-to-video)模型在畫質與長度上進步飛快,但幾乎所有主流方法(例如 Sora 類系統)都採用「一次性批次生成」:使用者輸入一段提示詞,模型花費數十秒甚至數分鐘離線算完整段影片,中途無法插手,更別說即時互動。這對「數位分身」、虛擬主播、互動式陪伴角色這類場景是硬傷——使用者沒辦法在角色講話講到一半時,臨時用語音下指令改變它的動作、表情或話題。

由清華大學團隊(27 位作者,以 Jintao Zhang 為首)提出的 Vidu S1,正是針對這個缺口而生。這篇論文於 2026 年 7 月 3 日發布於 arXiv(編號 2607.03118),同時在 Hugging Face Papers 上以 108 個 upvote 拿下當日「#1 Paper of the day」,對應的 GitHub 專案也累積了 141 顆星,顯示業界對「即時互動式影片生成」這個方向的高度關注。Vidu S1 的目標很直接:讓使用者可以「隨時用語音控制」正在生成中的數位角色影片,而且要能無限長度地輸出、不模糊、不漂移、不失真,同時速度快到能在一般消費級顯示卡上跑。

方法

Vidu S1 的核心技術基礎是兩個自研框架:TurboDiffusion 與 TurboServe。TurboDiffusion 負責把擴散模型(diffusion model)的去噪(denoising)推論流程壓縮到極致——一般影片擴散模型動輒需要數十步迭代去噪才能產生一張清晰畫面,而即時互動場景要求每一幀都要在毫秒等級內生成完畢,因此需要在取樣步數、模型結構與運算精度上做大幅優化,才能兼顧速度與畫質。TurboServe 則是對應的服務端(serving)推論框架,負責把模型部署成能夠持續串流輸出、支援長時間不間斷生成的服務,同時處理語音輸入的即時解析與注入,讓「使用者說話→模型調整生成內容」這個回饋迴路可以在同一個推理管線裡低延遲完成。

系統設計上,Vidu S1 支援使用者上傳「真人、動漫角色、寵物」等不同類型的自訂圖片作為數位角色的外觀基底,再選擇不同的語音音色(voice tone)來搭配角色,達到高度個人化的互動體驗。而「無限長度生成」是另一個關鍵能力——傳統影片擴散模型在生成長影片時,常見問題是誤差隨著幀數累積而放大,導致畫面逐漸模糊、角色形狀漂移、色彩失真;Vidu S1 宣稱透過架構設計解決了這個長期痛點,讓角色可以連續互動而不崩壞。整體而言,這篇論文與其說是單一模型的算法創新,更像是一套「模型+推論引擎+服務框架」三位一體的系統工程,目的是把最先進的影片擴散生成能力,壓縮進消費級硬體能負擔的即時延遲預算內。

實驗結果

論文摘要指出,Vidu S1 在輸出解析度上達到 540p,幀率最高可達每秒 42 幀(42 FPS),且是在「一般消費級 GPU」上跑出來的結果——這意味著不需要多卡 A100/H100 叢集,一般玩家或中小型開發團隊也有機會部署。42 FPS 已經超過大多數串流影片常見的 30 FPS 標準,足以支撐流暢的即時互動觀感,而 540p 的解析度雖然不算頂級 4K/1080p,但對於即時語音互動角色這類應用場景(重點在反應速度與角色連貫性而非電影級畫質)是相當務實的取捨。

在實驗評測方面,團隊表示 Vidu S1「在所有測試指標上都取得最佳表現(achieves the best performance across all test metrics)」,同時完全滿足即時推論的延遲需求。雖然目前公開的論文頁面與摘要並未列出與其他即時影片生成系統(如業界其他串流數位人方案)逐項比較的具體數字或基準名稱,但結合其在 Hugging Face 上獲得 108 個 upvote、被選為當日熱門論文第一名的社群反應來看,顯示同行對其展示效果的認可度相當高。專案也提供了可直接遊玩的線上 demo(vidu.com/vidu-stream)以及對應的 API 服務(platform.vidu.com/live/landing),讓外部使用者能實際驗證「無模糊、無漂移、無限長度」的宣稱是否成立,這種公開可驗證的呈現方式,在影片生成論文中相對少見,也提高了結果的可信度。

意義

Vidu S1 代表的是影片生成技術從「離線批次產出一段成品」轉向「即時、可對話、可持續互動」的一次典範轉移。過去語音驅動的數位人產品多半依賴預錄動作庫、關鍵幀拼接或輕量級 2D 唇形同步技術,畫面自由度與擬真度有限;而 Vidu S1 把重量級的影片擴散模型直接搬進即時互動迴路,並證明消費級硬體也能撐起 42 FPS、540p 的串流輸出,等於把「電影級生成品質」與「遊戲級互動延遲」這兩個過去互斥的目標,往同一個系統裡收斂。

對應用面而言,這樣的技術一旦成熟,虛擬主播、AI 陪伴角色、客服數位人、遠距教學助教等場景都可能出現體驗上的躍升——使用者不再只是「看一段生成好的影片」,而是能像跟真人視訊一樣,隨時打斷、隨時提出新的要求,角色也能即時做出對應的表情與動作變化。TurboDiffusion 與 TurboServe 這兩個工程框架的價值,也不僅限於 Vidu S1 本身,其背後「加速擴散模型取樣+高吞吐串流服務」的思路,對整個即時生成式 AI(包含即時圖片生成、即時 3D 內容生成)都具有參考意義。當然,目前論文尚未公開詳細的消融實驗、與競品的逐項基準對比,以及長時間運行下是否真能完全避免品質衰退的長期壓力測試,這些都是後續需要更多獨立驗證的地方,但作為「即時互動影片生成」這個新賽道的早期指標性成果,Vidu S1 已經展示了相當有說服力的可行性。

Video-Oasis:戳破影片理解 benchmark 的假象,一半題目根本不用看影片

Video-Oasis: Rethinking Evaluation of Video Understanding

NAVERGeuntaek Lim、Sungjune Park、Jaeyun Lee、Inwoong Lee、Taeoh Kim、Dongyoon Wee、Minho Shim、Yukyung Choi43Hugging FacearXiv
Video-LLMbenchmark評測多模態AI影片理解ECCV2026

背景

近年來 Video-LLM(影片多模態大型語言模型)發展迅速,各種宣稱能評估「高階推理能力」的 benchmark 也如雨後春筍般出現。但一個長期被忽視的根本問題是:這些 benchmark 上的高分,究竟是模型真的看懂了影片的視覺內容與時間變化,還是單靠語言推理或訓練時累積的世界知識「猜」出來的?換句話說,很多題目可能不需要真正的視覺感知或時序理解,僅憑字幕、對白或常識就能作答。

由 Sejong University 與 NAVER Cloud 團隊(Geuntaek Lim、Sungjune Park 等人)共同發表、將發表於 ECCV 2026 的論文《Video-Oasis: Rethinking Evaluation of Video Understanding》,並沒有選擇再推出「又一個」新 benchmark,而是選擇往回退一步,重新檢視現有評測標準本身是否可靠。他們打造了一套名為 Video-Oasis 的「可持續診斷工具組」(sustainable diagnostic suite),專門用來系統性稽核既有的影片理解 benchmark,找出其中的「捷徑」(shortcut)題目。

方法

Video-Oasis 的診斷框架分成三大類測試:

視覺依賴性測試:透過「盲測」(完全不給模型看影片畫面)、僅提供音訊轉錄文字、或僅提供字幕/caption 摘要三種方式重新讓模型作答,藉此檢查一道題目是否即使沒有真正的視覺輸入也能被解出。

時序依賴性測試:包含只給模型看影片中間單一幀(center-frame)、把影片幀順序打亂(frame-shuffling)、以及把所有幀當作無序集合輸入(bag-of-frames matching),藉此判斷題目是否真的需要理解時間順序與動作變化,還是隨便看一幀或亂序輸入都能矇對。

模糊性驗證:結合人工審核(human-in-the-loop),透過一致性檢查、重複性分析與敏感度驗證,找出標註品質有問題、答案模糊不清的樣本。

團隊將這套流程套用在 14 個具代表性的既有 benchmark 上,總共涵蓋 24,416 筆問答資料、來自 4,938 支獨立影片。經過稽核後發現,高達 55% 的樣本可以在完全不使用視覺輸入或時序脈絡的情況下被正確解答——也就是說,超過一半的題目根本測不出模型的「影片理解」能力。若依題型細分,空間類題目的捷徑比例最高,達 58.8%,時序類題目為 54.4%,推理類題目相對較低但仍有 44.6%。

過濾掉這些可被「抄捷徑」解決的樣本後,剩下 11,033 筆真正需要影片原生(video-native)理解能力的題目,構成了一個更純淨的測試集,團隊進一步用它作為「試驗場」,探究哪些演算法設計選擇(例如取樣策略、時序建模方式等)真正有助於提升穩健的影片理解能力。

實驗結果

在這批經過過濾、真正需要視覺與時序理解的高難度題目上,研究團隊評測了多種代表性模型,涵蓋商用閉源模型(GPT-4o、Gemini-2.5-Pro)、開源 Video-LLM(Qwen3-VL、Eagle2.5、InternVL-3.5、VideoAuto-R1),以及具備多步驟推理設計的 agentic 方法(VideoTree、STAR)。

結果相當令人警醒:表現最好的 Gemini-2.5-Pro 準確率也只有 46.7%,而許多其他模型的表現則幾乎貼近隨機猜測基準線(約 25.6%)。換言之,一旦拿掉可以靠語言先驗或單幀資訊矇對的「假題目」,當前最先進的 Video-LLM 在真正的影片理解任務上其實表現得相當糟糕,遠不如它們在原始、未過濾 benchmark 上動輒 6、70% 甚至更高的亮眼分數所暗示的能力。分析進一步指出,「全域敘事理解」(global narrative understanding,即需要整合整段影片脈絡才能回答的問題類型)是當前模型最主要的瓶頸所在。

意義

Video-Oasis 這篇工作的核心貢獻,並不是提出另一個更難的 benchmark,而是提供了一套可重複使用的「稽核方法論」,用來檢驗既有及未來 benchmark 的含金量。它揭露了一個業界長期心照不宣卻少被量化的問題:目前許多影片理解 benchmark 上的進步,有相當比例其實反映的是語言模型的常識推理與捷徑利用能力,而非真正的視覺時序理解能力提升。

這項研究對整個 Video-LLM 領域有兩層實際意義:第一,對於評測基準的設計者而言,未來構建 benchmark 時必須主動加入類似 Video-Oasis 的盲測、亂序測試等稽核步驟,才能確保分數真實反映視覺與時序能力,而不是被語言先驗「灌水」;第二,對於模型研發者而言,11,033 筆過濾後的「真影片」題目集提供了一個更誠實的能力天花板參照——目前最強模型也僅有 46.7% 準確率,說明業界距離真正穩健的影片理解還有很長的路要走,尤其是在需要整合全片脈絡的敘事理解上。團隊已將程式碼公開於 GitHub(sejong-rcv/Video-Oasis),為後續研究者提供了可直接套用的稽核工具,有望推動整個社群朝更嚴謹、更誠實的評測文化邁進。

LingBot-Video:用混合專家架構打造面向具身智慧的影片基礎模型

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

RobbyantShuailei Ma、Jiaqi Liao、Xinyang Wang、Jingjing Wang、Chaoran Feng、Zijing Hu、Chong Bao、Zichen Xi43Hugging FacearXiv
MoE影片生成具身智慧機器人DiT

背景

近年來影片生成模型(如 Sora、Wan、CogVideoX 等)在視覺品質與創意表現上突飛猛進,但這些模型的訓練目標從一開始就是為了「內容創作」服務——追求畫面美感、色彩豐富度與敘事創意,而非物理世界的真實規律。這種設計取向導致一個明顯的落差:當研究者試圖把影片生成模型拿來當作機器人(embodied intelligence,具身智慧)的世界模型或動作規劃器時,模型經常生成違反物理常識的畫面,例如物體穿模、抓取後懸空不落下、或動作軌跡不連貫,這些問題在娛樂用途裡無傷大雅,但套用到機器人控制上就是致命缺陷。

同時,通用影片生成模型的推論成本也偏高。要讓機器人即時根據視覺輸入做決策,模型必須兼顧「表達能力」與「推論效率」,但目前主流的 dense(稠密)transformer 架構在擴大模型容量時,推論算力會同步線性增加,難以在機器人這種對延遲敏感的場景中部署。

基於以上兩個痛點——物理真實性不足、效率與容量難以兼得——本篇論文提出 LingBot-Video,一個專門為具身智慧設計的 DiT(Diffusion Transformer)影片預訓練範式,並將其作為開源社群首個大規模 Mixture-of-Experts(MoE,混合專家)影片基礎模型釋出。

方法

LingBot-Video 從架構、資料、訓練三個面向同時著手改造傳統影片生成模型:

架構面:團隊放棄了傳統的 dense DiT 設計,改採 MoE 架構,並且是「從零開始(from scratch)」把 MoE 擴大訓練,而非把既有 dense 模型後續改造成 MoE。團隊同時釋出了 dense 版本(1.3B 參數)作為對照/輕量版本,以及主打的 MoE 版本——總參數量達 30B,但每個 token 實際啟動(active)的參數僅約 3B。這種「大容量、小啟動量」的設計讓模型在保有更強表徵能力的同時,推論速度相較同規模 dense 模型提升約 3 倍,達成容量與效率的更好平衡。

資料面:團隊建構了一套「資料剖析引擎(data profiling engine)」,在標準的網路影片語料之外,額外注入超過 70,000 小時 的機器人導向影片素材,涵蓋三大類:機械臂/靈巧手的操作(manipulation)、機器人在空間中的導航(navigation),以及第一人稱視角(egocentric)影片。這批資料的用意是讓基礎模型從預訓練階段起就內建對「動作」與「世界動態」的理解,而不是只學會網路影片裡常見的人類活動與鏡頭語言。

訓練面:除了業界慣用的美感(aesthetics)、指令遵循(prompt-following)、動作一致性等獎勵訊號之外,LingBot-Video 額外設計了一套多維度獎勵系統(multi-dimensional reward system),把「物理合理性」與「任務完成度」也納入對齊目標。換句話說,模型在生成影片時不僅要「畫得漂亮、聽指令」,還要「符合物理定律」且「動作真的能達成任務」,這是專門針對機器人應用場景補上的訓練訊號,也是與一般內容創作類影片模型最大的方法論差異。

在工程實作上,LingBot-Video 支援 Text-to-Image (T2I)、Text-to-Video (T2V)、Text-to-Image-to-Video (TI2V) 以及僅 MoE 版本才有的 Refinement(細化)任務,並提供多 GPU 的 FSDP 分片推論、FP8 量化與 SGLang Diffusion 後端等效率最佳化選項,方便社群在有限硬體上部署這個 30B 規模的模型。

實驗結果

論文以 RBench 這個針對具身/機器人情境設計的評測榜單來檢驗模型表現。結果顯示,LingBot-Video 的平均分數達到 0.620,在所有開源模型中排名第一,超越了另一個強力對手 Cosmos3 Super 的 0.581 分。細分項目中,LingBot-Video 在「人形機器人(Humanoid)」任務上拿下 0.689 的高分,在「操作(Manipulation)」任務上則有 0.578 的表現,顯示其在需要精細動作理解的場景中優勢明顯。

除了 RBench 之外,團隊也進行了內部的多維度評測,分別檢視「品質類」指標(包含動作流暢度 Motion、指令遵循 Prompt Following、視覺一致性 Visual Consistency、美感 Aesthetics)以及「領域類」指標(人機互動 Human Interaction、物理合理性 Physics、機器人動作 Robot、第一人稱視角 Egocentric、導航 Navigation)。這種雙軌評測設計呼應了論文方法論上「創作品質」與「物理/任務對齊」並重的訓練目標,證明多維度獎勵系統確實在對應的評測維度上帶來實質提升。

效率方面,30B 總參數、3B 啟動參數的 MoE 設計,相較同等表達能力的 dense 模型,推論速度提升約 3 倍,這對於需要接近即時反饋的機器人應用而言是關鍵指標——模型不必犧牲容量就能換取可用的推論延遲。

意義

LingBot-Video 的價值不只在於刷新了一個榜單分數,而在於它示範了一條「把影片生成模型從內容創作工具,轉化為機器人世界模型」的具體路徑。過去業界普遍直接借用 Sora、Wan 這類為視覺創作優化的模型去做機器人策略學習或世界模型模擬,如今 LingBot-Video 證明:只要在架構(MoE 換取效率)、資料(注入操作/導航/第一人稱這類具身資料)、獎勵(補上物理合理性與任務完成度)三個環節做針對性設計,就能訓練出同時兼顧生成品質與物理真實性的專用基礎模型。

更重要的是,團隊將其定位為「首個大規模、開源的 MoE 影片基礎模型」貢獻給社群,這代表其他研究團隊或新創公司不必再從零摸索如何把 MoE 擴大到影片生成領域,也不必自行蒐集龐大的機器人影片語料,而是可以直接在這個開源模型基礎上進行微調(fine-tuning),應用於自己的機械臂、人形機器人或自動導航專案。對於機器人與具身智慧產業而言,這種「數位創意」與「物理致動」之間的橋樑,有機會加速世界模型(world model)在真實機器人策略訓練、模擬到真實遷移(sim-to-real)、以及動作規劃等下游任務中的落地應用,是連接生成式 AI 與物理世界智能體的重要一步。