Vidu S1:讓數位角色即時聽懂你說話的影片生成模型
Vidu S1: A Real-Time Interactive Video Generation Model
背景
過去兩年,文字轉影片(text-to-video)模型在畫質與長度上進步飛快,但幾乎所有主流方法(例如 Sora 類系統)都採用「一次性批次生成」:使用者輸入一段提示詞,模型花費數十秒甚至數分鐘離線算完整段影片,中途無法插手,更別說即時互動。這對「數位分身」、虛擬主播、互動式陪伴角色這類場景是硬傷——使用者沒辦法在角色講話講到一半時,臨時用語音下指令改變它的動作、表情或話題。
由清華大學團隊(27 位作者,以 Jintao Zhang 為首)提出的 Vidu S1,正是針對這個缺口而生。這篇論文於 2026 年 7 月 3 日發布於 arXiv(編號 2607.03118),同時在 Hugging Face Papers 上以 108 個 upvote 拿下當日「#1 Paper of the day」,對應的 GitHub 專案也累積了 141 顆星,顯示業界對「即時互動式影片生成」這個方向的高度關注。Vidu S1 的目標很直接:讓使用者可以「隨時用語音控制」正在生成中的數位角色影片,而且要能無限長度地輸出、不模糊、不漂移、不失真,同時速度快到能在一般消費級顯示卡上跑。
方法
Vidu S1 的核心技術基礎是兩個自研框架:TurboDiffusion 與 TurboServe。TurboDiffusion 負責把擴散模型(diffusion model)的去噪(denoising)推論流程壓縮到極致——一般影片擴散模型動輒需要數十步迭代去噪才能產生一張清晰畫面,而即時互動場景要求每一幀都要在毫秒等級內生成完畢,因此需要在取樣步數、模型結構與運算精度上做大幅優化,才能兼顧速度與畫質。TurboServe 則是對應的服務端(serving)推論框架,負責把模型部署成能夠持續串流輸出、支援長時間不間斷生成的服務,同時處理語音輸入的即時解析與注入,讓「使用者說話→模型調整生成內容」這個回饋迴路可以在同一個推理管線裡低延遲完成。
系統設計上,Vidu S1 支援使用者上傳「真人、動漫角色、寵物」等不同類型的自訂圖片作為數位角色的外觀基底,再選擇不同的語音音色(voice tone)來搭配角色,達到高度個人化的互動體驗。而「無限長度生成」是另一個關鍵能力——傳統影片擴散模型在生成長影片時,常見問題是誤差隨著幀數累積而放大,導致畫面逐漸模糊、角色形狀漂移、色彩失真;Vidu S1 宣稱透過架構設計解決了這個長期痛點,讓角色可以連續互動而不崩壞。整體而言,這篇論文與其說是單一模型的算法創新,更像是一套「模型+推論引擎+服務框架」三位一體的系統工程,目的是把最先進的影片擴散生成能力,壓縮進消費級硬體能負擔的即時延遲預算內。
實驗結果
論文摘要指出,Vidu S1 在輸出解析度上達到 540p,幀率最高可達每秒 42 幀(42 FPS),且是在「一般消費級 GPU」上跑出來的結果——這意味著不需要多卡 A100/H100 叢集,一般玩家或中小型開發團隊也有機會部署。42 FPS 已經超過大多數串流影片常見的 30 FPS 標準,足以支撐流暢的即時互動觀感,而 540p 的解析度雖然不算頂級 4K/1080p,但對於即時語音互動角色這類應用場景(重點在反應速度與角色連貫性而非電影級畫質)是相當務實的取捨。
在實驗評測方面,團隊表示 Vidu S1「在所有測試指標上都取得最佳表現(achieves the best performance across all test metrics)」,同時完全滿足即時推論的延遲需求。雖然目前公開的論文頁面與摘要並未列出與其他即時影片生成系統(如業界其他串流數位人方案)逐項比較的具體數字或基準名稱,但結合其在 Hugging Face 上獲得 108 個 upvote、被選為當日熱門論文第一名的社群反應來看,顯示同行對其展示效果的認可度相當高。專案也提供了可直接遊玩的線上 demo(vidu.com/vidu-stream)以及對應的 API 服務(platform.vidu.com/live/landing),讓外部使用者能實際驗證「無模糊、無漂移、無限長度」的宣稱是否成立,這種公開可驗證的呈現方式,在影片生成論文中相對少見,也提高了結果的可信度。
意義
Vidu S1 代表的是影片生成技術從「離線批次產出一段成品」轉向「即時、可對話、可持續互動」的一次典範轉移。過去語音驅動的數位人產品多半依賴預錄動作庫、關鍵幀拼接或輕量級 2D 唇形同步技術,畫面自由度與擬真度有限;而 Vidu S1 把重量級的影片擴散模型直接搬進即時互動迴路,並證明消費級硬體也能撐起 42 FPS、540p 的串流輸出,等於把「電影級生成品質」與「遊戲級互動延遲」這兩個過去互斥的目標,往同一個系統裡收斂。
對應用面而言,這樣的技術一旦成熟,虛擬主播、AI 陪伴角色、客服數位人、遠距教學助教等場景都可能出現體驗上的躍升——使用者不再只是「看一段生成好的影片」,而是能像跟真人視訊一樣,隨時打斷、隨時提出新的要求,角色也能即時做出對應的表情與動作變化。TurboDiffusion 與 TurboServe 這兩個工程框架的價值,也不僅限於 Vidu S1 本身,其背後「加速擴散模型取樣+高吞吐串流服務」的思路,對整個即時生成式 AI(包含即時圖片生成、即時 3D 內容生成)都具有參考意義。當然,目前論文尚未公開詳細的消融實驗、與競品的逐項基準對比,以及長時間運行下是否真能完全避免品質衰退的長期壓力測試,這些都是後續需要更多獨立驗證的地方,但作為「即時互動影片生成」這個新賽道的早期指標性成果,Vidu S1 已經展示了相當有說服力的可行性。