← 目錄

K1 論文詳解

2026-07-09


AlayaWorld:全端開源的長時間、可互動影片世界生成框架

AlayaWorld: Long-Horizon and Playable Video World Generation

AlayaWorld Team、Kaipeng Zhang、Chuanhao Li、Yifan Zhan、Yongtao Ge、Yuanyang Yin、Jiaming Tan、Kang He74Hugging FacearXiv
世界模型影片生成遊戲AI開源框架Diffusion Transformer

背景

傳統遊戲世界的打造仰賴龐大的美術、關卡設計與程式團隊,一磚一瓦手工搭建場景、規則與互動邏輯,不僅開發成本高昂,上線後想要客製化或修改也十分困難。近年來,「影片世界模型」(video world model)提出了一種截然不同的思路:模型不再顯式地編寫世界的每個元件,而是根據「目前的世界狀態」與「使用者的操作輸入」,以自回歸(autoregressive)方式即時生成下一幀畫面,讓一個「可玩的世界」在使用者互動的當下被動態合成出來,而不是提前做好放在硬碟裡。這類模型同時在遊戲錄影與真實世界影片上訓練,因此能同時掌握多樣化的視覺風格與物理動態規律,應用範圍也不僅限於遊戲——像是具身智能(embodied intelligence)的訓練與模擬環境同樣能受益。然而,這類研究過去大多以封閉的 demo 形式呈現,缺乏可重現的完整流程。AlayaWorld 正是在這個背景下,由 Kaipeng Zhang、Chuanhao Li 等作者提出的一套「全端開源」框架,試圖把資料準備、模型架構、訓練、推論加速到部署,整套流程都公開出來。

方法

AlayaWorld 的核心生成模型以 LTX-2.3 為基底微調而成,骨幹是一個自回歸的 Diffusion Transformer(DiT),用「分塊(chunk)生成」的方式逐步合成畫面:每個 chunk 大約對應一秒的影片內容,輸出解析度為 720p、每秒 24 幀,並透過 DMD(distribution matching distillation)式的少步蒸餾技術,將每個 chunk 的去噪步數壓縮到僅需四步——相較一般 diffusion 模型動輒二三十步以上的去噪流程,這是實現「即時可玩」體感的關鍵。

在互動控制上,AlayaWorld 設計了兩套機制:一是鏡頭/導航控制,透過 AdaLN(adaptive layer normalization)風格的模組把攝影機軌跡資訊直接注入 DiT 的正規化層,同時維護一份沿玩家路徑渲染、經深度反投影(depth-unprojected)得到的「3D cache」,讓場景具備空間一致性——換句話說,當玩家離開某個地點又繞回來時,畫面能維持與先前一致的外觀,達成類似「迴圈閉合(loop closure)」的效果。二是開放式動作控制,採用「chunk 粒度的 prompt 切換」機制,讓玩家可以在每個約一秒的 chunk 邊界隨時下達新指令,例如近戰攻擊、施法或召喚怪物,而不需要重新生成整段序列。

為了應對自回歸生成長期累積誤差、畫面逐漸崩壞的常見問題,團隊還設計了「歷史壓縮(history-compression)」模組來維持時間上的一致性,並引入「錯誤庫(error bank)」——訓練時主動把帶有殘留失真的「已漂移歷史」而非乾淨的 ground truth 餵給模型學習,讓模型學會在長時間 rollout 中自我修正,而非單純記憶完美輸入。整套系統連同資料準備管線、參考實作、評測工具與文件都計畫一併開源。

實驗結果

由於這篇論文本質上是一份系統/框架技術報告,目前公開版本的重點在於「質化」展示而非完整的量化 benchmark 排行——作者明確表示完整的技術細節、實驗結果與完整程式碼將於稍後(約七月中)發布。目前可確認的具體數字包括:生成畫質為 720p、24fps;每個約一秒長的 chunk 僅需四步去噪即可完成,顯示其推論效率遠優於標準 diffusion 流程;論文展示了長達一分鐘的連續生成 rollout,其中包含玩家離開場景後再返回的軌跡測試,用以驗證場景在「重訪」時仍能保持視覺一致性。在質化比較部分,作者將 AlayaWorld 與未具名的「代表性互動式世界模型」進行畫面對照,聲稱在長期畫面穩定度、攝影機控制精確度以及重訪場景一致性上表現更佳,但這一版本尚未附上如 PSNR、FID 或使用者偏好百分比等具體量化指標,量化評測結果仍待後續版本補齊。

意義

AlayaWorld 代表的是遊戲與互動內容生產範式的一次轉向:從「事先手工編寫好每個細節」轉為「按需即時生成」,理論上能大幅降低打造互動世界的門檻與成本,也讓內容在部署後仍能持續客製化與調整——這是傳統手工管線很難做到的彈性。更重要的是,團隊選擇把整條技術鏈(資料準備、模型訓練、推論加速、部署)全部以模組化、可擴充的形式開源,而不只是丟出一組模型權重,這對目前多半停留在封閉 demo 階段的影片世界模型研究領域,是相對少見且具參考價值的做法,有助於後續研究者站在同一套可重現的基礎上做比較與改進。其應用潛力也不僅限於遊戲娛樂,像具身智能訓練環境、模擬測試場景、互動式教育或媒體內容都是可能的延伸方向。當然,目前版本仍缺乏具體的量化 benchmark 數據與完整程式碼,其長時間穩定性與可控性的說法是否能在大規模測試與同儕系統的直接比較中站得住腳,仍需等待作者在七月中承諾的完整技術報告與程式碼發布後才能真正驗證。

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

Haoyu Zhao、Xingyue Zhao、Siteng Huang、Xin Li、Deli Zhao、Zhongyu Li72Hugging FacearXiv
RGB-DFdiffusion models4D world modeltri-branch architecturecross-modal attention

Good, I have plenty of detail now to write the article.

{"title": "RynnWorld-4D:用RGB-深度-光流打造能「預判物理」的機器人世界模型", "tags": ["世界模型", "機器人操作", "diffusion transformer", "多模態", "具身智能"]}

背景

機器人要在真實世界裡靠語言指令完成靈巧操作(比如雙手搬箱子、疊碗、遞物品),光是「看懂畫面長什麼樣」還不夠——它還必須預測場景的三維結構在互動中會如何變化。過去的「世界模型」大多只在 2D 像素影片層面做預測,例如直接生成未來的 RGB 影格。這類方法雖然畫面看起來合理,卻缺乏深度、物體邊界與運動速度等物理資訊,導致「預測出的世界」和機器人真正需要的低階末端執行器(end-effector)動作之間存在一道鴻溝——模型知道畫面會怎麼變,卻不容易轉換成「手該往哪裡移動多少」。

RynnWorld-4D 團隊的核心觀察是:如果把 RGB、深度圖(Depth)、光流(Optical Flow)三種模態同步起來一起生成,即所謂的 RGB-DF 表示,就能同時捕捉「畫面外觀」「幾何結構」和「時間運動」,這種表示空間在幾何和物理意義上比純 2D 影片更貼近機器人動作空間,從而縮小「世界預測」與「策略學習(policy learning)」之間的差距。這篇論文就是圍繞這個假設,設計了一個統一的 4D 生成模型與配套的策略頭(policy head)。

方法

RynnWorld-4D 建立在 Wan 2.2-TI2V-5B 這個 diffusion transformer 基礎上(30 層 transformer、隱藏維度 3072、FFN 維度 14,336),把原本單一 RGB 分支擴展成三分支架構(tri-branch),分別負責 RGB、深度、光流的生成,三者共用文字 cross-attention 的 Key/Value 投影,但各自保留獨立的 transformer 權重以維持各模態特徵分布。

三個分支之間如何保持一致?論文設計了「Joint Cross-Modal Attention(JA)」模組,每 3 層插入一次(第 0、3、6…27 層,共 10 個 JA 模組),搭配 frame-wise 3D RoPE(逐幀的三維旋轉位置編碼)與逐幀遮罩,確保跨模態注意力只在同一時間幀內互相對齊,而不是做全局語意平均。這一設計被作者稱為「像素級特徵融合的關鍵橋樑」——消融實驗顯示,若拿掉 3D RoPE,深度準確度 δ₁ 從 0.610 掉到 0.450,光流誤差 AEPE 從 0.170 升到 0.210。

整個生成過程用單一 diffusion 流程,以一張 RGB-D 圖片加一句語言指令為輸入,同時「共同去噪」出未來的 RGB 影格、深度圖與光流,三個模態共享同一組高斯噪聲以保證時間對齊。訓練分三階段:第一階段各分支獨立做「模態適應」(learning rate 2×10⁻⁵);第二階段凍結主幹與自注意力、只訓練 JA 模組(5×10⁻⁵);第三階段全參數聯合微調(1×10⁻⁵)。作者強調這個漸進策略至關重要——若跳過模態適應,δ₁ 會從 0.610 掉到 0.479。

為了餵養這樣的模型,團隊建立了 Rynn4DDataset 1.0,收錄超過 2.544 億(254.4 million)幀,涵蓋人類第一視角操作影片(如 Epic-Kitchens、EgoVid)與機器人操作資料(RoboMIND、RDT-1B、Galaxea、RoboCoin、AgiBot),並用 Qwen3-VL 生成字幕、DPFlow 產生光流、Depth Anything 3(DA3NESTED-GIANT-LARGE-1.1)產生深度圖作為高品質偽標籤,影片以 1 FPS 取樣、切成 5 秒短片,深度值裁切在 0 到 5 公尺範圍。

在生成端之上,論文再提出 RynnWorld-4D-Policy:一個逆動力學頭(inverse dynamics head),直接讀取 RynnWorld-4D 內部在擴散時間步 t=500、第 15 層時的隱藏特徵(三分支各 3072 維、共 9216 維),透過一次前向傳播就輸出動作,不必像一般 diffusion policy 那樣跑完整多步去噪。動作生成本身用 flow matching + 4 步 Euler ODE 取樣,一次預測長度為 10、每步 54 維的動作序列(action chunk),透過動作分塊(action chunking)在 50Hz 執行的同時平行規劃下一輪,實現約 9Hz 的有效閉環控制頻率。

實驗結果

在世界模型的預測品質上,RynnWorld-4D 與 Wan、CogVideoX、Free4D、4DNeX、TesserAct 等模型比較:深度準確度 δ₁<1.25 達到 0.610,遠高於 4DNeX 的 0.327 與 TesserAct 的 0.279;幾何誤差 AbsRel 降到 0.310(若用「獨立分支」而非聯合訓練會退化到 0.737);光流誤差 AEPE 僅 0.170,且是少數能同步輸出光流的方案之一。消融實驗也顯示,拿掉 4D 預訓練會讓 AEPE 從 0.170 暴增到 0.729,證明大規模 4D 資料預訓練是關鍵。

在真實世界雙手靈巧操作任務上(每項任務 35 次試驗,以成功率計),RynnWorld-4D-Policy 表現:雙物拾取(Dual Picking)94.29%、推方塊(Block Pushing)91.43%、物品遞交(Hand-over)88.57%(這項還明顯超越 π₀ 與 π₀.₅ 基礎模型)、雙臂抬舉(Bimanual Lifting)82.86%、放置瓶蓋(Lid Placement)與疊碗(Bowl Stacking)則各為 65.71%,對照 Diffusion Policy 基線的 57.14%。特別是在需要空間精度與時間協調的任務(如疊碗、放瓶蓋)中領先幅度最明顯。另外,若把 RynnWorld-4D 的內部特徵換成一般 ResNet-18 視覺編碼器,Dual Picking 成功率會從 94.29% 掉到 71.43%,說明 4D 表示本身對下游策略學習的貢獻不是換個骨幹網路就能取代的。模態消融也顯示,純 RGB 表現最弱,加上 Depth 明顯提升空間任務精度,加上 Flow 則提升動作敏感任務的表現,RGB-DF 三模態齊全時效果最佳。硬體層面,在 NVIDIA RTX 5090(搭配 FP8 量化與 FlashAttention 3)上,一個完整推理循環約 1.1 秒,其中三分支 transformer 佔了 89.5%(約 0.98 秒),動作生成僅佔剩餘的 10.5%。

意義

RynnWorld-4D 的意義不只是「多加了兩個輸出模態」,而是重新定義了世界模型該長什麼樣:與其讓模型單純學習「像素怎麼變」,不如讓它同時學習「幾何怎麼變、運動怎麼變」,這樣得到的內部表示天然更貼近機器人的動作空間,因此可以省去傳統 diffusion policy 需要的多步去噪取樣,直接用一次前向傳播的逆動力學頭輸出動作——這對於需要高頻閉環控制(此處達到約 9Hz)的真實機器人系統非常關鍵。另一個貢獻是 Rynn4DDataset 1.0 這個 2.544 億幀規模的資料集與其偽標籤流程,為後續研究者提供了可複用的大規模 4D 訓練資料基礎,降低了構建類似系統的門檻。整體而言,這項工作提示了一個方向:具身智能(embodied AI)的世界模型不該停留在「生成好看的影片」,而應該朝著「生成物理上一致、且能直接驅動動作」的多模態表示演進,這對機器人在非結構化真實環境中完成精細操作(尤其是雙手協調類任務)有直接的實用價值。

RynnWorld-Teleop:用生成式世界模型打造「數位遙操作」機器人資料引擎

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

Haoyu Zhao、Xingyue Zhao、Hangyu Li、Biao Gong、Kehan Li、Siteng Huang、Xin Li、Deli Zhao67Hugging FacearXiv
世界模型機器人學習遙操作Diffusion TransformerSim2Real

背景

訓練一個好用的機器人操作策略(policy),核心瓶頸從來不是演算法,而是資料。要讓機器人學會抓取、搬運、雙手協作等動作,imitation learning 需要海量、多樣的「狀態-動作」軌跡,而這些軌跡目前幾乎都靠人類操作員用實體遙操作(teleoperation)裝置,一動作一動作地在真實機器人上示範產生。問題是,每一次示範都把操作員的時間綁死在特定硬體、特定工作空間上——換一套機械手臂或換一個場景,示範資料往往就得重新收集,資料規模化(scaling)因此非常昂貴且緩慢。

RynnWorld-Teleop 提出的解法是「數位遙操作」(digital teleoperation):把「真實機器人」直接從資料收集迴圈裡拿掉,改用一個生成式世界模型(world model)來合成機器人視角的影片。操作員仍然只是自然地做手部動作,系統记录下來的是一串與具體機器人形態無關的手部姿態(embodiment-agnostic action label),之後可以透過標準的動作重定向(retargeting)轉換給任何目標機器人使用。這樣一來,收集資料不再需要真正的機械手臂、不需要真實工作空間,操作員的時間就能被無限複用。

方法

RynnWorld-Teleop 建立在 Wan-2.2-TI2V-5B 這個 50 億參數的 video Diffusion Transformer(DiT)之上,搭配 3D VAE 與 conditional flow matching 框架。整套系統有三個關鍵設計:

第一,深度感知的骨架條件化(depth-aware skeletal conditioning)。操作員的手部被追蹤成 21 個關節點的骨架,渲染時的顏色與半徑會依相機空間的深度做調變,再透過一個零初始化(zero-initialized)、帶可學習縮放係數(初始值 0.1)的「分佈對齊式附加 patch embedding」注入到 DiT 中,讓模型清楚知道手在三維空間中的位置與遠近關係。

第二,漸進式「人到機器人」訓練(progressive human-to-robot training)。訓練分兩階段:第一階段在大規模的人類第一視角(egocentric)資料上做預訓練,用了 EgoDex(7,400 萬幀,切成 91 萬段影片片段)與 VITRA(3,070 萬幀,切成 123 萬段片段);第二階段再用 1,800 段高品質的真實遙操作示範(43 萬幀、切成 5,300 段片段,對應雙 7 自由度手臂加雙 20 自由度靈巧手、共 54 自由度)做機器人領域適配。消融實驗顯示,若跳過人類預訓練直接在機器人資料上訓練,生成品質會嚴重崩壞(FVD 從 585 惡化到 2598),證明「先學人手、再遷移到機器人手」是整個管線的關鍵。

第三,串流自迴歸蒸餾(streaming autoregressive distillation)。原本雙向(bidirectional)的 teacher 擴散模型被蒸餾成帶因果時間遮罩(causal temporal mask)與固定大小 KV cache 的 causal student,搭配 4 步 flow matching 排程,把生成過程壓縮成單次前向推論(single-pass inference)。這讓系統能在單張 H100 GPU 上以 40+ FPS 即時互動生成畫面,每幀延遲約 25 毫秒(其中骨架編碼佔約 5%、DiT 去噪佔約 72%、影像解碼佔約 23%)。

實驗結果

在生成品質上(480×832 解析度),完整版 RynnWorld(SFT)取得 PSNR 26.78、SSIM 0.887、LPIPS 0.119、FVD 550,明顯優於同類動作條件式基準模型 InterDyn(FVD 655)、Mask2IV(FVD 1650),也優於文字條件式的 CogVideoX、Wan I2V(FVD 落在 1540–2790 區間)。經過因果蒸餾後的 RynnWorld-Causal 雖然 FVD 略升至 1226、PSNR 降到 22.25,但生成速度從 2.8 FPS 一舉躍升到 40 FPS,換取了即時互動能力。消融也顯示,拿掉對抗式蒸餾(DMD)FVD 會退化到 1338,拿掉因果 warmup 更會惡化到 2150,說明蒸餾流程中每個環節都有實質貢獻。

更關鍵的是下游機器人任務的效果。研究團隊在真實的 TIANJI M6 雙臂(7 自由度)加 WUJI 靈巧手(20 自由度)平台上測試,策略完全只用 RynnWorld-Teleop 生成的合成資料訓練,就能實現零樣本(zero-shot)Sim2Real 轉移:例如 π₀ 策略在「推方塊」任務達到 82.86% 成功率、在「雙手抬舉」任務達到 77.14%。而當把 300 段真實資料與 300 段合成資料混合訓練時,效果更全面提升——「推方塊」成功率從 65.71% 提升到 82.86%,「雙手抬舉」從 54.29% 提升到 77.14%,「放置瓶蓋」從 34.29% 提升到 54.29%;在更強的 π₀.₅ 策略上同樣一致提升,「雙手撿取」從 62.86% 提到 74.29%,「放置瓶蓋」從 42.86% 提到 62.86%。

意義

這篇論文最核心的貢獻,不是又一個影片生成模型,而是把「世界模型」重新定位成機器人資料的規模化引擎(data engine)。過去要擴充機器人示範資料,必須持續佔用真實硬體與操作員工時;RynnWorld-Teleop 證明,只要世界模型足夠逼真、動作條件化足夠精準,合成資料就能真正提升甚至獨立支撐真實世界的策略訓練,而不只是用來做 domain randomization 式的資料增強。40+ FPS 的即時生成速度也意味著這不只是離線資料工廠,未來還可能支援操作員即時「試操作」不存在的機器人硬體,進一步壓縮從想法到可用資料的週期。對於整個具身智能(embodied AI)領域而言,這代表資料瓶頸有機會從「物理世界的可得性」轉移到「生成模型的品質與泛化能力」,是一條值得持續關注的規模化路徑。