單張桌上型 GPU 跑出無限開放世界:ABot-World-0 如何實現即時互動影片世界模型
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
背景
近年來「世界模型」(world model)成為生成式 AI 的熱門方向之一:讓模型不只是生成一段影片,而是能根據使用者的操作(例如鍵盤方向鍵)即時「演化」出一個可互動、可探索的虛擬世界,類似 Google 的 Genie 3、以及 HappyOyster、LingBot-World、HY-World 1.5 等競品。這類模型的難點在於三個互相拉扯的目標:畫質要好、能長時間(long-horizon)維持世界一致性而不崩壞、同時還要能即時(real-time)在消費級硬體上跑起來。過去許多世界模型只能在雲端多卡叢集上以離線或準即時方式生成,普通玩家或開發者的一張桌機顯卡幾乎無法承受。
ABot-World-0 的目標正是打破這個門檻:在單張 NVIDIA RTX 5090(消費級桌上型 GPU,並非資料中心卡)上,做到 720P、最高 16 FPS 的串流生成,操作到出現第一幀的延遲僅 1.2 秒,峰值顯存(VRAM)約 19GiB。這代表這類世界模型第一次有機會被個人開發者、獨立遊戲工作室甚至遊戲主機等級的裝置實際運行,而不只是研究 demo。
方法
ABot-World-0 建立在 Wan2.2 影片擴散 transformer(diffusion transformer, DiT)骨幹之上,整體方法可以拆成「資料」、「模型訓練」、「動作與角色控制」、「部署推理」四塊:
資料基礎設施(WorldExplorer):團隊沒有單純依賴人類手動蒐集或既有影片,而是打造了一個「智能體驅動」的資料採集系統 WorldExplorer——由導航 agent 在虛擬環境中自主探索、依多階段目標選擇路徑,同步捕捉影片畫面、相機參數與操作訊號;並用「訓練回饋」動態調整不同資料類型的採集比例(哪類資料訓練效果差就多採一些)。資料來源涵蓋三種:AAA 遊戲(直接拿遊戲引擎 API 的控制訊號)、模擬引擎(Unreal Engine、3D 高斯潑濺技術 3D Gaussian Splatting,有確定性的軌跡標籤)、以及網路影片(用姿態估計產生偽標籤)。所有資料都要通過涵蓋六個維度、共 14 項確定性品質檢查(檔案完整性、視覺有效性、幾何一致性、遊戲狀態正確性、動作對齊、metadata),再加上 VLM(視覺語言模型)語義評估與同步的動作、文字標註。
漸進式蒸餾訓練:訓練分三階段。第一階段訓練一個「雙向」(bidirectional)動作條件教師模型,在多來源動作-影片資料上以全時域雙向生成方式微調。第二階段做 ODE 蒸餾(概率流常微分方程蒸餾),把這個雙向教師轉換成「因果」(causal,也就是只看過去、能逐幀串流輸出)的少步驟(few-step)學生模型,本質是學習從帶噪聲的中間潛變量直接映射到教師 ODE 定義的乾淨終點,藉此大幅減少推理所需的擴散步數。第三階段是本文的核心創新之一 LongForcing:用一個「延長時域」的雙向教師來監督學生自己做長 rollout(自迴歸連續生成)的結果,做分布匹配式蒸餾,專門解決自迴歸生成常見的「誤差累積/漂移」(distribution shift、autoregressive drift)問題——也就是模型跑久了畫面會逐漸模糊、飽和度異常、出現色塊重複等劣化現象。
動作與角色控制:控制介面採用原始鍵盤輸入(W/A/S/D 移動、I/J/K/L 視角旋轉等 8 維訊號),打包成 32 維的時序動作 token,並與 VAE 壓縮率對齊,透過 PixelUnshuffle 加殘差卷積模組注入到每個 token。這套「統一」介面同時支援第一人稱場景漫遊與第三人稱角色操控。為了讓第三人稱角色在長時間 rollout 中「看起來還是同一個角色」,團隊設計了「參考角色記憶」(reference-character memory)模組,用角色的標準(canonical)圖片編碼成 identity token,並採用不對稱的 memory-video attention,持續提供外觀線索。
部署推理棧:為了塞進單張桌機 GPU 並做到即時串流,團隊共同設計了一整套系統層優化:輕量化 VAE 解碼器(裁剪過的解碼架構)、SageAttention2 高效注意力、Fast-RoPE 時序位置編碼、有界 KV cache(本地上下文快取加滾動淘汰機制,並可對 cache 做量化)、記憶體感知排程(按執行順序做模組分階段載入以壓低峰值顯存)、以及低位元(low-bit)DiT 推理(預設 FP8,並提供更激進的量化選項換取更高吞吐量)。
實驗結果
在效能面,ABot-World-0 在最佳化的低位元配置下,於單張 RTX 5090 上可串流輸出 720P 影片、最高達到 16 FPS,動作輸入到畫面第一幀輸出的延遲僅 1.2 秒,推理時峰值顯存約 19GiB——這個顯存量級是消費級旗艦卡就能負擔的範圍,而非需要 40GB/80GB 級的資料中心 GPU。
在效果評測上,團隊建立了自有 benchmark WorldRoamBench,並與 Genie 3、HappyOyster、LingBot-World、HY-World 1.5 等同類世界模型比較,在動作保真度(action fidelity)、軌跡跟隨(trajectory following)、視覺品質、物理一致性與記憶保持(memory retention)等多個維度上取得具競爭力的表現。此外還做了延伸的長時互動 rollout 實驗,包括「小時級」的連續 rollout(驗證場景連貫性與可控性維持)、以及「天級」的極限壓力測試(在多個取樣時間點檢查畫質與世界動態是否仍然活躍、未塌縮)。
針對 LongForcing 的消融實驗特別值得一提:在 60 秒的連續 rollout 中,相較於單純 Causal-Forcing(即只用因果教師做逐幀監督、不做延長時域對齊)的基線,加入 LongForcing 後在 rollout 後半段的 HPSv3(人類偏好評分)分數明顯更高,且畫面飽和度異常、模糊、色塊重複等自迴歸誤差累積的典型症狀顯著減少——這直接證明了「用延長時域教師對齊長 rollout」這個設計對長時間穩定性確實有效,而不只是理論上合理。另外,模型在分布外(out-of-domain)場景與角色組合上也展現出一定的泛化能力,並能生成碰撞、環境痕跡、幾何約束等合理的物理互動效果。
意義
ABot-World-0 的價值不在於單一指標刷新 SOTA,而在於把「可互動世界模型」從研究論文式的雲端 demo,往「消費級硬體可跑」的方向推進了一大步。過去這類系統的效能瓶頸不只是模型本身的生成品質,更是工程系統層面——擴散模型多步採樣天生慢、雙向注意力天生不能做串流、長 rollout 天生會漂移崩壞。這篇論文的解法是「教師-學生蒸餾三階段」加「系統層全棧優化」的組合拳:用 ODE 蒸餾把多步擴散壓成少步、用因果注意力換取串流能力、再用 LongForcing 專門治療長時漂移問題,最後靠低位元推理、輕量 VAE、高效 kernel 把一切塞進 19GiB 顯存與 16 FPS。
對產業而言,這意味著遊戲原型設計、虛擬角色互動、UGC(使用者生成內容)式的世界探索體驗,未來有機會不依賴雲端算力、直接在玩家自己的桌機上運行——這對成本結構和延遲體驗都是質的改變。同時,WorldExplorer 這套「訓練回饋驅動的智能體資料採集」思路,也提供了一個可能推廣到其他世界模型/具身智能(embodied AI)訓練場景的資料飛輪範式:讓資料採集本身變成一個閉環優化問題,而不是一次性靜態蒐集。整體來看,ABot-World-0 是世界模型從「能不能生成」邁向「能不能落地在真實終端裝置上跑起來」這條路上頗具代表性的一步。