← 目錄

K1 論文詳解

2026-07-24


AlayaRenderer-Flash:把生成式世界渲染器加速到「遊戲速度」的 31.54 FPS

Generative World Renderer at the Speed of Play

Alaya LabGuixu Lin、Zheng-Hui Huang、Siqi Yang、Ming-Hsuan Yang、Kaipeng Zhang、Zhixiang Wang67Hugging FacearXiv
生成式世界模型即時渲染模型蒸餾自回歸串流遊戲AI

背景

近年生成式影片模型讓「用文字或控制訊號生成畫面」成為熱門方向,但這類方法有個根本問題:模型生成的畫面內容往往與底層世界狀態脫鉤,場景結構、物理邏輯容易在生成過程中被悄悄改變,難以真正拿來做「可互動的遊戲世界」。

作者團隊先前提出的 AlayaRenderer 走了另一條路:它不是憑空生成畫面,而是接收物理引擎匯出的結構化世界狀態(即 G-buffer,包含 albedo、depth、metallic、normal、roughness 等圖層),再把這些結構資訊「渲染」成 RGB 畫面。因為輸入本身就是精確的世界狀態,AlayaRenderer 不會竄改場景結構與世界動態,只負責重新詮釋畫面風格——這讓「生成式世界模型」與「使用者可控玩法」第一次有了較穩固的結合方式。

問題在於,原始 AlayaRenderer 使用完整的 50 步 diffusion 去噪流程,推論速度只有 0.56 FPS,離「即時遊戲」的門檻(通常需要 30 FPS 左右)差了兩個數量級,完全無法真正拿來玩。這篇技術報告要解決的就是這個落差:如何在幾乎不犧牲畫質與可控性的前提下,把推論速度拉到「遊戲速度」。

方法

AlayaRenderer-Flash 的核心思路是把一個「教師模型」(teacher model,即原版 AlayaRenderer)透過三項技術重構成即時串流系統:

1. 少步數自回歸蒸餾(Few-Step Distillation) 原本 50 步的去噪流程被壓縮成僅 4 步,分三階段完成:先做 Guidance Distillation,把 classifier-free guidance 的效果直接內化進模型權重;接著做 Progressive Step Reduction,依序在 32→16→8→4 步的預算下逐步訓練收斂;最後用 Mean Flow Distillation(MFD)搭配對抗式損失(adversarial loss)找回被壓縮步數犧牲掉的細節。

2. 自回歸串流架構(Autoregressive Streaming) 系統把 latent 影片切成固定長度的區塊(每塊 4 個 latent frame),以自回歸方式逐塊生成,並在區塊邊界間維持「持久時間狀態」。為了在無限長度的輸入串流下仍保有一致性,團隊設計了三層式的歷史壓縮機制:近期畫面保留高保真度細節,較久遠的畫面則逐步壓縮。此外,串流一開始生成的第一幀會被當作「全域外觀錨點」,並附加在高保真歷史紀錄前端,確保後續每個區塊都能維持與最初風格一致的視覺表現。

3. 輕量蒸餾編解碼器(Distilled Lightweight Codecs) 原本使用的 Wan VAE 運算成本高昂,團隊改用針對遊戲場景蒸餾與微調過的「小型 G-buffer 編碼器」與「小型時序解碼器」,取代原有的通用 VAE 模組,大幅降低 latent 編碼與畫面重建的算力開銷,同時以因果(causal)方式實作編解碼器,確保單次前向傳遞也能維持數值一致性。

整體架構仍保留教師模型原有的兩個介面:G-buffer 輸入與文字提示(text prompt)控制。文字提示透過專門設計的自注意力「text sink」機制,在整個自回歸串流過程中持續影響畫面風格,讓使用者可以隨時切換渲染風格而不中斷串流。

實驗結果

團隊在《黑神話:悟空》(Black Myth: Wukong)實機錄製的畫面資料上進行訓練與評測,解析度 1280×720、30 FPS,共 1,352 段訓練片段與 131 段測試片段(每段 5 秒、150 幀),評測時使用 832×448 解析度。訓練使用 8 張 NVIDIA H200,推論則在單張 H200 上完成。

關鍵數字對比(教師模型 AlayaRenderer vs. AlayaRenderer-Flash):

  • 推論速度:0.56 FPS → 31.54 FPS,提升約 56 倍,首次跨過「遊戲速度」門檻。
  • 內容保真度(CLIP 相似度 S_CLIP-I):0.836 → 0.847,學生模型反而略高。
  • 區塊邊界誤差(Boundary MSE):0.0500 → 0.0406,下降約 18.8%,代表自回歸分塊之間的接縫更平滑。
  • 提示可控性(M_CLIP):0.039 → 0.043,提升約 10%,顯示風格切換的反應更明確。
  • GPU 記憶體佔用:30.1 GB → 16.2 GB,降低約 46%。
  • 時序穩定性(tLPIPS_warp):0.124 對比 0.155,維持在同一量級,代表壓縮步數與蒸餾並未明顯犧牲畫面的時間一致性。

與其他方法比較(5 秒評測序列):RGB↔X 方法的 CLIP 相似度為 0.820、僅 1.30 FPS;FrameDiffuser 為 0.844 CLIP、0.31 FPS,且缺乏提示控制能力;AlayaRenderer-Flash 則在 0.847 CLIP、31.54 FPS 之外還保留了提示切換功能。在 Fréchet Video Distance(FVD)這項衡量生成影片分布與真實分布差距的指標上,AlayaRenderer-Flash 得分 384.1,遠優於 RGB↔X 的 1031.3 與 FrameDiffuser 的 650.6,顯示畫面品質與時序連貫性同時勝出而非取捨關係。

最重要的實測驗證,是團隊把 AlayaRenderer-Flash 接入開源賽車遊戲引擎 SuperTuxKart,實際跑出一個可玩的生成式世界,在真人操作、即時提示切換的情況下穩定維持 30 FPS。

意義

這篇報告示範了一條把「生成式世界模型」從研究概念推向真正可用產品的清晰路徑:不是一味追求更大、更慢但畫質更好的模型,而是用系統性的蒸餾工程(少步數去噪 + 自回歸串流 + 輕量編解碼器)把一個原本 0.56 FPS 的離線渲染器,轉化為 31.54 FPS、可整合進真實遊戲引擎的即時系統,而且多項品質指標(CLIP 相似度、邊界誤差、提示可控性)不降反升。

更關鍵的意義在於,AlayaRenderer 系列選擇「渲染結構化世界狀態」而非「純文字/控制訊號生成畫面」,這代表生成式模型可以只負責畫面風格化這一層,底層的物理模擬、碰撞判定、遊戲邏輯依然交給傳統物理引擎處理。這種「生成器 + 物理引擎」的混合架構,既保留了傳統遊戲引擎的可控性與規則正確性,又賦予畫面前所未有的風格自由度(例如即時切換美術風格而不用重新建模資產),同時把運算成本壓到消費級或雲端即時串流可負擔的程度。對遊戲產業、虛擬製作、以及更廣義的「可互動世界模型」研究而言,這提供了一個兼顧真實感、可控性與部署可行性的具體範例,也為後續把生成式渲染真正嵌入商業遊戲管線鋪平了道路。

Mage-Flow:一個 4B 參數也能打的高效原生解析度圖像生成與編輯模型

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

MicrosoftXinjie Zhang、Peng Zhang、Shicheng Zheng、Jinghao Guo、Zhaoyang Jia、Yifei Shen、Xun Guo、Yuxuan Luo60Hugging FacearXiv
圖像生成擴散模型VAE模型效率圖像編輯

背景

近年來文字生成圖片(text-to-image)與指令式圖片編輯模型持續朝「更大、更貴」的方向發展:模型參數愈堆愈多、訓練資料愈滾愈大,訓練與推論的成本也隨之水漲船高。這對想要落地部署、追求低延遲互動體驗(例如即時生成、線上編圖工具)的團隊來說,是一個很現實的痛點——模型再強,若一張圖要等好幾秒甚至十幾秒,使用體驗就大打折扣。

Mage-Flow 這篇論文正是針對這個矛盾提出解法:能不能用相對「精簡」的 4B(40 億參數)規模,做出在標準 benchmark 上具有競爭力,同時又能滿足互動式應用延遲需求的生成與編輯模型?作者的核心觀點是:效率的瓶頸往往不只在骨幹網路(backbone)本身,而是整個「tokenizer(把圖片轉成 latent 的編碼器)—backbone(負責去噪生成的 transformer)—系統工程(訓練/推論的底層優化)」三者需要一起共同設計(co-design),單獨優化某一環效果有限。

基於此,作者提出 Mage-Flow:一套包含 Mage-VAE(輕量級 latent tokenizer)與 NR-MMDiT(Native-Resolution Multimodal Diffusion Transformer,原生解析度多模態擴散 transformer)的完整技術棧,並在此基礎上訓練出 Base、RL 對齊(RL-aligned)、以及 Turbo 三個版本,同時涵蓋生成與編輯兩條產品線。

方法

Mage-VAE:一步式擴散編解碼器。 傳統高品質 VAE(例如 FLUX.2-VAE)雖然重建效果好,但編碼/解碼過程計算量大,成為訓練與推論時的隱藏成本。Mage-VAE 改用「一步式擴散風格編解碼(one-step diffusion-style encoding/decoding)」搭配「錨定潛在正則化(anchor-latent regularization)」,讓一個輕量模型透過蒸餾(distillation)的方式逼近強力公開 VAE 的重建品質,同時把編碼運算量降低約 12.3 倍、解碼運算量降低約 22.3 倍。更關鍵的是,Mage-VAE 保留了與 FLUX.2 系列相容的 latent 幾何結構,使得不同 tokenizer 之間可以互換使用而不明顯損失下游生成品質,這也代表其潛在空間設計具有一定通用性,而非為單一模型量身打造的取巧方案。

NR-MMDiT:原生解析度 + rectified flow matching。 生成骨幹網路是一個以 rectified flow matching 訓練的多模態擴散 transformer,並支援「原生解析度封裝(native-resolution packing)」——也就是不需要把所有圖片硬塞進同一個正方形尺寸,而是讓不同長寬比、不同解析度的圖片以變長批次(variable-length batching)一起訓練,讓解析度多樣性本身變成一種訓練訊號,而非需要被抹平的雜訊。搭配 stack 級的 CUDA kernel 融合優化,模型的 FLOP 利用率從 33% 大幅提升到 77%,整體訓練吞吐量提升約 2.49 倍(接近論文摘要所稱的 2.5 倍),同時尖峰顯存從 175.45 GB 降至 141.44 GB。

後訓練:Diffusion-NFT 與少步蒸餾。 在基礎模型訓練完成後,作者採用 Diffusion-NFT(一種在前向擴散過程上進行「負樣本感知」微調的方法),利用約 2 萬條生成任務 prompt 與 3 萬條編輯任務 prompt,搭配針對文字渲染、美學品質、語意理解、編輯保真度等面向設計的獎勵評估器,對模型做強化對齊,得到 RL-aligned 版本。而 Turbo 版本則透過「解耦式 DMD(Decoupled Distribution Matching Distillation)」搭配對抗式感知引導(adversarial perceptual guidance)進行少步蒸餾,把原本 20–30 步的採樣壓縮到僅 4 步,生成蒸餾用了 20 萬組跨六大內容類別的精選資料,編輯蒸餾則用了 25 萬樣本(編輯與生成資料以 3:1 混合)。作者也發現,對抗式感知引導在極端的 4 步壓縮下,對維持文字渲染與生成品質特別重要。

實驗結果

在 1024² 解析度下,Mage-Flow 於多項標準 benchmark 上取得具競爭力的成績:GenEval 達 0.90(Turbo 版 0.88)、DPG-Bench 達 86.49 分(Turbo 版 85.48)、TIIF-Short 達 82.19(Turbo 版反而略升至 83.58)、長文字渲染測試 LongText-EN/CN 分別為 0.944/0.823(Turbo 版 0.911/0.801)。可以看到 Turbo 版在多數指標上只有輕微下滑,部分指標甚至持平或更好,顯示 4 步蒸餾並未明顯犧牲品質。

編輯方面,Mage-Flow-Edit 在 ImgEdit 拿下 4.34 分(Turbo 版 4.38,反而更高)、GEdit-EN/CN 分別為 8.127/8.123(Turbo 版 8.271/8.264),TextEdit-Syn/Real 則為 14.14/16.26(Turbo 版 12.77/15.41,略有下降但仍維持高水準)。

效率數字才是本篇的重頭戲:在單張 NVIDIA A100 上、1024² 解析度下,Mage-Flow-Base(30 步)需 7.51 秒,標準版 Mage-Flow(20 步)需 4.37 秒,而 Turbo 版(4 步)僅需 0.59 秒;編輯任務中 Mage-Flow-Edit(30 步)需 10.55 秒,Edit-Turbo(4 步)僅需 1.02 秒。所有變體的尖峰顯存都控制在 18–20 GB 左右,對單卡部署相當友善。訓練資料方面,生成語料從約 100 億原始圖文對篩選至約 13 億高品質資料,並採漸進式解析度訓練(256×256 用 12 億張、512×512 用 6 億張、1024×1024 用 3 億張),編輯語料則從 9000 萬原始三元組經 VLM 三方投票過濾後保留 4500 萬筆,涵蓋 19 種編輯類型並做平衡採樣。

意義

Mage-Flow 說明了一件事:在圖像生成領域,「規模」不是通往高品質與高效率的唯一路徑。透過 tokenizer(Mage-VAE)、backbone(NR-MMDiT)、系統工程(kernel 融合、原生解析度封裝)三者的協同設計,一個 4B 規模的模型也能在標準 benchmark 上逼近甚至媲美更大模型的表現,同時把單張 1024² 圖片的生成時間壓到 0.59 秒、編輯壓到 1.02 秒——這樣的延遲已經接近「互動式」應用的門檻,對於需要即時反饋的線上編圖工具、聊天機器人配圖、電商素材生成等場景意義重大。

更值得注意的是方法論上的啟示:少步蒸餾配合對抗式感知引導,證明了品質與速度不必然是零和取捨;而 VAE 層級的「潛在幾何相容性」設計思路,也為未來社群共享、跨模型替換 tokenizer 提供了可能性,降低了整體生態系的重複造輪成本。對於資源有限的團隊或研究者而言,Mage-Flow 提供了一個具體的範例:與其一味追求參數規模,不如把功夫下在整個技術棧的協同優化上,同樣能做出「又快又好」的生成式模型。

AlayaWorld:讓世界模型即時生成可互動、長時間穩定的虛擬世界

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

Alaya LabAlayaWorld Team、Kaipeng Zhang、Chuanhao Li、Yifan Zhan、Yongtao Ge、Yuanyang Yin、Jiaming Tan、Kang He49Hugging FacearXiv
世界模型影片生成擴散模型自回歸生成模型蒸餾遊戲AI

背景

傳統遊戲開發是一條又長又貴的流水線:美術資產製作、動畫綁定、物理引擎調校、程式邏輯撰寫,每一個環節都需要大量人力與時間。近年興起的「影片世界模型」(video world model)提出了另一種可能——直接從文字、圖片或影片輸入,即時生成一個可探索、會演化的虛擬世界,不需要預先建好任何 3D 資產。

但要讓這個願景真正可用,必須同時解決四個高度耦合的難題:互動性(使用者的操作要能即時反映在畫面上)、持續的時空一致性(場景轉一圈回頭看,原本的物件與光線要維持不變)、穩定的長時間生成(不能生成幾十秒後畫面就崩壞或漂移)、以及高效率的即時回應(不能讓玩家等半天才出下一幀)。過去的世界模型如 NVIDIA Cosmos、HunyuanVideo-1.5(HY-World 1.5)、WAN 2.2、YUME 1.5、Matrix-Game 2.0 等,往往只能在其中一兩項上表現不錯,長時間 rollout 後容易出現顏色飄移、模糊、軌跡跑偏等問題。

AlayaWorld 正是針對這四個難題提出的一套完整解法,由 Alaya Lab 的 17 人團隊(以 Kaipeng Zhang、Chuanhao Li 為核心)開發,於 2026 年 7 月 20 日以完整技術報告形式公開,並定位為長期、全棧、開源的研究專案。

方法

AlayaWorld 的核心是一個約 15B 參數規模的影片擴散 transformer(基於 LTX 系列骨幹改造,移除音訊模組後專注於視覺生成),能以 24fps 生成 540p 與 720p 的影片。模型並非一次生成整段影片,而是在 VAE 潛在空間中,以「短潛在區塊」(每區塊 K=4 個潛在幀)的方式自回歸生成,並在每個區塊上接受相機軌跡與可即時切換的文字提示雙重控制。

要解決長時間一致性,關鍵在於模型的「有界視覺上下文」(bounded visual context)設計,它同時融合四種訊息來源:

  1. 持久錨定幀(sink frame):一張固定不變的乾淨潛在幀,作為全局身份錨點,避免場景「忘記自己是誰」。
  2. 壓縮時間歷史:透過歷史壓縮模組,將滑動窗口內的過去幀壓縮成緊湊表示。
  3. 幾何對齊空間記憶:利用單目深度估計與相機姿態,把過去看過的視角重新投影回當前畫面,最多取用 10 幀先前渲染結果,以「最大覆蓋選取」方式挑選最有用的參考視角。
  4. 近鄰幀條件:最近一幀作為影格間連續性的直接參照。

相機控制則用傅立葉編碼的相對姿態增量,透過 AdaLN(adaptive layer normalization)注入模型。

為了對抗長期生成中常見的「漂移」(drift)——也就是畫面隨時間推移逐漸失真、變色、模糊——團隊設計了專門的抗漂移訓練:用「Helios 漂移模擬」人工注入噪點、模糊、飽和度偏移等三類瑕疵,並建立「錯誤庫」重放模型自己 rollout 產生的殘差誤差,讓模型學會自我修正而非放大誤差。

整體訓練分三階段:第一階段是雙向(非自回歸)全參數預訓練,採用自適應 sigma-shift 排程處理長達 20 秒的變長影片;第二階段是自回歸訓練,先凍結骨幀只用 LoRA 訓練歷史壓縮模組,再解凍骨幀進行含歷史壓縮、相機控制、下一幀預測頭三個模組的全棧微調;第三階段是推論加速蒸餾,結合分佈匹配蒸餾(distribution-matching distillation)、self-forcing++、一致性蒸餾(consistency distillation)三種技術,把原本約 30 步的採樣流程壓縮到每區塊僅需 4 步,大幅降低延遲,是實現「即時互動」的關鍵一步。

訓練資料方面,團隊蒐集了 222,147 段影片片段,來自七個資料源,涵蓋真實第一人稱影像(Sekai-Real,21,561 段)、室內掃描(SpatialVid、RealEstate10K)、遊戲合成資料(GameVerse,多達 124,116 段,佔比最大)等,並透過六階段清洗流程(技術檢驗、光度檢查、鏡頭邊界偵測、動作分析、文字/UI 遮蔽、YOLO11 人物過濾)確保資料品質,再用兩層式的階層字幕標註(影片級 26 值詞彙 + 片段級四軌語意描述)提升文字可控性。

實驗結果

團隊在自建的 iWorld-Bench 上,與 NVIDIA Cosmos、HunyuanVideo-1.5(HY-World 1.5)、WAN 2.2、YUME 1.5、Matrix-Game 2.0 等主流世界模型比較長時間生成表現。AlayaWorld 在幾乎所有關鍵指標上都取得最佳成績,對比最強競爭對手(多為 HY-World 1.5):

  • 亮度一致性:0.9492,對手最佳 0.8051
  • 色溫穩定性:0.9379,對手最佳 0.7819
  • 銳利度保持:0.8361,對手最佳 0.6634(這三項顯示 AlayaWorld 在對抗長時間畫面漂移上優勢最明顯)
  • 運動平滑度:0.9924,對手最佳 0.9921(接近打平)
  • 軌跡準確度:0.7985,對手最佳 0.7472
  • 記憶對稱性:0.8871,對手最佳 0.8481
  • 軌跡對齊度:0.7018,對手最佳 0.6776

其中亮度、色溫、銳利度三項的領先幅度最大(接近或超過 15 個百分點),直接印證了抗漂移訓練策略(Helios 漂移模擬 + 錯誤庫)的有效性——長時間 rollout 後畫面不容易變色、變模糊。此外,推論步數從約 30 步壓縮到 4 步,在維持生成品質的前提下大幅提升了每秒可生成幀數,這對「互動式」應用場景(需要低延遲回饋)至關重要。

意義

AlayaWorld 的意義不只是刷新一項 benchmark 分數,而是提出了一套可行的工程框架,把「即時互動」與「長時間穩定」這兩個原本互斥的目標同時做到位:有界視覺上下文讓計算成本不隨生成長度增長,4 步蒸餾讓延遲可接受,抗漂移訓練讓幾十秒甚至更長的 rollout 不至於崩壞。

對於遊戲產業,這代表未來或許能繞開部分傳統美術與關卡製作流程,由文字或參考影像直接生成可探索的虛擬場景原型,大幅縮短概念驗證週期。對於更廣泛的具身智能(embodied AI)與機器人模擬研究,一個能長時間保持空間記憶、支援相機軌跡控制的世界模型,也可以作為低成本的仿真環境來源,用於訓練與評估智能體。

團隊特別強調 AlayaWorld 是「全棧、開源、長期」專案,意味著後續會持續釋出程式碼、模型權重與資料處理工具鏈,為社群提供可擴展的研究基礎,而不只是一篇單次發表的論文。這種開放策略,加上其在长时间一致性上展現的具體技術路徑(sink frame、空間記憶、抗漂移訓練、自回歸蒸餾的組合),很可能成為後續世界模型研究的重要參考範本。