← 目錄

K1 論文詳解

2026-08-03


Frontis-MA1:用 35B 模型打造能自我進化的 AI 工程師

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Frontis AIJunlin Yang、Che Jiang、Yu Fu、Tianwei Luo、Can Ren、Weizhi Wang、Kaikai Zhao、Hongyi Liu168Hugging FacearXiv
遞歸自我改進機器學習工程強化學習AI4AIbenchmark

背景

「遞歸自我改進」(Recursive Self-Improvement, RSI)一直是 AI 領域最具野心也最具爭議的目標之一:如果一個 AI 系統能夠親手改進「打造 AI 的流程」本身(作者稱之為 AI4AI),理論上就能形成一個不斷加速的正向循環。但這個概念過去大多停留在哲學討論層面,缺乏一個可以量化、可重複驗證的實驗場。

這篇由 24 位研究者共同完成的論文(arXiv:2607.28568,2026 年 7 月 30 日提交)提出,機器學習工程(Machine Learning Engineering, MLE)正是研究 RSI 的絕佳試驗場——因為每一個 MLE 任務(例如訓練一個分類模型、調參、寫資料前處理程式)都有明確的、可執行驗證的成敗標準(例如 Kaggle 式的分數),而不是模糊的主觀判斯。基於這個想法,團隊打造了一整套開源系統 OpenMLE,並在其上訓練出一個 350 億參數(35B)的模型 Frontis-MA1,讓它扮演「元進化代理人」(meta-evolution agent),專門負責自動撰寫、除錯、改良機器學習程式碼。

方法

OpenMLE 由三個互相銜接的子系統組成:

  1. OpenMLE-Gym:提供大量「可驗證」的任務環境,每次程式碼執行都會回傳明確的執行回饋(成功/失敗、分數高低),作為訓練訊號。
  2. OpenMLE-RL:負責「算子學習」(operator learning),也就是訓練模型掌握處理程式碼的基本動作。
  3. OpenMLE-Evo:實作長視野搜尋(long-horizon search),把訓練好的算子串接成一個能持續迭代、演化程式碼的搜尋流程。

核心設計是四個「原子級程式演化算子」:Draft(從零草擬一版解法)、Improve(在現有解法上優化)、Debug(定位並修復錯誤)、Crossover(把兩個不同解法的優點重組)。這四個算子先透過「執行落地」(execution-grounded)的 SFT(監督微調)與 RL 訓練——也就是每一步訓練資料都對應真實可執行、可驗證對錯的程式碼片段,而且訓練資料經過去重處理,確保與所有評測 benchmark 完全不重疊,避免「背答案」的作弊疑慮。

訓練完成後,這些算子不是各自獨立使用,而是被組合進 OpenMLE-Evo 的長視野搜尋迴圈中,讓「學習」(training)與「演化搜尋」(evolutionary search)耦合在同一個閉環裡:模型一邊用學到的算子生成、修改程式碼,一邊透過搜尋機制探索更廣的解法空間,形成一個從訓練到推理都圍繞著同一套算子設計的一致架構。

實驗結果

團隊在 MLE-Bench Lite 上做了嚴格的資源限制測試:每個任務只給 12 小時預算,並且只用單張 RTX 4090(顯示記憶體上限鎖定在 12GB),模擬真實世界中資源受限的工程場景。結果顯示:

  • 未經強化的基礎模型(base model)Medal Average 只有 39.39%
  • 換上 Frontis-MA1 並搭配 OpenMLE-Evo 搜尋後,Medal Average 大幅提升到 60.61%
  • 若再啟用 OpenMLE-Evo-Max(加入與 benchmark 無關的通用經驗先驗知識,並採非同步搜尋架構),成績進一步衝到 71.21%

這個 71.21% 的成績已經超越了 GPT-5.5 + Codex 的組合,並且逼近 GPT-5.6 Sol 與參數量高達 2.8 兆(2.8T)的 Kimi K3——意味著一個 35B 的專門化模型,配合正確的訓練與搜尋架構,在受限硬體資源下也能追上規模大上百倍的通用模型。

在另一個完全沒有出現在訓練資料中的評測集 NatureBench Lite 上,團隊做了消融實驗來驗證「模型」與「框架」各自的貢獻:固定使用 OpenMLE-Evo 框架,但把底層模型從基礎模型換成 Frontis-MA1,Match-SOTA 分數從 50% 提升到 70%;反過來固定使用 Frontis-MA1 模型,但把搜尋框架從陽春版換成 OpenMLE-Evo,Match-SOTA 則從 20% 提升到 50%。這說明訓練出來的模型能力與演化搜尋框架都各自帶來實質貢獻,而且兩者的效果在未見過的新任務上依然能夠遷移(transfer),不是單純過擬合訓練分佈。

意義

這篇論文的重要性不只在於刷新了 benchmark 分數,更在於它把「AI 自己改進造 AI 的流程」這件事,從抽象概念變成了一套可以被拆解、可以被複現的具體工程堆疊。透過把 RSI 拆成四個原子算子(Draft、Improve、Debug、Crossover),研究者證明了複雜的「自我演化」行為,其實可以被分解成幾個可單獨訓練、可組合的基本動作,而不是一個黑盒子式的整體能力。

另一個關鍵訊號是效率:在單張消費級顯卡(RTX 4090,12GB VRAM)、有限時間(12 小時/任務)的條件下,一個 35B 模型就能逼近數兆參數的頂尖閉源模型表現。這對於資源有限的研究團隊或新創公司而言,意味著「打造能自動做機器學習工程的 AI」不再是只有大型實驗室才能負擔的遊戲。

最後,團隊選擇完全開源模型權重與整套 OpenMLE 工具鏈(Gym、RL、Evo),並公開發布在 GitHub(FrontisAI/OpenRSI),這對整個 RSI 研究社群是重要貢獻——它讓「可執行、可驗證的 AI4AI」研究第一次有了一個公開、可重複的基準起點,後續研究者可以直接在此基礎上疊代,而不必從零建構整套驗證環境。這種開放策略,某種程度上也呼應了論文本身的精神:透過共享與疊代,加速整個領域朝向真正的遞歸自我改進邁進。

PhiZero:讓世界模型先「用語言思考」再生成影片

PhiZero: A World Model Built Around Physical Language

Chinese Academic of Science Institute of AutomationShuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang159Hugging FacearXiv
世界模型影片生成具身智能多模態物理常識推理

背景

近年的物理世界模型(physical world model)大多採取「直接在像素空間預測未來影片」的做法:給定一段起始畫面,模型透過影片擴散(diffusion)技術逐幀「腦補」接下來會發生什麼。這種做法雖然能生成畫面精美的影片,但物理世界如何演變的邏輯,始終被埋藏在高維度的視覺特徵裡,無法被拆解、檢視或推理——模型「知道」球會滾落,卻無法明確表達「為什麼」以及「按什麼規則」滾落。

這篇由中國科學院自動化研究所(CASIA)NLPR 團隊發表的論文《PhiZero: A World Model Built Around Physical Language》(arXiv:2607.28624,2026 年 7 月 30 日提交)指出一個關鍵觀察:人類在觀看世界時,會自動把視覺經驗中重複出現的規律抽象成語言概念(例如「掉落」「碰撞」「彈起」),再用這些概念做顯式推理,而不是直接在腦中「重播畫面」去預測未來。既然人類是這樣運作的,世界模型是否也能學出一套屬於物理世界的「語言」,先用這套語言推理事件將如何演變,再把推理結果「翻譯」回影片畫面?這就是 PhiZero 想解決的問題——建立一種介於像素與自然語言之間的中介表示,稱為「physical language(物理語言)」。

方法

PhiZero 的核心設計是「reason-then-render(先推理、後渲染)」兩階段架構,由兩個主要模組組成:physical language tokenizer(物理語言分詞器)與 physical language reasoner(物理語言推理器)。

Tokenizer 部分:先用 Wan2.2 架構的時空 VAE 編碼器把影片轉成潛在特徵,再用一個帶有 32 個可學習查詢(query)的「transition-level Q-Former」,專門處理相鄰兩個潛在狀態之間的「轉變」而非單幀畫面本身——這是關鍵的歸納偏置(inductive bias),讓模型聚焦於「狀態如何改變」而不是「畫面長什麼樣」。接著用有限標量量化(Finite Scalar Quantization, FSQ)把連續特徵離散化成詞彙表大小 25,000(配置為 8×5×5×5×5×5)的符號序列。一段 33 幀的影片最終只需壓縮成 256 個離散 token,相較傳統 VAE 基線所需的 44,800 個連續 token,壓縮率提升超過 170 倍,同時重建品質(在 512×896 解析度下)依然更優。解碼端則採用預訓練的 Wan2.2-5B 影片擴散模型,用 LoRA(rank 32)微調,把物理語言序列「渲染」回真實影片。團隊還發現一個工程細節很關鍵:若不做「pure-noise warm-up(純噪聲預熱)」訓練,解碼器容易直接忽略物理語言條件、退化成普通的影片生成器。

Reasoner 部分:以 Qwen3-VL-4B 這個視覺語言模型為基礎,擴充詞彙表加入每個 FSQ 索引對應的原子符號,讓模型能像預測文字一樣,以自回歸方式根據「第一幀畫面+文字動作意圖」預測接下來的物理語言序列(交叉熵損失)。

訓練資料規模相當龐大:tokenizer 先在約 5 萬小時的野外影片池中篩選出約 1 萬小時進行預訓練,再用約 500 萬段 4 秒短片微調,資料來源涵蓋自建資料(250 萬)、HOIGen-1M(57.4 萬)、OpenVid-1M(51.6 萬)、Moments in Time(52.8 萬)等真實影片,以及 Phyco、ComPhy、Cosmos3、CLEVRER、Physion++、Physion 等模擬資料。Reasoner 則先在同樣的 500 萬段影片(搭配 VLM 生成的描述文字)上繼續預訓練,再用約 100 萬段(80 萬篩選真實片段+20 萬模擬器生成片段)聚焦動作的資料做監督微調。整套訓練使用 128 張 NVIDIA A100 GPU。

實驗結果

PhiZero 在生成與理解兩大類基準上都取得最佳表現:

  • Physics-IQ Verified(66 組受控物理實驗):在 IQ-Score 指標上取得最佳成績,顯示其模擬的物理過程(碰撞、重力、慣性等)與真實世界最為吻合。
  • PhyGround(250 組圖文條件,涵蓋固體力學、流體動力學、光學等 13 類物理定律,由 PhyJudge-9B 評分):Physics Score 與 Overall 分數均為第一。
  • WorldModelBench(350 組圖文條件,涵蓋自動駕駛、機器人、人類活動、工業場景、遊戲、動畫、自然環境 7 大領域):Physics Adherence 與 Total 分數同樣領先。
  • 在影片理解類基準,如 IntPhys2(1,012 支影片、253 組四元組,測物體恆存性、連續性等)、LikePhys(12 種場景的合法/不合法影片對,測似真性判斷)、YoCausal(1,232 組真實影片對,測時序與因果理解),PhiZero 也展現出更貼近人類直覺物理的判斷能力。

消融實驗進一步驗證了設計選擇的合理性:預訓練擴散解碼器帶來最大的性能提升;transition-level Q-Former 明顯優於處理全域畫面的 Q-Former;純噪聲預熱策略能穩定提升重建品質;兩階段訓練優於一次性聯合訓練;混入模擬資料能反過來提升真實世界生成的品質;而僅用自然語言做推理(不引入專屬的物理語言)則明顯不足,證明專門學出的離散物理語言確實提供了自然語言無法取代的細粒度表示能力。

論文也展示了幾項延伸應用:互動式連續推演(根據自然語言指令逐步控制世界演變)、在 nuScenes 與 AGI-Bot RealRobot 資料集上的細粒度動作條件模擬,以及零樣本(zero-shot)動作遷移——包括把人類動作遷移到人形機器人身上,以及模擬到真實(sim-to-real)的跨域遷移,且完全不需要成對的訓練資料。

意義

PhiZero 的價值不只在於「生成的影片更符合物理定律」,更在於它示範了一條介於「純像素預測」與「純語言描述」之間的中間路線:讓世界模型擁有一套自己專屬、可離散化、可被 transformer 直接建模的「物理詞彙」,藉此把隱式的視覺動態顯式化為可推理的符號序列。這種設計呼應了近年在 LLM 領域廣受驗證的「先想清楚、再輸出」思路(類似 chain-of-thought 或 RLHF 對齊中強調的顯式推理步驟),把同樣的哲學搬到了影片與具身智能(embodied AI)領域。

對機器人、自動駕駛等需要「预测物理後果再行動」的下游應用而言,若世界模型能明確輸出「物理語言」序列,而不只是模糊的像素預測,就更容易被解讀、除錯、甚至與規劃(planning)模組對接。250 倍級別的壓縮率(256 vs 44,800 token)也意味著未來在自回歸世界模型中結合語言與物理推理的計算成本可望大幅降低。整體而言,PhiZero 提供了一個具體、可量化驗證的範例,說明「先推理後渲染」可能是通往下一代更具物理常識、更可控的世界模型的重要路徑。

DistillAlign:讓自回歸影片蒸餾同時學會「求廣」與「求精」

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

Jiaxing Li、Kai Zou、Cindy Zhou、Kaichen Huang、Junyao Gao、Zile Wang、Yang Liu、Bin Liu89Hugging FacearXiv
影片生成模型蒸餾DMD自回歸模型VBench

背景

近年的自回歸(autoregressive)影片生成模型雖然畫質亮眼,但推理速度慢,業界因此普遍採用 Distribution Matching Distillation(DMD)技術把大型教師模型「蒸餾」成能快速生成的學生模型。標準做法分成多個階段:先用某種初始化方法(例如因果強制訓練或 Consistency Distillation)讓學生模型學會基本生成能力,再用 DMD 針對教師模型的機率分佈做進一步微調。

問題在於,這兩個階段長期以來是「各做各的」——初始化階段只看 VBench 這類視覺品質分數來挑選最好的起點,卻沒人問一個關鍵問題:這個起點所覆蓋的「分佈範圍」,跟後面 DMD 教師模型真正想蒸餾的目標分佈,是否吻合?

本篇論文(作者來自多個機構的十人團隊,2026 年 7 月提交至 arXiv,分類 cs.CV)指出,DMD 的核心目標函數是逆向 KL 散度(reverse-KL),這種目標函數天生具有「mode-seeking」(求精、收斂到高機率區域)傾向,而不是「mode-covering」(求廣、盡量覆蓋所有可能模式)。如果初始化階段挑選的模型雖然畫質高分,但其實只覆蓋了教師分佈的一小塊區域(即低覆蓋率、高精確率),那麼後續 DMD 精修只會在這塊小區域內反覆打磨,永遠補不回原本就沒學到的多樣性。研究團隊將此稱為「Hypothesis I:模式不匹配」。他們進一步發現,即使初始化階段的分佈已經對齊教師模型,DMD 訓練到後期仍會因為 reverse-KL 的本質持續往教師模型的高機率區域收縮,導致多樣性隨訓練步數增加而下降,稱為「Hypothesis II:後期漂移」。

方法

為了驗證上述假設,團隊提出一套「分佈式評估協議」:利用 V-JEPA2 編碼器把學生與教師模型生成的影片樣本投影到同一個潛在空間,再以 k 近鄰(k=5)方式計算兩個核心指標——precision(精確率,學生樣本是否落在教師模型的支持區域內)與 coverage(覆蓋率,教師模型的各個「模式」有多少比例被學生樣本觸及),另外搭配 Vendi score 衡量多樣性。這套協議揭露了單看 VBench 看不出的問題:某些初始化方法 VBench 分數很高,但 coverage 卻很低,說明其視覺品質是「假精緻」——只是收斂到少數模式而已。

基於這個診斷,論文提出「Joint Distillation(聯合蒸餾)」:把 DMD 的求精損失與一個基於 Consistency Distillation(CD)的求廣約束項結合成單一目標,L_joint = L_DMD + λ·L_CD,預設權重 λ=0.01。CD 的特性是傾向擴張支持範圍、優先提升 coverage,恰好抵銷 DMD 後期收縮多樣性的傾向,讓兩種目標在訓練過程中互相校正、動態平衡。

實驗以 Wan2.1-T2V-1.3B(生成 832×480、81 帧影片)為學生模型骨架,訓練分三階段(基於 Causal Forcing 框架):第一階段用教師強制的自回歸擴散訓練 5000 步建立基礎能力;第二階段用 Consistency Distillation 訓練 2500 步強化模式覆蓋;第三階段才進入聯合 DMD-CD 訓練 1500 步。訓練資料分別取自 Wan-1.3B 與 Wan-14B 兩種教師模型在 VidProM 提示詞下生成的 25K 筆樣本。

實驗結果

評估採用 16 個提示詞 × 16 個隨機種子共 256 筆樣本的固定測試集,配合 Flow-UniPC 求解器(22 次模型評估)與 ρ=0.9 的重新加噪(re-noising)協議做公平比較——研究發現若不做重新加噪,直接用 ODE 求解器測得的 coverage 僅 0.020,重新加噪後才顯現真實的 0.326,證明許多初始化方法的多樣性其實被低品質噪聲掩蓋了。

在初始化方式比較(Table 7)中,Causal DMD Init 雖然精確率最高,但 coverage 僅 0.306,遠低於 Causal CD Init 的 0.478,證實 mode-seeking 式初始化確實犧牲了覆蓋率。訓練過程對比(Table 6)顯示,純 DMD 在訓練 1500 步時 VBench 84.6、coverage 0.412、多樣性分數 6.89,而聯合蒸餾在相同步數下達到 VBench 85.2、coverage 0.452、多樣性 7.31,三項指標同步提升,且純 DMD 訓練越久多樣性反而持續下滑,聯合蒸餾則能維持穩定。在權重消融實驗(Table 5)中,λ=0.01 在品質、精確率、覆蓋率三者間取得最佳平衡,λ 越大則 coverage 提升但畫質下降。最引人注目的結果是:即使只用較小的 Wan-1.3B 作為 DMD 教師模型,DistillAlign 依然在整體表現上超越了用 Wan-14B 大教師模型精修出的基線方法。

意義

這篇論文的核心貢獻不是又一個「更強的蒸餾算法」,而是指出整個領域長期忽略的評估盲點:僅用 VBench 之類的視覺品質分數來挑選蒸餾流程中的「最佳初始化」,可能系統性地選出覆蓋率不足、多樣性受損的模型,而這種缺陷在單張畫面上很難被人眼察覺。透過引入基於潛在空間近鄰的 precision/coverage 分佈式評估,團隊提供了一套可量化、可診斷的工具,讓研究者能在蒸餾流程早期就發現「品質高但多樣性差」的隱患。

更重要的實務意義在於:用小教師模型(Wan-1.3B)配合分佈對齊的訓練策略,竟能超越用十倍參數量教師模型(Wan-14B)蒸餾出的結果。這說明在影片生成蒸餾中,「教師夠大」不是決定性因素,「訓練目標分佈是否對齊」才是關鍵。對於資源有限、無法動用超大教師模型的團隊而言,這代表只要方法設計得當,也能用較小、較便宜的教師模型達到甚至超越大模型蒸餾的效果,對降低自回歸影片生成模型的部署與訓練成本具有直接的參考價值。