Frontis-MA1:用 35B 模型打造能自我進化的 AI 工程師
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
背景
「遞歸自我改進」(Recursive Self-Improvement, RSI)一直是 AI 領域最具野心也最具爭議的目標之一:如果一個 AI 系統能夠親手改進「打造 AI 的流程」本身(作者稱之為 AI4AI),理論上就能形成一個不斷加速的正向循環。但這個概念過去大多停留在哲學討論層面,缺乏一個可以量化、可重複驗證的實驗場。
這篇由 24 位研究者共同完成的論文(arXiv:2607.28568,2026 年 7 月 30 日提交)提出,機器學習工程(Machine Learning Engineering, MLE)正是研究 RSI 的絕佳試驗場——因為每一個 MLE 任務(例如訓練一個分類模型、調參、寫資料前處理程式)都有明確的、可執行驗證的成敗標準(例如 Kaggle 式的分數),而不是模糊的主觀判斯。基於這個想法,團隊打造了一整套開源系統 OpenMLE,並在其上訓練出一個 350 億參數(35B)的模型 Frontis-MA1,讓它扮演「元進化代理人」(meta-evolution agent),專門負責自動撰寫、除錯、改良機器學習程式碼。
方法
OpenMLE 由三個互相銜接的子系統組成:
- OpenMLE-Gym:提供大量「可驗證」的任務環境,每次程式碼執行都會回傳明確的執行回饋(成功/失敗、分數高低),作為訓練訊號。
- OpenMLE-RL:負責「算子學習」(operator learning),也就是訓練模型掌握處理程式碼的基本動作。
- OpenMLE-Evo:實作長視野搜尋(long-horizon search),把訓練好的算子串接成一個能持續迭代、演化程式碼的搜尋流程。
核心設計是四個「原子級程式演化算子」:Draft(從零草擬一版解法)、Improve(在現有解法上優化)、Debug(定位並修復錯誤)、Crossover(把兩個不同解法的優點重組)。這四個算子先透過「執行落地」(execution-grounded)的 SFT(監督微調)與 RL 訓練——也就是每一步訓練資料都對應真實可執行、可驗證對錯的程式碼片段,而且訓練資料經過去重處理,確保與所有評測 benchmark 完全不重疊,避免「背答案」的作弊疑慮。
訓練完成後,這些算子不是各自獨立使用,而是被組合進 OpenMLE-Evo 的長視野搜尋迴圈中,讓「學習」(training)與「演化搜尋」(evolutionary search)耦合在同一個閉環裡:模型一邊用學到的算子生成、修改程式碼,一邊透過搜尋機制探索更廣的解法空間,形成一個從訓練到推理都圍繞著同一套算子設計的一致架構。
實驗結果
團隊在 MLE-Bench Lite 上做了嚴格的資源限制測試:每個任務只給 12 小時預算,並且只用單張 RTX 4090(顯示記憶體上限鎖定在 12GB),模擬真實世界中資源受限的工程場景。結果顯示:
- 未經強化的基礎模型(base model)Medal Average 只有 39.39%;
- 換上 Frontis-MA1 並搭配 OpenMLE-Evo 搜尋後,Medal Average 大幅提升到 60.61%;
- 若再啟用 OpenMLE-Evo-Max(加入與 benchmark 無關的通用經驗先驗知識,並採非同步搜尋架構),成績進一步衝到 71.21%。
這個 71.21% 的成績已經超越了 GPT-5.5 + Codex 的組合,並且逼近 GPT-5.6 Sol 與參數量高達 2.8 兆(2.8T)的 Kimi K3——意味著一個 35B 的專門化模型,配合正確的訓練與搜尋架構,在受限硬體資源下也能追上規模大上百倍的通用模型。
在另一個完全沒有出現在訓練資料中的評測集 NatureBench Lite 上,團隊做了消融實驗來驗證「模型」與「框架」各自的貢獻:固定使用 OpenMLE-Evo 框架,但把底層模型從基礎模型換成 Frontis-MA1,Match-SOTA 分數從 50% 提升到 70%;反過來固定使用 Frontis-MA1 模型,但把搜尋框架從陽春版換成 OpenMLE-Evo,Match-SOTA 則從 20% 提升到 50%。這說明訓練出來的模型能力與演化搜尋框架都各自帶來實質貢獻,而且兩者的效果在未見過的新任務上依然能夠遷移(transfer),不是單純過擬合訓練分佈。
意義
這篇論文的重要性不只在於刷新了 benchmark 分數,更在於它把「AI 自己改進造 AI 的流程」這件事,從抽象概念變成了一套可以被拆解、可以被複現的具體工程堆疊。透過把 RSI 拆成四個原子算子(Draft、Improve、Debug、Crossover),研究者證明了複雜的「自我演化」行為,其實可以被分解成幾個可單獨訓練、可組合的基本動作,而不是一個黑盒子式的整體能力。
另一個關鍵訊號是效率:在單張消費級顯卡(RTX 4090,12GB VRAM)、有限時間(12 小時/任務)的條件下,一個 35B 模型就能逼近數兆參數的頂尖閉源模型表現。這對於資源有限的研究團隊或新創公司而言,意味著「打造能自動做機器學習工程的 AI」不再是只有大型實驗室才能負擔的遊戲。
最後,團隊選擇完全開源模型權重與整套 OpenMLE 工具鏈(Gym、RL、Evo),並公開發布在 GitHub(FrontisAI/OpenRSI),這對整個 RSI 研究社群是重要貢獻——它讓「可執行、可驗證的 AI4AI」研究第一次有了一個公開、可重複的基準起點,後續研究者可以直接在此基礎上疊代,而不必從零建構整套驗證環境。這種開放策略,某種程度上也呼應了論文本身的精神:透過共享與疊代,加速整個領域朝向真正的遞歸自我改進邁進。