← 目錄

K1 論文詳解

2026-07-05


Program-as-Weights:把模糊功能編譯成可離線執行的神經權重

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

University of WaterlooWentao Zhang、Liliana Hotsko、Woojeong Kim、Pengyu Nie、Stuart Shieber、Yuntian Deng76Hugging FacearXiv
LLMLoRA模型壓縮程式合成邊緣運算

背景

日常軟體開發中,有大量任務其實很難用明確規則寫死,例如「判斷哪些日誌行值得警示」「修復格式錯誤的 JSON」「依使用者意圖排序搜尋結果」。這類工作的共通點是:輸入輸出的對應關係模糊、難以窮舉條件分支,傳統程式碼寫起來又臭又長,於是工程團隊近年乾脆把它們外包給大型語言模型(LLM)API,每次呼叫都即時推論一次。這種做法雖然方便,卻犧牲了三件事:本地化(local)執行能力、結果的可重現性,以及成本——畢竟每次呼叫都要付費,且依賴雲端網路。

由 Wentao Zhang、Yuntian Deng 等六位作者(涵蓋多間機構)於 2026 年 7 月投稿 arXiv 的這篇論文,提出了一個新的程式設計典範,稱為「fuzzy-function programming」(模糊函式程式設計)。核心想法很直白:與其把「模糊函式」當成每次都要問一次 LLM 的問題,不如把它「編譯」成一個小巧、可在本地重複執行的神經網路產物(neural artifact),就像編譯器把原始碼編譯成執行檔一樣——只是這次編譯出來的不是機器碼,而是一組權重。

方法

論文提出的具體實作方案叫做 Program-as-Weights(PAW)。整個流程分成「編譯」與「執行」兩階段:

編譯階段由一個 4B 規模、經過訓練的 Qwen3 編譯器(compiler)負責,把開發者用自然語言寫的函式規格(specification)轉換成一組參數效率極高的 adapter(基於 LoRA)。具體來說,PAW 的「程式」是混合式的:一半是離散的「偽程式碼」(pseudo-program,由未經訓練、現成的 Qwen3-4B 模型透過提示直接改寫規格與範例產生),另一半是連續的 LoRA 權重——由訓練過的 LoRA 編譯器讀取規格與偽程式碼後,從 64 個學習出的前綴 token(T=64)、跨多層(L)萃取隱藏狀態,再透過一個「LoRA Mapper」映射成實際的 LoRA 參數。這個 Mapper 用共享的可學習基底(rank r=64、每種模組類型 N=64 組基底),每個函式大約注入 3850 萬個參數。

執行階段則交給一個凍結不動、輕量的 0.6B(或 0.8B)Qwen3 直譯器(interpreter),只要熱插拔對應的 LoRA adapter,就能離線執行任何已編譯好的函式。

訓練資料是團隊自建並公開釋出的 FuzzyBench,規模達 1000 萬筆範例。生成方式分兩階段:先用 gpt-5.2 產生超過 800 種模糊任務類別,涵蓋 29 個主題版本,再展開成七大任務家族(文字處理/NLP 佔 250 萬筆、解析、分類、命名實體辨識、結構化輸出生成、程式碼生成、安全性驗證等),並加入八種雜訊擾動(拼字錯誤、語法錯誤、表述模糊、格式混亂)三種強度等級,測試集則要求 gpt-5.2 與 gpt-5-mini 的輸出彼此一致才視為有效標註。訓練只更新 LoRA 編譯器,偽編譯器與直譯器全程凍結,3 個 epoch、有效批次大小 48、學習率 2×10⁻⁵,在 B300/H200 GPU 上耗時 3 到 72 小時不等。

實驗結果

在 FuzzyBench 上,0.6B 的 Qwen3 直譯器搭配 PAW 程式達到 73.78% 精確匹配率(exact match),反而超越直接對 Qwen3-32B 做提示(prompting)的 68.70%——用的推論記憶體卻只有約五十分之一(1.2GB vs. 60GB)。作為對照的上限,gpt-5.2 本身在此基準上是 96.09%,gpt-5-mini 是 91.87%。

消融實驗顯示 PAW 的優勢並非只靠訓練資料量:同樣資料下,全量微調 0.6B 模型只有 58.4%,固定 LoRA(r=64)只有 52.1%,分別比 PAW 低 15.4 與 21.7 個百分點;程式碼生成基線 ALCHEmist 更只有 23.1%。而作者早期嘗試用 KV-cache 前綴微調(prefix-tuning)取代 LoRA,在同等運算量下僅 50.4%,遠不如 LoRA 在 r=64 時的 65.7%,因此最終選定 LoRA 方案。

效能與部署面同樣亮眼:模型量化為 Q4_K_M 基底加 Q4_0 LoRA 後,總體積約 507MB(430MB 共享基底 + 每程式 23MB adapter),在 MacBook M3 上以 Metal 加速可跑到每秒 30 個 token,冷啟動載入僅需 0.48 秒。即使把直譯器換成更小的 GPT-2(124M參數),準確率仍有 54%;把編譯器換成 Qwen3-VL-4B,還能不改動文字直譯器就處理圖像任務,例如圖表理解(CoSyn-400K)在電路圖項目達 0.274,優於同量級 VLM 基線的 0.196。抗雜訊測試中,乾淨規格下 73.78% 的準確率,在重度拼字雜訊下,若保留偽程式碼這層「去噪」機制仍有 69.28%,拿掉則掉到 64.78%,顯示 4B 編譯器的改寫步驟能有效保護小型直譯器不受規格文字雜訊干擾。此外論文也展示了五個實際應用案例,包括一個由 10 個 PAW 函式串接的工具呼叫(tool-calling)流程,在 ToolCall-15 基準上拿下 93% 的分數。

意義

PAW 最重要的概念轉變,是把基礎模型(foundation model)從「每次輸入都要重新求解一次的問題解算器」,改造成「只需為每個函式定義呼叫一次的工具打造者(tool builder)」。編譯只發生一次,之後每次呼叫該函式都是離線、便宜、可重現的本地運算,不再依賴雲端 API 也不再產生持續性的推論成本。

這對實務工程有直接影響:過去許多「懶得寫規則、乾脆呼叫 LLM API」的小型判斷邏輯(日誌告警分級、模糊搜尋排序、資料格式修復),現在可以被編譯成一個幾百 MB、能塞進手機或筆電本地執行的小模型,速度、隱私與成本都大幅改善,同時保留了接近大型模型的準確度。更廣義地看,這篇論文也是超網路(hypernetwork)研究路線的一次延伸——不再只是根據問答情境生成連續型的 PEFT 模組,而是根據「工程師風格」的功能規格生成離散加連續混合的「程式」,並將其當作可版本控管、可分發的軟體產物來看待,為未來「用自然語言定義、編譯出本地小模型」的開發模式打開了一個具體可行的範例。

AgenticSTS:以「有界記憶」重新設計長時程 LLM 代理人測試平台

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

Alaya StudioXiangchen Cheng、Yunwei Jiang、Jianwen Sun、Zizhen Li、Chuanhao Li、Xiangcheng Cao、Yihao Liu、Fanrui Zhang46Hugging FacearXiv
LLM Agent長時程規劃記憶機制Slay the SpireBenchmark

背景

近年 LLM agent 被期待處理需要數十甚至數百步決策的長時程(long-horizon)任務,例如玩策略遊戲、執行多階段工作流程。目前最主流的記憶做法非常樸素:把過去所有的觀察(observation)、工具呼叫(tool call)、反思(reflection)全部原封不動地塞進每一次的 prompt 裡,讓 context 隨著回合數線性甚至更快地膨脹。這種「全部堆疊」的做法雖然簡單,讓模型「什麼都看得到」,但也帶來一個難以忽視的副作用:prompt 變成一團渾濁的混合物,研究者根本無法分辨究竟是哪一段記憶、哪一層機制真正影響了某個決策。換句話說,這種契約(memory contract)對「未來的決策可以看到什麼」沒有做出清楚的界定,也讓消融實驗(ablation)幾乎不可行——你拿掉一段記憶,prompt 的其餘部分早已被污染。

AgenticSTS 這篇論文(arXiv:2607.02255,作者包含 Xiangchen Cheng、Kaipeng Zhang 等十人)正是針對這個問題,提出一個「有界記憶」(bounded memory)的替代契約,並用一款高複雜度的策略遊戲當作測試場來驗證這個想法。

方法

論文的核心設計是:每一次決策都從一則「全新組裝」的使用者訊息出發,透過 typed retrieval(有型別的檢索)去挑選需要的資訊片段,而不是把跨決策的原始逐字稿(raw cross-decision transcript)整段附加上去。這樣做的直接效果是,無論一局遊戲跑了多少回合,prompt 的長度都維持在一個固定的上限內,不會隨著時間累積而爆炸。更重要的是,因為記憶被拆成獨立的「層」(layer),研究者可以針對任何單一一層做開關實驗,觀察它對決策品質的邊際貢獻,而不受其他記憶內容干擾。

他們選擇的測試環境是《Slay the Spire 2》——一款規則封閉(closed-rule)但具有隨機性的卡牌構築(deck-building)遊戲,一局完整遊戲需要數百次戰術與戰略層級的決策,非常適合檢驗長時程代理人的穩定度與規劃能力。論文中比較的其中一項關鍵記憶層是「觸發式戰略技能」(triggered strategic skills)——當特定遊戲狀態被觸發時,代理人可以調用預先設計好的策略片段。實驗設計包含一個「fixed-A0」的消融組,比較不含任何額外儲存機制的 no-store baseline,與加入技能層之後的版本。

實驗結果

作為對照組,論文引用了一個公開的線上 benchmark:在最低難度下,五種前沿 LLM 設定在該 benchmark 上全數拿下零勝(0 wins),而遊戲開發者自行統計的人類玩家在同難度的勝率則是 16%。這說明這個任務「難但尚未飽和」——目前的 LLM agent 遠遠落後人類,但並非完全不可能突破。

在 AgenticSTS 自己的實驗框架中,fixed-A0 消融顯示出目前觀察到差距最大的比較:no-store baseline 在 10 局中贏了 3 局(3/10),而加入觸發式戰略技能層之後,勝場提升到 6 局(6/10)。不過作者也誠實指出,以這個樣本數(10 局)來看,Fisher 精確檢定的 p 值約為 0.37,因此這個差異只能算是「方向性」的訊號,還稱不上具有統計顯著性的結論。此外,論文也做了跨骨幹模型(cross-backbone)的初步探測,以及與公開的「累積式 context」baseline 做操作性比較,但作者明確聲明這些屬於操作層面的觀察,而非針對「記憶契約」這個變數本身的嚴格控制實驗。

最終,團隊釋出了一套可重現的測試平台,包含 298 條完整的遊戲軌跡(trajectories)並附帶條件標籤(condition tags)、凍結版本的記憶與技能快照、完整的 prompt 紀錄,以及分析腳本,方便後續研究者直接復現或延伸實驗。

意義

這篇論文的貢獻與其說是「刷新了某個 benchmark 分數」,不如說是提供了一套研究方法論:如何在長時程 agent 任務中,把記憶機制拆解成可以獨立測量、獨立消融的模組。過去許多 agent 論文在報告「加了記憶模組後表現變好」時,往往難以排除「context 更長」「資訊更雜」等混淆因素;AgenticSTS 的有界契約設計,讓研究者第一次可以在 prompt 長度恆定的前提下,乾淨地比較「有沒有某一層記憶」的效果。

雖然 3/10 對 6/10、p≈0.37 的結果距離「統計顯著」還有距離,但方向性訊號本身已具參考價值,尤其是在 LLM agent 於複雜策略遊戲中普遍「零勝」的背景下,任何能把勝率從接近零推向兩位數趴數區間的機制都值得關注。更重要的是,298 條完整軌跡加上凍結快照與分析腳本的公開釋出,讓「記憶層如何影響長時程決策」這個問題從單篇論文的軼事觀察,轉變成一個社群可以持續累積證據、跨模型骨幹複現驗證的開放研究議題。對於正在設計 RAG、工具調用、多步規劃型 agent 的工程師來說,這種「拆解記憶契約、逐層消融」的思路,也提供了一個排查「究竟是哪個記憶元件在幫忙、哪個在添亂」的實用範本。

EvoPolicyGym:當AI代理人被要求「自己進化策略」,誰才是真正的贏家?

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

Zhilin Wang、Han Song、Runzhe Zhan、Jusen Du、Jiacheng Chen、Tianle Li、Qingyu Yin、Yulun Wu43Hugging FacearXiv
AI agent強化學習benchmarkGPT-5.5policy evolution

背景

近幾年大型語言模型(LLM)驅動的自主代理人(agent)已經能寫程式、修bug、甚至跑完整個軟體工程流程,但研究者發現一個被長期忽略的問題:當代理人被要求「持續改進一段可執行的決策程式」時,現有評測方式往往只看最終分數,或是把這個過程和開放式的軟體工程進度混在一起,無法真正衡量代理人「把回饋轉換成通用性改進」的能力。

換句話說,一個agent修好一個bug、通過一次測試,跟一個agent能不能在有限的互動次數內,持續觀察環境回饋、猜測失敗原因、修改策略邏輯、驗證效果、再迭代——這是兩種完全不同層次的能力。EvoPolicyGym這篇論文就是想把後者獨立出來,設計一個「乾淨」的測試場景,稱之為Autonomous Policy Evolution(自主策略進化)。這篇論文由來自中國科學技術大學、香港中文大學、澳門大學、清華大學、浙江大學、蘇州大學、Brown University、上海交通大學等機構共16位作者合作完成,已於2026年7月2日發表於arXiv(編號2607.02440)。

方法

論文的核心設計是:讓一個「harness-model agent」(即某個LLM搭配特定的agent框架,例如Codex或Claude Code)反覆編輯一段可執行的策略系統(policy),而且每個環境只給固定128回合(episode)的互動預算,不能無限重跑。

策略系統的介面很單純:一個Python class,包含reset和act兩個方法,agent可以自由加入輔助模組、參數、狀態管理與診斷程式碼,但核心邏輯必須是「用觀察值和過去記憶決定動作」的決策規則。評測採伺服器端仲裁機制與快照式(snapshot)檢查點,關鍵設計是嚴格的可見性邊界:訓練回饋對agent可見,但驗證集與最終held-out評測結果完全隱藏,避免agent「偷看答案」式地過擬合。

測試環境集合稱為Core16,涵蓋四大類、共16個Gymnasium相容環境:

  • Gym/Box2D:CartPole、MountainCar、LunarLander、ContinuousCar
  • MuJoCo:HalfCheetah、Ant、Swimmer、Walker2d
  • MiniGrid:KeyCorridor、FourRooms、LockedRooms、ObstructedMaze
  • Robotics/Driving:FetchPickAndPlace、Parking、CarRacing、BipedalWalker、Roundabout

參與評測的四組agent-harness組合為:GPT-5.5(搭配Codex harness)、Claude Opus 4.7(搭配Claude Code harness)、MiniMax-M3(Claude Code harness)、DeepSeek-V4-Pro(Claude Code harness)。所有組合使用相同的執行參數,但保留各家廠商預設的推理與token管理策略,這些差異僅作為診斷資訊記錄,不計入最終分數。

論文另一個重要方法貢獻,是把agent的修改行為拆成兩種機制做軌跡層級(trajectory-level)分析:「結構性合成」(structural synthesis,例如重寫程式邏輯、加入新的感知或規劃模組)與「參數調校」(parametric tuning,例如微調現有數值)。前者常見於像素感知或符號規劃這類任務(如CarRacing、MiniGrid),後者則常見於低維度連續控制任務(如HalfCheetah、Ant、Walker2d)。

實驗結果

在Core16整體排名(aggregate rank score)上:

  • GPT-5.5:0.891分,拿下9項環境的第一名,並在全部16個環境中都排進前二名
  • Claude Opus 4.7:0.750分,5項第一、12項前二,在MiniGrid類別上表現最強(0.938)
  • MiniMax-M3:0.531分,僅1項第一
  • DeepSeek-V4-Pro:0.359分,僅1項第一
  • 均勻隨機策略基準線:0.109分

值得注意的是,GPT-5.5的優勢不只是「拿第一名的次數多」,而是幾乎在每個環境都維持在頂尖水準,顯示出穩定的跨任務覆蓋能力;Claude Opus 4.7則靠著廣泛的次佳表現守住整體第二名。

在合成型任務(synthesis-dominant)上,GPT-5.5與Claude Opus 4.7能把41%與48%的結構性編輯成功轉化為驗證集分數的提升,而MiniMax-M3與DeepSeek-V4-Pro的成功轉換率只有10%與3%,差距懸殊。頂尖agent所選出的成功策略程式碼,也明顯包含更多函式、分支與迴圈結構,顯示它們確實在「建構」而非單純調參。

在調校型任務(tuning-dominant)代表案例BipedalWalker上,只有GPT-5.5取得正的held-out回報(248.874),其餘三組模型全部停留在負分區間,顯示它們甚至沒能先找到一個「可行的步態拓樸」就開始微調參數,結果徒勞無功。另一個案例CarRacing則顯示,成功的策略會把像素影像轉換成道路遮罩、計算前瞻中心線,並加入恢復模式(recovery mode)等機制。

意義

EvoPolicyGym的貢獻不只是又一個排行榜,而是提供了一套可以拆解「agent為什麼贏」或「為什麼輸」的診斷工具。論文明確指出,強大的自主策略進化能力至少來自四件事:跨任務的穩定覆蓋率、發現「任務適配」的抽象結構(該合成而非只調參)、把可見的行為回饋轉譯成有針對性的程式碼修改,以及在有限預算下妥善保留與管理候選版本(checkpoint)。

這對正在評估「用LLM agent做強化學習/控制策略研發」這條路線的團隊有直接參考價值:如果只看最終分數,很容易誤判一個agent「運氣好通過了某個任務」與「真正具備策略工程能力」的差別。EvoPolicyGym用固定預算、隱藏驗證集、軌跡級別診斷的設計,把這兩者拆開,也為未來評測「AI能不能自我改進」提供了一個更嚴謹、更難被作弊的框架。作者也坦承其分析方法(如AST程式碼結構分析)無法真正「語意證明」機制正確性,合成/調校的二分法也只是分析視角而非絕對分類,這些侷限也值得後續研究者留意。