← 目錄

K1 論文詳解

2026-08-11


從經濟主體到主體式經濟:建構經濟世界模型的六級系統藍圖

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

FreedomAIJiale Han、Xiang Li、Jing Qian、Wenyuan Gu、Pin Gao、Ye Luo、Hongyuan Zha、Dacheng Tao33Hugging FacearXiv
EconomicWorldModelsLLMAgents多主體模擬經濟學AISim-to-Real

背景

過去經濟學研究經濟系統的方式,大多依賴外生設定的規則:給定一組供需曲線、賽局理論假設或代表性主體(representative agent),再用數學方法求解均衡。這類模型雖然嚴謹,卻難以刻畫真實經濟中「異質主體(heterogeneous agents)如何各自形成信念、互相博弈、進而共同演化出市場秩序與制度」的內生過程。近年隨著 LLM 具備語言推理與角色扮演能力,學界開始嘗試用生成式主體取代規則化主體,建立所謂的「經濟世界模型(Economic World Models, EWM)」——不是從外部規定經濟如何運行,而是讓異質主體在模擬環境中自行行動、互動、調適,由內部湧現出宏觀經濟動態。

這篇由 Jiale Han、Lin William Cong 等十位作者(涵蓋香港中文大學、康乃爾大學等機構)共同完成的論文,正是要為這個新興方向提出一份系統性的「實作路線圖」。作者指出,目前這類研究散布在 AI 論文(偏重智能能力)與傳統經濟學期刊(偏重制度真實性與統計嚴謹)兩端,彼此缺乏共同的能力分級標準,難以判斷一個模擬系統究竟達到了多高的擬真程度。

方法

論文的核心方法論貢獻是提出一套「六級能力階梯(six-level capability ladder)」,用以系統化地衡量與規劃 EWM 系統的成熟度:

  • L1 固定規則主體世界:主體行為完全由預設規則決定,不具學習能力,類似傳統的 agent-based model。
  • L2 適應性規則主體世界:主體可透過強化學習或啟發式規則調整策略,但仍侵限於預先定義的行為空間。
  • L3 LLM 驅動的主體世界:主體具備顯式信念與語言化推理能力,能以自然語言表達動機、談判、模仿人類決策。
  • L4 自我演化主體:主體能隨時間自主獲取新策略、新工具與新能力,而非停留在固定的策略集合中。
  • L5 制度共同演化世界:市場規則、契約、監管等制度本身也隨主體互動內生演變,而非外部固定設定。
  • L6 Sim-to-Real 經濟數位孿生:模擬系統持續與真實世界觀測數據對齊校正,形成可信賴的「經濟數位孿生」。

為支撐這套階梯的落地,論文進一步提出五波「工程化路徑」:特徵工程(設計觀測訊號)、資料工程(訓練更強模型)、提示工程(誘發 LLM 推理)、情境工程(記憶、工具、即時資訊接入)、以及環境工程(設計互動式經濟世界本身)。作者也給出一套類似 Python 介面的模組化架構草案,例如 ewm.make() 建立世界、world.reset() 重置狀態、world.run_agents() 執行主體決策、world.step() 推進市場與制度演化,讓不同層級的系統能以統一協議串接。

在此框架下,團隊進行了一次系統性文獻調查,盤點跨越六個層級、共 737 篇經過驗證的相關論文,分析其分佈與技術特徵,以此檢驗當前領域實際發展到哪一級。

實驗結果

這篇論文本質上是路線圖與survey,因此「實驗結果」對應的是文獻調查所揭示的產業與學術現況。調查涵蓋的 737 篇 EWM 相關論文顯示出明顯的層級失衡:

  • 研究高度集中於 L1–L3:尤其在 2024 年之後,隨著 LLM 能力提升,大量工作投入固定規則、適應性規則以及 LLM 驅動的主體模擬,例如市場交易模擬、談判博弈、消費者行為模擬等場景。
  • L4–L6 系統極度稀缺:具備「自我演化主體」「制度內生演化」「持續性真實數據對齊」以及「經過驗證的經濟機制」四項特徵的系統罕見,顯示目前多數工作仍停留在「讓 AI 主體表現得像人」的階段,而未真正做到主體與制度的共同演化,也缺乏長期與真實經濟數據校準驗證。
  • 期刊/平台呈現不同偏好:arXiv 上的論文更強調 AI 能力本身(如更強的 LLM 推理、更複雜的多主體協作),而傳統經濟學期刊則偏好保留更嚴謹的經濟學規範與可解釋的低層級系統,兩個社群之間的方法論存在明顯落差。

換言之,現有研究像是蓋了很多一樓、二樓的房子,卻幾乎沒有蓋到頂樓——最有潛力用來做政策模擬、AI 安全評估的高層級系統,目前幾乎是空白。

意義

這篇論文的價值不在於提出一個新模型,而在於為一個快速膨脹卻缺乏共同語言的研究領域,建立起可比較、可規劃的座標系。六級能力階梯讓研究者可以清楚定位自己的系統處在哪一層,也讓資助機構與產業界能評估「一個經濟模擬系統距離真正可用還有多遠」。

更長遠地看,作者將 EWM 定位為三種基礎設施:給人類決策者用的「政策沙盒」(例如在真實推行政策前,先在模擬經濟中測試通膨、稅制或監管變化的連鎖效應)、給 AI 系統用的「訓練與規劃場」(讓強化學習或 LLM agent 在高擬真的經濟環境中學習長期決策),以及「安全評估場」(在部署自主經濟 AI 之前,先在模擬制度中觀察其博弈行為是否會產生系統性風險)。隨著愈來愈多 AI agent 被投入實際市場交易、供應鏈調度甚至政策建議,這種能同時處理「異質主體智能」與「制度內生演化」的高層級經濟世界模型,可能會成為未來 AI 安全與經濟治理研究的關鍵基礎工具。作者也公開了整理後的論文清單與相關資源,方便後續研究者依循此路線圖填補 L4 至 L6 的空白。

SFT 會打架、RL 能共存:多任務強化學習如何化解 LLM 的任務衝突

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

Chinese Academic of Science Institute of AutomationKejian Zhu、Zhuoran Jin、Shangqing Tu、Hongbang Yuan、Yushi Bai、Kang Liu、Juanzi Li、Jun Zhao32Hugging FacearXiv
LLM強化學習SFT多任務學習GRPO

背景

大型語言模型(LLM)常需要同時具備數學、科學、邏輯、程式等多種推理能力,實務上團隊通常會用 Supervised Fine-Tuning(SFT)或 Reinforcement Learning(RL)依序或混合訓練多個任務。但研究者觀察到一個奇怪現象:用 SFT 做多階段訓練時,模型學新任務往往會把舊任務的能力「洗掉」,出現嚴重的任務衝突(task conflict);反之用 RL(如 GRPO)依序訓練多個任務時,各任務表現卻能穩定共存,甚至互相提升。這篇論文的目標就是解釋這個現象背後的機制,並據此設計更有效率的多任務訓練方法。作者使用 DeepSeek-R1-Distill-Qwen 1.5B 與 7B 模型,在數學(MATH500、AIME2025)、科學(MMLU、GPQA)、邏輯(Knights & Knaves)、程式(LiveCodeBench)四大推理領域上做系統性實驗。

方法

研究團隊從參數層級追蹤 SFT 與 RL 訓練後的權重更新量 ΔW,分析不同任務更新之間的 L2 norm 大小與 cosine similarity(方向相似度)。結果發現 RL 產生的更新是「稀疏且近似正交(orthogonal)」的——不同任務的梯度方向幾乎互不干擾;而 SFT 的更新則彼此高度重疊,容易互相覆蓋。為解釋這個差異,作者從理論上推導多任務梯度干擾的上界,證明:SFT 的干擾是「norm-limited」,會隨著梯度絕對量級線性放大;而 RL 的干擾是「variance-limited」,其上界由 advantage normalization(優勢函數標準化)與 on-policy 抽樣所引入的梯度變異數決定,而非梯度本身的大小。這個變異數上界天生較小,因此 RL 更新更容易維持任務間的正交性。這一理論同時可以推廣到 PPO 等其他有優勢標準化的 RL 演算法,但論文指出群組層級標準化(GRPO)比批次層級標準化(PPO)能達到更低的任務干擾。基於這個洞見,作者提出 Parallel-RL:把多任務訓練拆解成各任務獨立的 RL 優化,再將各自產生的參數更新合併,藉此在避開任務衝突的同時大幅提升訓練效率與靈活性。

實驗結果

數據相當具體。在多階段訓練情境下,SFT 平均效能比基線下降 23.1%,而 RL 平均反而提升 24.9%。單任務訓練的干擾測試也呈現同樣的落差:只用 SFT 訓練一個任務,其餘任務平均掉了 5.1%;而只用 RL 訓練一個任務,目標任務提升 6.8%,其他未訓練任務不但沒退步,反而平均提升 2.3%。參數層級的量化分析更直觀:RL 更新的 L2 norm 約為 3×10⁻²,比 SFT 的 7.4 小了兩個量級;RL 各任務更新之間的 cosine similarity 約 10⁻⁵,遠低於 SFT 的約 10⁻¹,證實了「稀疏正交」的說法。至於 Parallel-RL 本身,在 1.5B 模型上,最簡單的「直接加總」版本可保留 94.2% 的原始效能並比基線提升 6.6%;加入僅 5% 額外適應數據微調後的版本,效能保留率提升到 103.2%(超過原本各自訓練的總和),整體較基線提升 10.7%。消融實驗顯示,若拿掉某任務專屬的更新項,目標任務會掉 7.1%,但對其他任務只帶來 0.6% 的提升,證明任務間確實被有效解耦。論文也發現探索程度(sampling temperature)與任務干擾之間存在權衡:温度約 0.65 時能在單任務表現與跨任務干擾之間取得最佳平衡。

意義

這篇研究把一個訓練實務中常見卻難以解釋的現象,用干擾理論的 norm-limited 對比 variance-limited 講清楚,也第一次系統性證明了「RL 天生比 SFT 更適合多任務訓練」不是經驗巧合,而是 advantage normalization 與 on-policy 優化帶來的結構性效果。對於實務團隊而言,這意味著在建構通用推理模型時,若採用多階段或多任務課程設計,RL(尤其是 GRPO 類方法)應優先於 SFT 作為後期整合階段的選擇。而 Parallel-RL 提供了一種可擴展、可平行化的訓練範式——每個任務可以獨立、甚至異步地在不同機器上做 RL 訓練,最後再合併參數,不必犧牲效能也不需要昂貴的聯合訓練,對於降低多任務 LLM 訓練的算力與工程複雜度具有直接的應用價值。這也為未來設計「任務相容性預測」工具(例如透過 t-SNE 觀察 score function 分布是否重疊)鋪路,讓工程師在訓練前就能預判哪些任務可以安全地平行訓練、哪些需要額外的協調機制。

DataSpace:用可驗證表格答案考驗資料代理人的跨模態基準

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

HKUSTDialBoyan Li、Zhuowen Liang、Yupeng Xie、Xiaotian Lin、Tianqi Luo、Xinyu Liu、Yizhang Zhu、Zhangyang Peng30Hugging FacearXiv
data-agentsbenchmarkLLM-agent多模態KDD-Cup

背景

企業裡的「資料分析」很少是乾淨的單一資料庫查詢。真正的分析任務往往需要同時翻找 SQL 資料庫、CSV/JSON 檔案、內部文件(PDF、Markdown),甚至會議錄影或監控影片,才能拼出一個完整答案。近年出現大量「data agent」,號稱能用自然語言直接對這類異質工作區做分析,但既有的評測基準卻各自為政:有的只測結構化查詢(Text-to-SQL)、有的只測文件檢索(RAG)、有的只測開放式分析報告,彼此互不相通。這造成三個長期缺口——沒有基準同時涵蓋「跨模態證據探索」「完整表格輸出」以及「可決定性(deterministic)自動評分」。換句話說,現有測驗只考了單科,卻沒人考過「跨科綜合題」,而這正是真實企業分析場景的樣子。

為填補這個缺口,研究團隊(以 Boyan Li 為首、共 14 位作者)提出了 DataSpace,並讓它同時成為 KDD Cup 2026「Data Agents for Complex Data Analysis」競賽的官方評測基準,顯示這個問題已經受到學界與工業界的高度重視。

方法

DataSpace 包含 410 個跨語言任務、7,439 個檔案素材,總資料量達 15.01 GB,涵蓋 CSV、JSON、SQLite、Markdown、PDF 與影片六種模態,每個任務平均對應約 31.26 MB 的資料,答案表格合計超過 12.6 萬行,最大的單一答案就有 12,962 行。任務中 64.6%(265 題)牽涉跨語言情境,35.4%(145 題)為單語言;主題分布集中在基金(38.5%)、股票(29.3%)、宏觀經濟(20.7%)與醫療(11.5%)四大領域。分析操作方面,82.4% 的任務涉及欄位投影(projection)、78.3% 涉及過濾、51.0% 涉及排序、35.6% 涉及聚合、27.6% 涉及跨表 join,中位數每題會用到五種操作類型,60.5% 的任務至少組合五種。

為了造出這樣規模又高品質的資料,團隊設計了 DataSpace-Builder 這套「執行導向(execution-grounded)」的自動化框架,把既有的 Text-to-SQL 語料轉化為異質工作區任務,分四階段進行:(1) 跨語言轉換,同步搬移問題、資料庫結構與可執行 SQL,並維持實體名稱一致性;(2) 限制感知的關聯式抽樣(constraint-aware relational sampling),在保留資料表關聯與 SQL 條件安全性的前提下,產生任務專屬的小型資料庫實例;(3) 模態路由與素材渲染,把抽樣出的表格分別轉成 CSV、JSON、SQLite,以及事實對齊的文件與依查詢條件生成的影片;(4) 由 11 位領域專家進行人工審查與任務修正,確保每題都經過至少兩位專家獨立驗證。評測本身採用「確定性評分器」,重點在於:表頭無關的欄位對齊(不管代理人輸出欄位順序)、具型別與精度感知的數值正規化,以及依任務語意判斷是否需要考慮行序的逐行比對——這讓整套流程可以自動、可重現地打分,而不必依賴人工或模糊的語意相似度。

實驗結果

團隊在固定的 DataSpace-Agent 執行框架下,測試了六個近期的前沿多模態模型:Grok 4.5 拿下最高的 66.34% 準確率,GPT-5.6 Sol 緊追在後為 64.63%,接著是 Kimi K3(53.41%)、MiMo-V2.5(39.27%)、Claude Sonnet 5(32.93%)與 MiniMax M3(28.54%)。值得注意的是,GPT-5.6 Sol 只比第一名落後 1.71 個百分點,但用了少 74.2% 的 token 與少 39.2% 的延遲,顯示效率與準確率並非完全綁死。

另一組實驗固定模型(MiMo-V2.5),改換五種常見的代理人執行框架(agent harness):Grok Build 達 46.34%、Claude Code 44.63%、DataSpace-Agent 39.27%、Codex 34.88%、Smolagents 30.98%——同一顆模型光是換一套執行框架,準確率就出現 15.36 個百分點的落差,說明「怎麼包裝、怎麼調度工具」和「用哪顆模型」幾乎同等重要。

更關鍵的發現是:多模態任務在六個模型上全部表現得比單模態任務差,落差為 1.8 到 14.0 個百分點;而牽涉跨表 join 的任務更慘,準確率普遍下降 9.7 到 19.8 個百分點。即便是表現最好的 Grok 4.5,經人工稽核後也發現,56.6% 的失敗案例源於「誤解目標結果」與「欄位投影錯誤」——也就是代理人常常找對了資料,卻輸出錯了表格的形狀或欄位。此外,即使是六個模型聯手,仍有 76 個任務全部答錯,顯示這個基準遠未被「打穿」。

意義

DataSpace 的核心貢獻,不只是又一個更大的資料集,而是把「異質證據探索」「完整表格輸出」「決定性自動評分」三件事第一次整合進同一套可重現的評測管線,並用真實企業場景常見的多語言、多模態、多表關聯任務去逼近真實需求。它揭示了目前 data agent 的兩個系統性弱點:一是跨模態證據整合能力仍薄弱,模型往往能單獨處理表格或單獨處理文件,但難以在同一任務裡把兩者對齊、互相驗證;二是關聯式推理(尤其是 join)仍是準確率的主要瓶頸,顯示 LLM 在需要維持多表一致性與精確欄位對應時容易出錯。66.34% 的最佳成績與 15.36 個百分點的框架差距同時說明,提升代理人可靠度不能只靠換更強的模型,執行框架的工程設計(工具調度、錯誤恢復、輸出格式約束)同樣舉足輕重。由於 DataSpace 已被選為 KDD Cup 2026 的官方評測基準,它很可能成為未來一到兩年內 data agent 研究與產業選型的重要標尺,推動社群把重心從「單一模態的準確率競賽」轉向「異質工作區下端到端的可驗證分析能力」。