← 目錄

K1 論文詳解

2026-07-21


RESOURCE2SKILL:把教學影片、程式庫與文章蒸餾成可執行的 Agent 技能

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

Microsoft ResearchYijia Fan、Zonglin Di、Zimo Wen、Yifan Yang、Mingxi Cheng、Qi Dai、Bei Liu、Kai Qiu113Hugging FacearXiv
AI Agent多模態Skill LibraryLLM自動化

背景

現在的軟體 agent(例如操作 PPT、Excel、Blender 等工具的 AI 助手)越來越依賴「技能庫」(skill library)這種抽象方式,把人類或 agent 過去的操作經驗,轉換成可重複使用的程序性知識,讓 agent 下次遇到類似任務時不用從零摸索。然而,現有的技能庫大多是人工手寫、以純文字為主,或是直接從 agent 的操作軌跡(trace)中萃取出來。這種做法忽略了大量高品質、人類原生創作的多模態資源——尤其是 YouTube 上的教學影片、GitHub 上的程式庫、部落格文章與參考範例檔案。這些資源其實蘊含了三種互補的訊號:影片能捕捉「時序性操作」與「視覺效果」(例如滑鼠點擊順序、動畫過渡);程式碼提供「可執行的工具呼叫模式」;文章與範例則給出「概念性與風格性」的指引。過去的技能庫格式往往只保留其中一種訊號,導致 agent 學到的技能不完整。RESOURCE2SKILL(arXiv:2606.29538,作者包括 Yijia Fan、Zonglin Di、Chong Luo 等人)正是為了解決這個「多模態資源被浪費」的問題而提出。

方法

RESOURCE2SKILL 的核心是一套「建構運算子」(construction operator):利用具備視覺能力的語言模型(vision-capable LM),透過提示工程與結構化輸出,把教學影片、程式庫、文章、範例檔案等異質資源蒸餾成統一格式的技能條目。每個技能條目是一個五元組:分類路徑(taxonomy path)、說明機制與適用情境的文字內容、保留畫面截圖與示意圖的視覺內容、可執行的程式碼、以及元資料(含來源出處)。系統並設有五道「確定性關卡」(deterministic gates),分別檢查完整性、來源可追溯性、去重、跨模態一致性,以及程式碼是否真的可執行,確保進入技能庫的內容品質可控。

這些技能條目最終被組織成一個階層式的「Skill Wiki」,而非扁平的清單。推論階段,agent 透過名為 MetaBrowse 的兩階段檢索機制取用技能:第一階段用 BM25 詞彙比對法,依照分類路徑把候選範圍縮小到前 20 筆;第二階段再由語言模型從中挑選最多 5 筆進行組合套用。當 Skill Wiki 涵蓋不足時,同一套建構運算子可以即時線上運作,現場生成新技能補足缺口,形成「檢索優先、線上補強」的雙軌機制。

實驗結果

研究團隊在七個實務創作領域上做評測:投影片設計(PPT)、試算表(Excel)、網頁開發、3D 場景(Blender)、音訊製作(Reaper)、CAD 繪圖與即時 3D(UE5),使用四種 agent 後端模型(GPT-5.5、GPT-5.4、GPT-5.4 Mini、GPT-5.4 Nano),評分則由 GPT-5.4 視覺模型與(針對 Reaper 的音訊任務)GPT-4o 系列擔任評審。

整體結果顯示,有技能加持的 agent 平均總分達 56.8%,相較無技能版本的 45.0%,提升了 11.9 個百分點,且在全部 28 個「模型 × 領域」組合中全數勝出。與 ClaudeCode-H、Codex-H 這兩個強力商用基線相比,RESOURCE2SKILL 也在 28 組中的 26 組勝出。消融實驗顯示:技能庫規模擴增到約 200 筆技能時效果趨於飽和,從 0 到 200 筆這段區間貢獻了最大增益,Reaper 領域增加 3.1 個百分點、Excel 領域則高達 14.2 個百分點。若移除影片來源,平均分數會從 68.9% 掉到 59.4%,其中 Excel 掉 14.2 個百分點、網頁開發掉 11.5 個百分點,證明影片訊號不可或缺。階層式 Wiki 介面比扁平文字檢索平均高出 2.5 至 8.2 個百分點;MetaBrowse 的「階層先篩、LM 精選」策略平均達 68.9%,優於純 BM25(66.0%)與 BM25+Embedding(64.2%)。線上即時獲取技能在標準 benchmark 上只多貢獻 0.7 個百分點,但面對全新能力的任務時,分數從 41.2% 大幅拉升到 62.8%,提升達 21.6 個百分點。此外,團隊做了 200 筆盲測人工評分(每組 5 位評分者),結果「有技能」版本在非平手評比中贏得 85.5%,人機評分一致性(ICC)達 0.66,設計相關維度的 Spearman 相關係數更達 0.71。

意義

這篇論文的意義在於重新定義了 agent 技能的「原料來源」——不再侷限於文字文件或 agent 自身的操作紀錄,而是把人類多年累積、散落在 YouTube 教學影片、開源程式庫與技術文章中的隱性知識,系統化地轉換成 agent 可直接呼叫的可執行能力。這對於 PPT、Excel、Blender、CAD 這類高度依賴「操作步驟 + 視覺回饋」的創作型軟體尤其關鍵,因為純文字說明往往難以還原滑鼠拖曳、時間軸剪輯這類動態操作,而影片恰好補上了這塊拼圖。階層式 Skill Wiki 加上「檢索優先、不足再線上生成」的架構,也提供了一個可擴展、可持續成長的技能庫維運範式,而非一次性訓練完就固定不變。對於想打造垂直領域(例如影音剪輯、工程繪圖、遊戲引擎操作)AI 助手的團隊而言,RESOURCE2SKILL 展示了一條「把既有教學資源轉成 agent 生產力」的低成本路徑,未來或許能延伸到更多需要多模態程序性知識的專業軟體場景。

RAGU:用 7B 小模型打造更乾淨的知識圖譜檢索增強系統

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

Novosibirsk State UniversityMikhail Komarov、Ivan Bondarenko、Stanislav Shtuka、Oleg Sedukhin、Roman Shuvalov、Yana Dementyeva、Matvey Solovyov、Nikolay O. Nikitin111Hugging FacearXiv
GraphRAGRAG知識圖譜小型語言模型檢索增強生成

背景

檢索增強生成(Retrieval-Augmented Generation, RAG)已經是大型語言模型(LLM)處理長文件、專業領域知識的標準做法,而 GraphRAG(圖檢索增強生成)進一步把非結構化文本轉換成知識圖譜,讓模型能沿著實體與關係做多跳推理,而不只是找相似段落。但現有的 GraphRAG 系統大多只用「一次抽取」(single extraction pass):LLM 讀一段文字,直接輸出實體與關係,整個知識圖譜就這樣一次成形。這種做法的問題在於,同一個實體在不同段落可能被抽成不同的名稱或格式(例如「Aspirin」「阿斯匹靈」「乙醯水楊酸」),導致圖譜裡充滿重複、雜訊節點,檢索路徑因此變得脆弱、容易斷裂。

另一個被業界忽略的問題是成本與模型選擇。目前主流 GraphRAG 系統多半直接呼叫 GPT-4 級或 Qwen2.5-32B 這類大型商用/開源模型來做抽取,這意味著建構一個大規模知識庫可能要花費可觀的 API 費用(論文提到約每份文件 0.10 美元,10 萬份文件就要 1 萬美元)。RAGU 團隊的洞察是:抽取流程裡 LLM 真正需要的能力——理解文本、抽取結構化資訊、在上下文中做推理——本質上是「語言技能」,而不是「世界知識」。已有研究顯示,語言技能隨模型規模增大的邊際效益遠低於事實性知識的增長,換句話說,一個經過針對性訓練的小模型,在抽取任務上不見得會輸給大模型。這個假設如果成立,就能大幅降低建構知識圖譜的運算與金錢成本,讓 GraphRAG 真正能在單張消費級 GPU 上跑起來。

方法

RAGU 是一套開源、模組化的 GraphRAG 引擎(pip install graph_ragu 即可安裝),核心設計是把「抽取」與「整併」明確拆成兩個獨立階段,而不是一次抽取定生死:

  1. 兩階段有型別抽取(two-stage typed extraction):先由 LLM 辨識出帶類型標籤的實體(例如人物、疾病、藥物、組織等),再進行第二階段的關係抽取,把實體之間的語義關係結構化輸出,減少單階段抽取時常見的類型混淆與遺漏。
  2. DBSCAN 去重(DBSCAN-backed deduplication):抽取出的實體先轉成向量嵌入,再用 DBSCAN 這種基於密度的聚類演算法把語義相近、可能是同一實體的不同表述聚成一群,取代傳統靠字串相似度或人工規則的去重方式,能更穩健地處理同義詞與拼寫差異。
  3. LLM 摘要(LLM summarization):對去重後合併的實體與其相關描述,再交由 LLM 生成一段濃縮摘要,作為該實體節點的最終描述,避免圖譜節點內容零散重複。
  4. Leiden 社群偵測(Leiden community detection):在乾淨後的圖譜上執行 Leiden 演算法,把圖切分成語義相關的社群(community),支援類似 Microsoft GraphRAG 的全域摘要式檢索,讓系統在回答「總結型」問題時能夠聚合整個主題社群的資訊,而不只是單一節點。

在抽取模型的選擇上,團隊訓練了一個名為 Meno-Lite-0.1 的 7B 參數模型,專門針對「理解、抽取、上下文推理」這幾類語言技能做最佳化訓練,而非追求百科式的世界知識覆蓋。這個模型設計理念的核心賭注就是前述的假設——這些技能不太需要靠堆參數量取得,用合適的訓練資料與方法讓小模型專精即可。RAGU 系統支援三種儲存後端組合(NetworkX、Neo4j 做圖儲存,NanoVDB、Qdrant 做向量索引),並附有約 374 個測試案例與一個可重現的 mock LLM 伺服器,方便社群驗證與擴充。整套程式碼採 MIT 授權,Meno-Lite-0.1 模型權重另外釋出(Apache-2.0),可在 Hugging Face 上直接下載(bond005/meno-lite-0.1)。

實驗結果

團隊在知識圖譜建構任務上比較 Meno-Lite-0.1(7B)與 Qwen2.5-32B(32B,參數量約為前者 4 倍以上):Meno-Lite-0.1 的相對調和平均數(relative harmonic mean,綜合抽取精確率與召回率的指標)比 Qwen2.5-32B 高出 +12.5%,而在純英語的 GraphRAG 下游任務上兩者表現則大致打平,也就是說用四分之一參數量的小模型就能在核心抽取能力上超車、在應用端打平。

在 GraphRAG-Bench(醫療領域)基準上,RAGU 在各個 factoid(事實型問題)複雜度層級中都取得最完整的檢索上下文,evidence recall(證據召回率)最高達到 0.84,而其他對照系統則落在 0.76 以下。在需要整合多個資訊來源、生成綜合性回答的「synthesis」任務上,RAGU 也超越了強力對手 HippoRAG2,例如在 Creative Generation 的 AC(Answer Correctness 類指標)分數上取得 59.0,對比 HippoRAG2 的 56.9

比較值得注意的是多跳事實型問答(multi-hop factoid QA)的結果:表面上 HippoRAG2 在這類任務上看似領先,但論文分析後指出,這個差距主要來自「答案格式的評分假象」(answer-format artifact)——也就是說 HippoRAG2 傾向輸出評測指標偏好的簡短格式答案,而非真正在檢索完整性或推理正確性上勝出,一旦控制格式因素,RAGU 的實際表現並不遜色。

成本面上,論文估算使用 Meno-Lite-0.1 在租用 GPU 上跑抽取流程,每份文件成本約 0.001 美元,相較呼叫 API 型大模型的每份文件約 0.10 美元,等於便宜約 100 倍;以 10 萬份文件的知識庫規模計算,成本從約 1 萬美元降到約 100 美元。

意義

RAGU 這篇工作提供了兩個對從業者很實用的訊息。第一,它用具體數字驗證了「抽取任務靠的是語言技能而非世界知識」這個假設——這意味著建構 GraphRAG 系統不一定要綁定最貴、最大的模型,透過針對性訓練的小模型(7B)配合精心設計的多階段流程(去重、摘要、社群偵測),可以在知識圖譜品質上超越參數量大四倍以上的通用模型,同時把單GPU、低成本地端部署變成可行選項,這對預算有限的醫療、法律等專業領域應用尤其重要。

第二,論文對現有評測方式提出了警示:HippoRAG2 在多跳問答上的「優勢」部分是答案格式造成的評測假象,提醒研究社群在比較 GraphRAG 系統時,需要更仔細拆解評測指標到底衡量的是檢索完整性、推理正確性,還是單純的輸出格式偏好,否則容易得出誤導性結論。

整體而言,RAGU 把「抽取與整併分離」「小型專用模型」「開源可重現」三者結合成一套完整的開源系統(MIT 授權,pip 可裝),不只是一篇研究論文的展示,而是可以直接落地使用的工具,對希望自建知識圖譜檢索系統、又受限於運算資源的團隊提供了一條務實路徑。

Loopie:讓「迴圈式」Transformer 首次打敗同算力的巨獸模型

Loop the Loopies!

IQuestZitian Gao、Yilong Chen、Yihao Xiao、Xinyu Yang、Ran Tao、Joey Zhou、Bryan Dai55Hugging FacearXiv
looped-transformerMoELLM推理IMO訓練效率

背景

過去幾年,大型語言模型的進步幾乎都靠一條路線:堆更多參數、餵更多資料、燒更多算力。但另一條路線——「迴圈式 Transformer」(looped Transformer)——一直被視為理論上優雅、實務上打不贏的替代方案。它的想法源自更早的 Universal Transformer:與其把 N 層不同的權重疊在一起,不如讓同一組(或少數幾組)權重反覆迴圈執行 N 次,藉此用較少的參數量換取更深的運算深度。這種做法在參數效率、可解釋的「思考步數」上都很誘人,也被認為與 chain-of-thought 式推理有天然的相似性——多迴圈一次,就像多想一步。

然而業界長期觀察到一個尷尬的事實:如果把預訓練算力提高 N 倍,與其把模型迴圈 N 次,不如直接把參數量擴大 N 倍——後者幾乎總是更划算。這意味著迴圈架構雖然理論吸引人,卻在「同算力比拼」上輸給了傳統的大參數 Transformer,因此始終沒有真正的旗艦級模型出現。這篇論文《Loop the Loopies!》正是衝著這個長期未解的問題而來,作者來自 Zitian Gao、Yilong Chen 等七人團隊,提出的 Loopie 系列被稱為「至今最強的迴圈式 Transformer」,目標就是證明迴圈架構在同等訓練算力下也能打贏傳統模型。

方法

Loopie 系列包含兩個規模的 Mixture-of-Experts(MoE)模型:一個是 200 億參數、實際啟用 20 億(2B active)參數的版本,另一個是 60 億參數、實際啟用 6 億(0.6B active)參數的版本。選擇 MoE 架構而非稠密(dense)模型,本身就是一個關鍵設計選擇——MoE 讓模型在推理時只啟用一小部分專家網路,兼顧「總參數容量大」與「單次前向計算成本低」兩個目標,而這正好與迴圈架構「重複使用同一組運算單元」的精神互補:迴圈提供的是計算深度,MoE 提供的是容量密度,兩者疊加可以在固定的啟用參數(active parameters)與訓練算力預算下,榨出比單純擴大參數量更多的模型能力。

論文的核心貢獻,是設計出一套讓迴圈架構在同算力下真正贏過堆參數的訓練配方,並搭配「新穎的後訓練(post-training)流程」賦予模型強大的推理能力。雖然公開摘要沒有逐項列出後訓練的技術細節,但從其效果——讓模型在無工具輔助下拿下奧林匹亞競賽金牌——可以推斷這套流程包含了針對長鏈推理、自我驗證與高難度數理任務的強化式微調,類似近年提升推理模型能力常見的 RLHF/RL 微調範式,但被進一步調校以配合迴圈式架構的多步「內在思考」特性。作者在論文中進行了大量消融實驗(ablation studies),其中最關鍵的對照組,是一個參數規模達 300 億、啟用 30 億參數的「vanilla 30B-A3B」傳統 MoE Transformer——這正是驗證「同算力下迴圈是否划算」的直接證據。

實驗結果

論文的實驗設計緊扣它要解決的問題:在完全相同的預訓練算力預算下,把 Loopie 與傳統(非迴圈)Transformer 基線放在同一條起跑線比較。結果顯示,Loopie 在這樣的公平比較中「大幅超越」(substantially outperforms)vanilla 30B-A3B 這類傳統基線模型——這是論文標題「Loop the Loopies」想強調的重點:過去看似注定輸給堆參數策略的迴圈架構,如今在同算力條件下反而勝出。這個結果之所以重要,是因為它打破了此前普遍觀察到的「N 倍算力,擴參數比迴圈 N 次更划算」的經驗法則。

在下游任務評測上,論文展示的亮點成績來自兩項極具指標性的高難度測驗:2025 年國際數學奧林匹亞(IMO)與國際物理奧林匹亞(IPhO)。Loopie 在完全不依賴外部工具(no tools,例如程式碼執行器或計算器)的情況下,達到「金牌等級」(gold-medal performance)的表現。這類競賽題目要求極強的多步邏輯推理與創造性解題能力,而非單純知識檢索,因此「無工具金牌」的結果通常被視為模型純推理能力的硬指標,而不是靠外部輔助取巧得來。結合論文提到的大量消融研究,可以推測作者針對迴圈次數、專家數量、路由策略與後訓練資料配方都做了系統性的對照實驗,才能在 20B-A2B 與 6B-A0.6B 兩種規模上都驗證出一致的優勢,而不只是單一規模的巧合。

意義

這篇論文的意義不只在於「又出現一個強模型」,而在於它可能重新打開一條被業界擱置已久的擴展路線。過去大家默認「參數即正義」——同樣的算力,寧可把模型做胖,也不要把模型做深(迴圈)。如果 Loopie 的結果能被廣泛複現,意味著未來在算力受限、但希望降低推理時的顯存與服務成本的場景下(因為 active parameters 遠小於總參數量,加上迴圈可共享權重、降低儲存需求),迴圈式 MoE 架構可能成為兼顧訓練效率與推理效率的新選項,尤其是在邊緣裝置或成本敏感的部署場景。

更進一步看,Loopie 把「迴圈架構」與「強推理能力」綁在一起展示,某種程度上呼應了業界對「模型會不會用更多計算換取更好推理」這條路線的持續探索——迴圈本身提供了一種結構化、可控的「多想幾步」機制,如果後訓練流程能有效引導這種內在迭代朝向正確推理鏈收斂,那麼迴圈架構或許比單純的思維鏈提示(chain-of-thought prompting)更節省 token、更貼近模型的計算本質。對於researchers與工程團隊而言,這篇論文提供了一個重要訊號:在追逐更大參數量之外,重新審視架構層面的計算重複利用,可能是壓榨同一份算力預算、換取更強推理能力的另一條有效路徑。