RESOURCE2SKILL:把教學影片、程式庫與文章蒸餾成可執行的 Agent 技能
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
背景
現在的軟體 agent(例如操作 PPT、Excel、Blender 等工具的 AI 助手)越來越依賴「技能庫」(skill library)這種抽象方式,把人類或 agent 過去的操作經驗,轉換成可重複使用的程序性知識,讓 agent 下次遇到類似任務時不用從零摸索。然而,現有的技能庫大多是人工手寫、以純文字為主,或是直接從 agent 的操作軌跡(trace)中萃取出來。這種做法忽略了大量高品質、人類原生創作的多模態資源——尤其是 YouTube 上的教學影片、GitHub 上的程式庫、部落格文章與參考範例檔案。這些資源其實蘊含了三種互補的訊號:影片能捕捉「時序性操作」與「視覺效果」(例如滑鼠點擊順序、動畫過渡);程式碼提供「可執行的工具呼叫模式」;文章與範例則給出「概念性與風格性」的指引。過去的技能庫格式往往只保留其中一種訊號,導致 agent 學到的技能不完整。RESOURCE2SKILL(arXiv:2606.29538,作者包括 Yijia Fan、Zonglin Di、Chong Luo 等人)正是為了解決這個「多模態資源被浪費」的問題而提出。
方法
RESOURCE2SKILL 的核心是一套「建構運算子」(construction operator):利用具備視覺能力的語言模型(vision-capable LM),透過提示工程與結構化輸出,把教學影片、程式庫、文章、範例檔案等異質資源蒸餾成統一格式的技能條目。每個技能條目是一個五元組:分類路徑(taxonomy path)、說明機制與適用情境的文字內容、保留畫面截圖與示意圖的視覺內容、可執行的程式碼、以及元資料(含來源出處)。系統並設有五道「確定性關卡」(deterministic gates),分別檢查完整性、來源可追溯性、去重、跨模態一致性,以及程式碼是否真的可執行,確保進入技能庫的內容品質可控。
這些技能條目最終被組織成一個階層式的「Skill Wiki」,而非扁平的清單。推論階段,agent 透過名為 MetaBrowse 的兩階段檢索機制取用技能:第一階段用 BM25 詞彙比對法,依照分類路徑把候選範圍縮小到前 20 筆;第二階段再由語言模型從中挑選最多 5 筆進行組合套用。當 Skill Wiki 涵蓋不足時,同一套建構運算子可以即時線上運作,現場生成新技能補足缺口,形成「檢索優先、線上補強」的雙軌機制。
實驗結果
研究團隊在七個實務創作領域上做評測:投影片設計(PPT)、試算表(Excel)、網頁開發、3D 場景(Blender)、音訊製作(Reaper)、CAD 繪圖與即時 3D(UE5),使用四種 agent 後端模型(GPT-5.5、GPT-5.4、GPT-5.4 Mini、GPT-5.4 Nano),評分則由 GPT-5.4 視覺模型與(針對 Reaper 的音訊任務)GPT-4o 系列擔任評審。
整體結果顯示,有技能加持的 agent 平均總分達 56.8%,相較無技能版本的 45.0%,提升了 11.9 個百分點,且在全部 28 個「模型 × 領域」組合中全數勝出。與 ClaudeCode-H、Codex-H 這兩個強力商用基線相比,RESOURCE2SKILL 也在 28 組中的 26 組勝出。消融實驗顯示:技能庫規模擴增到約 200 筆技能時效果趨於飽和,從 0 到 200 筆這段區間貢獻了最大增益,Reaper 領域增加 3.1 個百分點、Excel 領域則高達 14.2 個百分點。若移除影片來源,平均分數會從 68.9% 掉到 59.4%,其中 Excel 掉 14.2 個百分點、網頁開發掉 11.5 個百分點,證明影片訊號不可或缺。階層式 Wiki 介面比扁平文字檢索平均高出 2.5 至 8.2 個百分點;MetaBrowse 的「階層先篩、LM 精選」策略平均達 68.9%,優於純 BM25(66.0%)與 BM25+Embedding(64.2%)。線上即時獲取技能在標準 benchmark 上只多貢獻 0.7 個百分點,但面對全新能力的任務時,分數從 41.2% 大幅拉升到 62.8%,提升達 21.6 個百分點。此外,團隊做了 200 筆盲測人工評分(每組 5 位評分者),結果「有技能」版本在非平手評比中贏得 85.5%,人機評分一致性(ICC)達 0.66,設計相關維度的 Spearman 相關係數更達 0.71。
意義
這篇論文的意義在於重新定義了 agent 技能的「原料來源」——不再侷限於文字文件或 agent 自身的操作紀錄,而是把人類多年累積、散落在 YouTube 教學影片、開源程式庫與技術文章中的隱性知識,系統化地轉換成 agent 可直接呼叫的可執行能力。這對於 PPT、Excel、Blender、CAD 這類高度依賴「操作步驟 + 視覺回饋」的創作型軟體尤其關鍵,因為純文字說明往往難以還原滑鼠拖曳、時間軸剪輯這類動態操作,而影片恰好補上了這塊拼圖。階層式 Skill Wiki 加上「檢索優先、不足再線上生成」的架構,也提供了一個可擴展、可持續成長的技能庫維運範式,而非一次性訓練完就固定不變。對於想打造垂直領域(例如影音剪輯、工程繪圖、遊戲引擎操作)AI 助手的團隊而言,RESOURCE2SKILL 展示了一條「把既有教學資源轉成 agent 生產力」的低成本路徑,未來或許能延伸到更多需要多模態程序性知識的專業軟體場景。