← 目錄

K1 論文詳解

2026-07-28


DataPrep-Bench:第一個統一評測「LLM 準備訓練資料」能力的基準

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

Peking UniversityHao Liang、Qifeng Cai、Yibo Lin、Jianzhuo Du、Qifeng Xia、Sizhe Qiu、Linzhuang Sun、Meiyi Qiang40Hugging FacearXiv
LLM訓練資料benchmark資料品質評估agent

背景

大型語言模型(LLM)的能力上限,很大程度上是由訓練資料的品質決定的——這句話幾乎已成業界共識。但一個尷尬的現實是:雖然大家都在談「data-centric AI」,卻始終沒有一個統一的基準,能真正衡量「LLM、agent、以及各種資料處理工作流」到底有沒有把訓練資料準備好。

現有的評測方式通常只看表面文字品質(例如流暢度、多樣性、去重程度),卻很少直接驗證這些資料「訓練起來到底有沒有用」。DataPrep-Bench 這篇論文(arXiv:2607.20465,由北京大學、上海智算院、OriginHub Technology、中關村學院等團隊合作,Wentao Zhang 為通訊作者)想解決的正是這個落差。

論文把「LLM 驅動的資料準備」拆成兩個互補的能力:

  1. 資料建構(data construction):把原始素材(例如教科書、文件)轉換成可監督式微調(supervised fine-tuning)的訓練資料。
  2. 資料品質評估(data quality evaluation):在真正拿去訓練之前,就能預測一份候選資料集對下游任務的訓練價值。

論文特別強調,這裡講的「品質」指的是「下游訓練效用」(downstream training utility),而不是文字表面看起來乾不乾淨、通不通順。這個定義上的區分,是整個 benchmark 設計的核心出發點。

方法

DataPrep-Bench 涵蓋六個領域:通用文本(General Text)、數學(Math)、科學(Science)、醫療(Medical)、金融(Finance)、法律(Law)。每個領域都準備了對應的原始素材(主要是領域教科書等長文件)以及專屬的下游評測基準,確保評測是「以終為始」——最終看的是模型在下游任務上表現如何,而不是資料集本身的統計特徵。

在資料建構賽道,評測協定要求所有方法消費「完全相同」的原始素材,然後把各自產出的資料與 Dolly-15k 一起,拿去微調同一個基礎模型(主要用 Qwen2.5-7B 與 Llama-3.1-8B),再比較下游任務分數。這種「同源輸入、同一基座模型」的設計,讓不同資料建構方法(包括純 prompt 生成、agent 式方法、DataFlow 式工作流等)可以被公平比較。

論文同時發布了自研方法 Data-Construction-Skill——一個「skill 導引」的 agent 框架。它不是單純靠一句 prompt 讓模型自由發揮,而是把資料建構過程「操作化」成可重複使用的技能層,裡面明確定義了輸出格式(schema)、篩選規則、覆蓋率約束(coverage constraints)以及驗證工具。換句話說,它把「怎麼把一份教科書變成高品質 QA 訓練資料」這件事,拆解成一套結構化、可驗證的流程模組,而不是一次性的黑箱生成。

在資料品質評估賽道,評測協定是讓不同的「打分函數」對同一批候選資料集打分,再用 Pearson 相關係數(r)去衡量這個分數跟該資料集實際訓練出來的下游表現有多一致。論文同時發布了自研評分方法 Distributional Alignment Score(DAS)。DAS 的核心想法是:比較候選資料集與「該領域的代理分佈(domain proxy)」之間的分佈差異,具體用 Maximum Mean Discrepancy(MMD),搭配固定頻寬的 Gaussian RBF 核函數來計算,並有域適應(domain adaptation)理論作為支撐——直覺上,一份訓練資料如果在分佈上更貼近目標領域的「理想樣態」,訓練出來的模型在該領域下游任務上通常表現更好。

實驗結果

在資料建構賽道上,論文給出幾個具體發現:

  • 光靠純 Dolly-15k 當基準,再單純疊加合成的領域資料,經常反而讓下游表現變差——這說明「加資料不一定加分」,資料建構方法的品質差異其實很大。
  • Data-Construction-Skill 在 Llama-3.1-8B 的 Finance(金融)領域上,相較 Dolly-only 基準線,取得了**近 20 個百分點(絕對值)**的提升,同時在「知識抽取密集型」領域(knowledge-extraction-dense domains)也能與最強的 agent 式方法及 DataFlow 式方法打平手。
  • 不過整體來看,並沒有單一方法在所有領域都全面領先:DataFlow 類方法在結構化程度較高的 Finance、Law 領域較強,agent 式方法在推理密集的 Math、Medical 領域更佔優勢。

在資料品質評估賽道上:

  • DAS 在六個領域中的四個領域取得了跨模型(Qwen2.5-7B、Llama-3.1-8B,以及用於測試跨架構穩健性的 Mistral-7B-v0.3)最強的相關性。
  • DAS 是唯一一個能在 Math、Science、Medical 三個領域同時達到 Pearson r > 0.70 的評分方法,超越了現有的品質類、多樣性類與啟發式(heuristic-based)評分方法。
  • Finance 與 Law 領域對所有評分方法來說都仍然是難點,相關性普遍偏低。
  • 論文也指出,許多既有評分指標在不同「領域-模型」組合下會出現正負號不一致的情況——也就是說,同一個指標在某個領域說「資料集 A 比 B 好」,換到另一個領域或另一個模型,結論可能完全反過來,凸顯了現有評分方法穩健性不足的問題。

意義

DataPrep-Bench 的價值不在於又發布了一個新資料集,而在於它第一次把「資料建構」與「資料品質評估」放進同一個、以下游任務為準繩的評測框架裡,並且把兩者視為「共同重要」的目標,而不是把資料品質評估當作資料建構的附屬品。

對做資料工程與 agent 研發的團隊來說,這篇論文至少帶來三個實際啟示:第一,合成資料「越多越好」的直覺並不可靠,必須用下游訓練結果來驗證,而不是單看資料量或表面文字品質;第二,像 Data-Construction-Skill 這樣把生成過程「結構化、可驗證」的 agent 設計,相較於純 prompt 式生成,能帶來實質可衡量的提升(在金融領域近 20 個百分點的絕對提升是相當顯著的數字);第三,「用分佈對齊(而非表面特徵)來預測資料的訓練價值」這個思路(DAS)提供了一個相對便宜、不需要真的跑一次微調就能篩選資料集的方法,這對於資料量龐大、微調成本高昂的實務場景相當有吸引力。

同時,論文也誠實地指出了侷限:沒有任何方法能在全部六個領域都稱霸,Finance 與 Law 這類領域至今仍缺乏可靠的品質預測手段。這也為後續研究指出了明確方向——如何針對結構化、規則密集的領域設計更合適的資料建構與評分方法,會是這個方向下一步值得關注的問題。整體而言,DataPrep-Bench 為「LLM 驅動的資料準備」這個原本各自為政、缺乏共同度量衡的領域,提供了一把可以持續追蹤進展的統一尺規。

SANA-Video 2.0:混合線性注意力如何讓單張 H100 跑出 720p 高畫質影片

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

NVIDIAJunsong Chen、Jincheng Yu、Yitong Li、Shuchen Xue、Haozhe Liu、Jingyu Xin、Yuyang Zhao、Tian Ye34Hugging FacearXiv
影片生成diffusion transformer線性注意力模型效率SANA

背景

影片生成模型近年來品質大幅提升,但代價是運算成本隨影片長度呈平方成長。傳統 diffusion transformer(DiT)採用 full-softmax attention,計算複雜度是 O(N²),其中 N 是影片的 latent token 數量。當解析度來到 1080p、影片變長時,一部影片的 latent token 數可達數萬個,softmax attention 的成本變得難以負擔,也因此像 Wan 2.2-A14B 這類高品質模型往往需要動輒數百秒才能生成一段影片,且難以在單張 GPU 上流暢運行。

線性注意力(linear attention)雖然把複雜度壓到 O(N),理論上能解決長序列的擴展性問題,但它天生是低秩(low-rank)的近似,缺乏 softmax 那種能捕捉全局、全秩(full-rank)token 互動的能力,因此過去用線性注意力訓練的影片模型品質始終落後於 softmax 版本。SANA-Video 2.0 就是想解決這個兩難:既要保留線性注意力的長序列擴展優勢,又要拿回 softmax 級別的表達能力。

方法

SANA-Video 2.0 是一個以統一架構訓練的混合式 video diffusion transformer,提供 5B 與 14B 兩種規模(5B 為 32 層、寬度 2,560;14B 為 40 層、寬度 4,096,實際參數約 14.25B)。核心設計有兩項:

第一是 Hybrid Linear-Softmax Attention:模型中約 75% 的層使用 gated linear attention 做 O(N) 為主的 token 混合,其餘以 3:1 的比例週期性插入 gated-softmax anchor 層,用來「補回」全秩的 token 互動,彌補純線性注意力的不足。透過縮小解析度的 proxy 實驗,作者發現 softmax 佔比抓在 25% 是品質與效率之間的最佳平衡點(Pareto 甜蜜點)——高於 50% 成本急遽上升,過低則品質明顯下滑。

第二是 Block Attention Residuals(AttnRes):把已經算完的區塊(block)摘要,透過共享的 routing query 傳遞給後面的線性層重複使用,讓深層網路不需要重新從頭推導這些「被 anchor 刷新過」的表徵。實驗顯示這讓深層的 effective rank 提升約 12%,若拿掉這個殘差路由,深層 rank 會驟降 82–91%。此外,共享 routing query 相較每層獨立 routing,loss 幾乎相同(0.495 對 0.496),卻能省下 4 倍的記憶體開銷。

架構上還移除了原本 SANA-Video 使用的時序卷積 FFN,改用標準 SwiGLU,在大規模下減少 20–29% 的額外開銷,同時更相容於編譯與 kernel 融合等優化。訓練上採取從零開始(from-scratch)學習完整混合架構,而非把既有 softmax 模型「線性化」改造;並搭配六階段的漸進式資料篩選、依動態/美學特性分流 noise 區間的 content-aware flow-shift、以及對十個 timestep 分桶做驗證以降低 2.27 倍評估變異。後訓練則採用基於 Gemini 排序的 Diffusion-DPO,再以 HPSv3++、DeQA-Score、UniPercept 等訊號做線上強化學習微調。

實驗結果

在 480×832×81 解析度、40 步取樣下,5B 模型的 VBench 總分達到 84.30(Quality 子項 85.61),與規模大得多的 softmax 模型(如 Bernini-R 的 84.64)相當接近;拉長到 121 幀與 193 幀時總分分別維持在 85.29 與 84.48,顯示品質不會隨長度崩壞。

效率上,5B 模型在單張 H100 上生成一段 480p 影片僅需 13.2 秒,14B 版本則為 29.1 秒。與同規格的 full-softmax baseline 相比,編譯後的 DiT forward pass 在 720p/60 秒序列下快 3.2 倍,而且這個優勢會隨影片變長持續擴大(480p 時約 1.16 倍,1080p 時約 2.01 倍,720p/60 秒時可達 3.17 倍)。與 Bernini-R 相比,在相同 shape、步數與裝置下便宜 31.8 倍(13.2 秒 vs. 421 秒);與 Wan 2.2-A14B 相比則快了 50 倍(單就 DiT 部分)。

進一步結合 Sol-Engine 的全棧優化(kernel 融合、緩存重用、稀疏 attention),又帶來 3.58 倍加速,讓 5B pipeline 在 720p/5 秒影片上僅需 13.06 秒——整體比 Wan 2.2-A14B 快了 120 倍。硬體層面,GB200 相較 H100 有 1.69–2.01 倍加速;採用 QAT(權重 MXFP4、激活 MXFP8)量化後品質與 BF16 相當,卻能減少 67.9% 的模型儲存空間與 56.9% 的峰值記憶體占用。

意義

SANA-Video 2.0 證明了「混合線性—softmax attention」不只是理論上可行,而是能在實際訓練與部署中,用遠低於傳統 softmax 模型的成本,達到幾乎同等的生成品質。這對影片生成的普及化意義重大:過去要跑出高解析度、長時長的影片,幾乎必須依賴多卡叢集或忍受數分鐘的等待,而 SANA-Video 2.0 讓 5B 規模的模型能在單張 H100 上於十餘秒內完成 720p 影片生成,大幅降低推論成本與延遲。

更重要的是,論文透過 effective rank 分析與消融實驗,具體拆解了「為什麼」混合架構有效——softmax anchor 負責恢復全秩表達,AttnRes 負責把這些高品質表徵有效傳遞到深層,兩者分工明確、可解釋。這種「從零訓練混合架構」而非「把預訓練 softmax 模型線性化」的路線,也為未來其他長序列生成任務(如更長篇的影片、互動式生成)提供了一個可擴展、可落地的技術範本,讓效率與品質不再是必須二選一的取捨。

技能自我對弈:讓LLM在陪練中自我進化的Skill-SP框架

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

QwenBusinessUnit-EduSiyuan Huang、Pengyu Cheng、Haotian Liu、Tao Chen、Yihao Liu、Jingwei Ni、Shijie Zhou、Ziyi Yang30Hugging FacearXiv
LLM self-evolutionself-playagent skillsreinforcement learningtool-use

背景

大型語言模型的訓練典範正從「人工設計題目、人工標註答案」轉向「模型自己跟自己玩,自己出題、自己解題」的自我演化模式。這條路上一直卡著一個兩難:一種是「環境綁定」的作法,例如在程式碼沙盒或數學驗證器裡訓練,獎勵訊號精準可靠,但任務範圍被環境本身限死,模型很難長出新能力;另一種是「開放式自我生成」,模型自己造題目、自己評分,任務多樣性大幅提升,但缺乏可靠的驗證機制,一旦模型學會用取巧方式騙過自己的獎勵模型(reward hacking),錯誤訊號就會污染整個訓練迴圈,愈訓練愈歪。

來自 Qwen 團隊(Siyuan Huang 等人為首)的這篇論文,提出了一個折衷點:agent skills(智能體技能)。每一項「技能」對應一個具體、可驗證的執行場景(例如呼叫某類工具、完成某種邏輯推理),保證了驗證的精確性;而在多個技能之間動態路由、切換,則保留了任務的開放性與多樣性。這篇論文於 2026 年 7 月提交(arXiv:2607.22529),同時釋出了程式碼。

方法

論文提出 Skill Self-Play(Skill-SP),一個由三個角色組成、以強化學習迴圈驅動的共同演化框架:

  1. Proposer(出題者):依據當前動態抽樣到的技能,生成對解題者而言有挑戰性、但仍落在該技能可驗證範圍內的任務。
  2. Solver(解題者):針對 proposer 出的題目探索多種候選解法,藉此不斷推高自己的能力邊界。
  3. Skill Controller(技能控制器):收集 solver 執行任務後的真實回饋(成功/失敗、執行軌跡),據此更新既有技能的難度分佈,並擴充整個技能庫,讓後續出題更貼近模型當前的能力前沿。

這三者在同一個 RL 迴圈中互相驅動:proposer 出的題目品質取決於 skill controller 提供的技能取樣策略,而 solver 的表現又回饋給 controller 去調整技能庫。整體設計的關鍵洞見是——不需要在「大範圍但不可信」與「小範圍但可信」之間二選一,只要把可驗證性的顆粒度收斂到「單一技能」層級,就能一邊維持嚴謹驗證,一邊靠技能庫的持續擴張換取任務多樣性。

實驗結果

論文在工具呼叫(tool-use)與邏輯推理兩類 benchmark 上驗證效果,工具呼叫使用 API-Bank、BFCL,推理則用 ZebraLogic(格點邏輯推理準確率)。測試的骨幹模型涵蓋 Qwen3-4B-2507、Qwen3-8B、Ministral-3-8B-Instruct、Ministral-3-14B-Instruct 與 Granite-4.1-3B,規模從 3B 到 14B 不等。

結果顯示,Skill-SP 對「本來就強」的模型能持續推高天花板:Qwen3-4B 在工具呼叫上從 60.2 提升到 66.7(+6.5 分),Qwen3-8B 在 ZebraLogic 推理上從 23.6 大幅跳到 32.4(+8.8 分)。但最引人注目的是對「起點差、原本表現失準」的模型帶來的逆轉:Ministral-3-8B 的工具呼叫分數從 20.7 暴增到 63.6,足足 +42.9 分;Ministral-3-14B 也從 22.2 衝到 64.5,+42.3 分。相對地,推理類任務的提升幅度較溫和,例如 Ministral-3-14B 在 ZebraLogic 上從 5.4 到 17.4(+12.0 分),Granite-4.1-3B 兩項任務則各自小幅提升約 1~5 分。整體來看,工具呼叫類任務的增益明顯大於邏輯推理類任務,且對能力較弱、原本「校準失準」的模型效果最為顯著。

意義

Skill-SP 的價值不只是刷新幾個 benchmark 分數,更在於它示範了一條可行的自我演化路徑:把「可驗證性」下放到技能顆粒度,讓開放式探索不再是無法無天的自我生成,而是始終有一把可信的尺在後面把關。這對降低人工標註成本、擴大模型自我訓練的任務覆蓋範圍都有直接意義。

更值得注意的是,論文顯示這套機制對「起跑點落後」的模型(如 Ministral 系列)帶來近乎翻倍的逆轉式提升,暗示 Skill-SP 不只是錦上添花的優化器,更可能是一種普適的「後訓練修正引擎」——即使某個模型在指令遵循或工具呼叫上原本嚴重失準,透過技能庫的動態擴張與針對性出題,也能被快速拉回正常水準。對正在探索 agentic AI、多工具協作系統的團隊來說,這種能自動生成高質量、可驗證訓練訊號的框架,可能會成為未來自我提升系統的標準配置之一。當然,技能庫的初始設計與覆蓋範圍仍需人工介入,且推理類任務的增益幅度不如工具呼叫類明顯,顯示因果鏈更長、更難驗證的任務仍是這條路線接下來要攻克的難點。