DataPrep-Bench:第一個統一評測「LLM 準備訓練資料」能力的基準
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
背景
大型語言模型(LLM)的能力上限,很大程度上是由訓練資料的品質決定的——這句話幾乎已成業界共識。但一個尷尬的現實是:雖然大家都在談「data-centric AI」,卻始終沒有一個統一的基準,能真正衡量「LLM、agent、以及各種資料處理工作流」到底有沒有把訓練資料準備好。
現有的評測方式通常只看表面文字品質(例如流暢度、多樣性、去重程度),卻很少直接驗證這些資料「訓練起來到底有沒有用」。DataPrep-Bench 這篇論文(arXiv:2607.20465,由北京大學、上海智算院、OriginHub Technology、中關村學院等團隊合作,Wentao Zhang 為通訊作者)想解決的正是這個落差。
論文把「LLM 驅動的資料準備」拆成兩個互補的能力:
- 資料建構(data construction):把原始素材(例如教科書、文件)轉換成可監督式微調(supervised fine-tuning)的訓練資料。
- 資料品質評估(data quality evaluation):在真正拿去訓練之前,就能預測一份候選資料集對下游任務的訓練價值。
論文特別強調,這裡講的「品質」指的是「下游訓練效用」(downstream training utility),而不是文字表面看起來乾不乾淨、通不通順。這個定義上的區分,是整個 benchmark 設計的核心出發點。
方法
DataPrep-Bench 涵蓋六個領域:通用文本(General Text)、數學(Math)、科學(Science)、醫療(Medical)、金融(Finance)、法律(Law)。每個領域都準備了對應的原始素材(主要是領域教科書等長文件)以及專屬的下游評測基準,確保評測是「以終為始」——最終看的是模型在下游任務上表現如何,而不是資料集本身的統計特徵。
在資料建構賽道,評測協定要求所有方法消費「完全相同」的原始素材,然後把各自產出的資料與 Dolly-15k 一起,拿去微調同一個基礎模型(主要用 Qwen2.5-7B 與 Llama-3.1-8B),再比較下游任務分數。這種「同源輸入、同一基座模型」的設計,讓不同資料建構方法(包括純 prompt 生成、agent 式方法、DataFlow 式工作流等)可以被公平比較。
論文同時發布了自研方法 Data-Construction-Skill——一個「skill 導引」的 agent 框架。它不是單純靠一句 prompt 讓模型自由發揮,而是把資料建構過程「操作化」成可重複使用的技能層,裡面明確定義了輸出格式(schema)、篩選規則、覆蓋率約束(coverage constraints)以及驗證工具。換句話說,它把「怎麼把一份教科書變成高品質 QA 訓練資料」這件事,拆解成一套結構化、可驗證的流程模組,而不是一次性的黑箱生成。
在資料品質評估賽道,評測協定是讓不同的「打分函數」對同一批候選資料集打分,再用 Pearson 相關係數(r)去衡量這個分數跟該資料集實際訓練出來的下游表現有多一致。論文同時發布了自研評分方法 Distributional Alignment Score(DAS)。DAS 的核心想法是:比較候選資料集與「該領域的代理分佈(domain proxy)」之間的分佈差異,具體用 Maximum Mean Discrepancy(MMD),搭配固定頻寬的 Gaussian RBF 核函數來計算,並有域適應(domain adaptation)理論作為支撐——直覺上,一份訓練資料如果在分佈上更貼近目標領域的「理想樣態」,訓練出來的模型在該領域下游任務上通常表現更好。
實驗結果
在資料建構賽道上,論文給出幾個具體發現:
- 光靠純 Dolly-15k 當基準,再單純疊加合成的領域資料,經常反而讓下游表現變差——這說明「加資料不一定加分」,資料建構方法的品質差異其實很大。
- Data-Construction-Skill 在 Llama-3.1-8B 的 Finance(金融)領域上,相較 Dolly-only 基準線,取得了**近 20 個百分點(絕對值)**的提升,同時在「知識抽取密集型」領域(knowledge-extraction-dense domains)也能與最強的 agent 式方法及 DataFlow 式方法打平手。
- 不過整體來看,並沒有單一方法在所有領域都全面領先:DataFlow 類方法在結構化程度較高的 Finance、Law 領域較強,agent 式方法在推理密集的 Math、Medical 領域更佔優勢。
在資料品質評估賽道上:
- DAS 在六個領域中的四個領域取得了跨模型(Qwen2.5-7B、Llama-3.1-8B,以及用於測試跨架構穩健性的 Mistral-7B-v0.3)最強的相關性。
- DAS 是唯一一個能在 Math、Science、Medical 三個領域同時達到 Pearson r > 0.70 的評分方法,超越了現有的品質類、多樣性類與啟發式(heuristic-based)評分方法。
- Finance 與 Law 領域對所有評分方法來說都仍然是難點,相關性普遍偏低。
- 論文也指出,許多既有評分指標在不同「領域-模型」組合下會出現正負號不一致的情況——也就是說,同一個指標在某個領域說「資料集 A 比 B 好」,換到另一個領域或另一個模型,結論可能完全反過來,凸顯了現有評分方法穩健性不足的問題。
意義
DataPrep-Bench 的價值不在於又發布了一個新資料集,而在於它第一次把「資料建構」與「資料品質評估」放進同一個、以下游任務為準繩的評測框架裡,並且把兩者視為「共同重要」的目標,而不是把資料品質評估當作資料建構的附屬品。
對做資料工程與 agent 研發的團隊來說,這篇論文至少帶來三個實際啟示:第一,合成資料「越多越好」的直覺並不可靠,必須用下游訓練結果來驗證,而不是單看資料量或表面文字品質;第二,像 Data-Construction-Skill 這樣把生成過程「結構化、可驗證」的 agent 設計,相較於純 prompt 式生成,能帶來實質可衡量的提升(在金融領域近 20 個百分點的絕對提升是相當顯著的數字);第三,「用分佈對齊(而非表面特徵)來預測資料的訓練價值」這個思路(DAS)提供了一個相對便宜、不需要真的跑一次微調就能篩選資料集的方法,這對於資料量龐大、微調成本高昂的實務場景相當有吸引力。
同時,論文也誠實地指出了侷限:沒有任何方法能在全部六個領域都稱霸,Finance 與 Law 這類領域至今仍缺乏可靠的品質預測手段。這也為後續研究指出了明確方向——如何針對結構化、規則密集的領域設計更合適的資料建構與評分方法,會是這個方向下一步值得關注的問題。整體而言,DataPrep-Bench 為「LLM 驅動的資料準備」這個原本各自為政、缺乏共同度量衡的領域,提供了一把可以持續追蹤進展的統一尺規。