K12-KGraph:用課綱知識圖譜檢驗與訓練教育用大型語言模型
K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
背景
近年來大型語言模型(LLM)大量被導入K-12(小學到高中)教育場景,例如自動解題、學習輔導、教材問答等。然而現有的教育類 benchmark,例如各種模擬考題庫,幾乎都只測試「能不能把考題答對」,卻沒有評估模型是否真正理解課程知識本身是如何被組織與呈現的——包括先備知識鏈(哪些概念要先學過才能學下一個概念)、概念分類體系、實驗與概念之間的對應關係、教學排序(先教什麼後教什麼),以及圖表等視覺元素的知識定位能力。這篇論文的作者群(來自北京大學、Institute for Advanced Algorithms Research上海、OriginHub Technology等單位)把這種綜合能力稱為「curriculum cognition(課綱認知)」,並指出目前業界完全沒有工具可以系統性檢驗這件事。
為了填補這個空白,作者從中國官方的人教版(People's Education Press)教材中,針對數學、物理、化學、生物四個科目,橫跨小學、國中、高中三個學習階段,抽取並建構了一個「課綱對齊知識圖譜」——K12-KGraph。這個圖譜不只包含文字概念,還包含教材中的圖片與視覺元素,因此可以同時支援純文字與多模態(圖文並用)的評測與訓練。
方法
K12-KGraph 的圖譜結構包含 9 種節點類型(例如 Book、Chapter、Section、Concept、Skill、Experiment、Exercise、Figure、VisualElement)與 14 種關係類型,涵蓋課程結構(例如章節從屬、先後順序)與視覺定位(例如某張圖對應到哪個概念)兩大類。統計上,文字部分包含 6,579 個概念、1,364 項技能、652 個實驗、1,171 道習題;多模態部分則有 7,388 張圖片、10,203 個視覺元素;邊的數量則有 3,705 條 relates_to、1,896 條 is_a、2,174 條 relates_to 等關係型連結。
基於這個圖譜,作者自動衍生出兩個下游資源。第一個是 K12-Bench,一個高達 23,640 題的多選題 benchmark,分成五種任務家族:Ground(知識定位)、Prereq(先備知識推理)、Neighbor(鄰近概念推薦)、Evidence(實驗證據鏈)、Locate(跨章節索引)。這五種任務刻意設計成無法單靠背誦考古題作答,而是必須理解知識彼此之間的結構關係。第二個資源是 K12-Train,一個「圖譜引導」的監督式微調(SFT)語料庫,共 7,335 筆樣本,其中 2,267 筆是純文字問答(K12-Train-Text),5,068 筆是圖文並茂的多模態問答(K12-Train-MM),兩者合併稱為 K12-Train-Full。
實驗結果
作者先用零樣本(zero-shot)方式測試現成模型在 K12-Bench 上的表現,結果相當令人意外:即便是強力模型 Gemini-3-Flash,精確匹配率(exact match, EM)也只有 57.1%(F1 為 73.0%);規模較小的 Gemma-4-31B-IT 更只有 46.4% EM(F1 為 69.5%)。細看五種任務類型,Prereq(先備推理)與 Neighbor(鄰近推薦)這兩類任務最難,EM 甚至低於 35%,顯示模型雖然能記住零散知識點,卻難以掌握知識點之間的結構化關聯。
接著作者驗證了「用課綱知識圖譜引導的訓練資料」是否能縮小這個落差。在同樣 2,300 筆樣本的預算下,K12-Train-Text 在 GaokaoBench(中國高考題庫)上,於 Qwen3-4B-Base 上總分達 1009.96,超過表現最強的對照組 DataFlow(985.91),提升約 24.1 分;在 Llama3.1-8B-Base 上更是大幅超越 WizardLM 達 32.4 分。在 EduEval 上,K12-Train-Text 同樣拿下最佳平均分:Qwen3-4B 為 66.76 分、Llama3.1-8B 為 40.90 分,勝過八個主流指令微調語料庫。
在多模態視覺語言模型(VLM)的實驗中,K12-Train-Full 在三個 benchmark 上都拿下最佳整體成績:Gaokao-MM 準確率 39.9%,MDK12-Bench 整體分數 52.94,K12Vista 平均分數 79.95。值得注意的是,K12-Train-Full 使用的樣本數其實少於完整版的 DataFlow 與 WizardLM 基準語料庫,卻仍勝出;同時它也全面超越只用文字(K12-Train-Text)或只用多模態(K12-Train-MM)單獨訓練的版本,證明「文字監督」與「視覺監督」兩者是互補而非互斥的關係。
意義
這篇論文的核心訊息是:現行以「考題正確率」為核心的教育 LLM 評測方式,可能掩蓋了模型在理解課程結構上的真實弱點。即便是先進模型在傳統考試題庫上表現不錯,一旦被要求推理「先備知識鏈」或「相鄰概念關聯」,正確率立刻腰斬到 35% 以下,這代表模型很可能只是「記住答案」而非「理解課綱脈絡」。
更重要的是,作者證明了用知識圖譜系統性生成的訓練資料,比起單純堆疊更多題目或使用一般指令微調語料,在同樣資料量下效果更好——這對教育科技公司或學校自建輔導模型有直接參考價值:與其花大錢蒐集更多考古題,不如投資建構結構化的課綱知識圖譜,用「小而精」的資料撬動更大的能力提升。同時文字與多模態訓練資料互補的發現,也提示未來教育類模型的資料建構應同時涵蓋教材文字與圖表視覺內容,而非偏廢一方。作者已公開釋出圖譜、benchmark、訓練資料與完整建構流程,這讓後續研究者可以直接在此基礎上擴充到更多科目、語言或教育體系,是一個相當紮實且具開放性的教育AI基礎設施工作。