SciReasoner:讓AI用「結構證據」推理蛋白質、分子與晶體的科學基礎模型
Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
背景
在生物、化學與材料科學裡,「結構決定性質」幾乎是鐵律:蛋白質的三維折疊決定它的功能,小分子的鍵結與立體化學決定它的反應性,晶體的週期性排列決定它的能帶與物理響應。科學家在解讀這些結構時,靠的不只是「看形狀」,而是套用一整套領域知識——立體化學、鍵結規則、對稱性、能量最低原理、週期性order等物理限制——去推論出「為什麼這個結構會有這個性質」。
過去幾年,大型語言模型(LLM)與科學基礎模型在序列預測、性質回歸上取得不少進展,但多數做法把結構「壓扁」成純文字或簡化描述,例如把蛋白質結構丟掉、只用胺基酸序列;把分子結構簡化成SMILES字串;把晶體結構丟成成分公式。這種做法方便套用現成的語言模型架構,卻犧牲了結構本身攜帶的空間、拓樸與週期性資訊,也讓模型難以「指出」到底是哪一段結構證據支撐了某個預測結論——也就是缺乏可解釋性。
這正是SciReasoner這篇論文想解決的核心矛盾:要讓AI模型「原生」地讀懂結構(而不是把結構降維成序列),同時又要它像科學家一樣,把推理過程中用到的具體結構線索攤開來講清楚,做到準確與透明兼顧。這篇論文由上海AI Lab、上海交通大學、清華大學、牛津大學等機構共29位作者合作完成,涵蓋蛋白質、小分子與無機晶體三大領域。
方法
SciReasoner的核心設計是一套「結構感知詞彙表」(structure-aware vocabulary):把座標(coordinates)、拓樸連接(topologies)以及晶體的週期性連接關係(periodic connectivities)全部離散化成token,和文字token放在同一個詞彙空間裡處理。這麼做的關鍵好處是,結構中的每一個token都變成「可定址的證據單元」(addressable evidence units)——模型在做推理時,可以像引用一段文獻一樣,明確指向某個原子座標、某段鍵結或某個晶格位置作為支撐證據,而不是把結構當成黑箱式的embedding。
這套統一詞彙讓同一個multimodal基礎模型能夠橫跨三個異質性很大的領域:
- 蛋白質:結構token編碼三維座標與拓樸關係,用於功能標註等任務;
- 小分子:結構token編碼原子連接與立體化學,支援逆合成(retrosynthesis)等化學任務,模型能同時生成「fragment-level disconnection」(把分子拆解成片段的斷鍵位置)與「precursor-verification」(驗證反應前驅物是否合理)的推理軌跡;
- 無機晶體:結構token編碼週期性連接,用於區分元素相與化合物相、band gap高低區間等材料性質。
訓練與推理上,SciReasoner採用一個統一的模型主幹,在跨領域資料上聯合訓練,讓模型學會「同一套推理邏輯」套用到不同結構模態,而不是為每個領域各自訓練專門模型。這種設計也呼應了論文標題強調的「native structural reasoning」——推理發生在結構原生表示上,而非先轉譯成低資訊量的文字描述再推理。
實驗結果
論文在跨領域共86個benchmark上做了系統評測,SciReasoner在其中67個任務上取得state-of-the-art的成績,覆蓋率約78%,顯示這套統一結構推理框架並非只在單一領域取巧,而是有較廣泛的泛化能力。
三個代表性數字特別值得注意:
-
蛋白質功能標註(Gene Ontology預測):在同源性受控(homology-controlled)的設定下,針對低同源性、甚至「孤兒式」(orphan-like,幾乎找不到同源序列可比對)的蛋白質,SciReasoner在Cellular Component這個子任務上,把F_max指標從0.42提升到0.55,相對提升幅度超過30%。這類低同源蛋白質原本是傳統依賴序列比對(homology search)方法的弱點,而SciReasoner靠結構證據推理彌補了這個缺口。
-
化學逆合成(single-step retrosynthesis):準確率從0.63提升到0.72,同時模型不是只給出「答案」,還會輸出fragment-level的斷鍵分析與precursor驗證軌跡,讓化學家可以檢查每一步推理是否符合真實反應機制。
-
材料科學表徵能力:在無機晶體上,SciReasoner學到的表徵能夠清楚地把元素相(elemental phase)與化合物相(compound phase)分開,並且能有效區分高band gap與低band gap兩個物理區間——這意味著模型內部學到的結構表示,本身就蘊含了材料物理上有意義的分類邊界,而不只是黑箱擬合。
此外,論文做了雙盲專家評測(double-blind expert evaluation),請領域專家評比SciReasoner生成的推理軌跡跟一個前沿LLM(frontier large language model)相比孰優孰劣。結果顯示,在98%的案例中,專家認為SciReasoner的推理軌跡「更好或至少相當」,這個高比例說明模型輸出的推理過程不只是準確率數字漂亮,在人類可讀性與科學嚴謹性上也站得住腳。
意義
SciReasoner的價值不只在於刷新了67個benchmark的紀錄,更重要的是它示範了一種「結構即證據」的AI設計哲學:把結構資訊完整保留為可索引的token,而不是壓縮成序列後再靠模型「猜」回結構含義。這對三個學科都有直接的應用想像——在生物領域,對缺乏同源序列參考的孤兒蛋白質(常見於新發現的病原體、深海生物或人工設計蛋白)做功能預測,原本是序列比對方法的死角,現在有了結構推理這條新路徑;在化學領域,逆合成規劃如果能連帶輸出可驗證的斷鍵與前驅物推理鏈,對藥物化學家、合成路線設計會更有實用度,而不只是給一個黑箱答案;在材料領域,模型表徵能自動分離出有物理意義的相與band gap區間,暗示未來可能用於加速新材料的性質篩選與逆向設計。
更深層的意義在於「可解釋性」與「準確率」不再是必須取捨的兩端。過去很多科學AI模型要犧牲透明度換取效能,或反過來為了可解釋性犧牲準確率。SciReasoner用統一結構詞彙+可定址證據token的設計,同時在準確率(67/86 SOTA)與可解釋性(98%專家認可)兩端拿到高分,這對於希望把AI真正整合進科學發現流程——而不只是當作黑箱預測工具——的研究者而言,是一個值得參考的技術路徑。當然,論文本身也提醒我們,「跨領域統一」的野心背後仍有工程複雜度與資料規模的門檻,這類多模態科學基礎模型能否進一步擴展到更多結構模態(例如RNA、蛋白質複合體、非週期性材料等),將是後續值得關注的方向。