AskChem:把化學文獻檢索單位從「論文」換成「有據可查的主張」
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
背景
化學研究常常不是讀一篇論文就能解決問題,而是要把散落在成百上千篇文獻裡的反應條件、產率、機制推論拼湊起來。傳統文獻搜尋系統(不管是關鍵字搜尋還是近年流行的 embedding 式語意搜尋)本質上都是「回傳一串排序過的論文清單」,之後的閱讀、比對、驗證來源全部丟給研究者或是 AI agent 自己手動完成。這在需要跨論文整合資訊的場景裡效率很差,也容易出錯——尤其現在很多人開始用 LLM 讀文獻做摘要或問答,DOI 引用亂編(citation hallucination)是常見痛點。這篇由 Bing Yan、Gregory Wolfe、Stefano Martiniani、Kyunghyun Cho 等人發表的論文,提出了 AskChem,一套把檢索單位從「整篇論文」下沉到「單一主張(claim)」的化學文獻基礎設施,目標是讓機器與人都能快速找到「有出處、可驗證」的化學事實,而不是一堆需要自己再篩選的文件。
方法
AskChem 的核心設計是把每篇論文拆解成「原子化、有型別(typed)」的主張,每條主張都必須綁定來源 DOI,並附上逐字引用或明確的證據定位(evidence locator),確保每個說法都能回溯查證。系統用雙軌抽取管線來產生這些主張:先用 GPT-5-mini 對摘要做高吞吐量的初步抽取,再用 Gemini 3.1 Pro 對全文 PDF 做更深入的抽取,捕捉摘要裡不會出現的細節(如具體反應條件、測量數值)。
在這個共享的主張資料庫之上,AskChem 疊了三層互補結構:一是「穩定化的分面式分類法(faceted taxonomy)」,橫跨反應類型、物質類別、應用、技術、機制、主張類型、測量、時間等八個維度,共有 30.7 萬個已填充節點,支援階層式瀏覽與檢索;二是「證據圖(evidence graph)」,用 17.1342 萬條有型別、有方向的邊(如 supports、contradicts、extends、derives_from)連結主張之間的邏輯關係,經專家驗證邊型別精確度達 97.9%;三是「動態演化的探索式分類法(living taxonomy)」,含 4,931 個節點,把論文安置到科學原理與機制的脈絡下,方便探索性瀏覽。
底層儲存用 SQLite 搭配 FTS5 全文檢索與向量索引,後端是 FastAPI,並用倒數排名融合(reciprocal rank fusion)把 FTS5 文字檢索、論文層級召回、分類節點召回、稠密向量召回四種訊號混合起來做混合式搜尋。對外則同時提供網頁介面、REST API、Python SDK 以及 MCP 伺服器,方便 AI agent 直接呼叫查詢。目前系統已索引 147,000 篇論文、共 240 萬條主張。
實驗結果
論文自建了 AskChem-Bench 評測集,涵蓋 30 道需要跨論文整合的化學問題,包括條件彙總、時間軸追蹤、矛盾發現等任務類型,並用 GPT-5.5 作為讀取生成答案的模型。結果顯示,把 GPT-5.5 接上 AskChem 檢索後,回答中的 DOI 100% 可解析(resolvable),相較於完全不做檢索的基線只有 88.3%,等於幾乎消除了 DOI 捏造的問題。在跟其他四套系統(單獨的 GPT-5.5、Paperclip、Edison Scientific 的 PaperQA 系列 agent、Google NotebookLM Deep Research)比較時,AskChem 拿下每則答案平均 18.1 個「已驗證」DOI 引用,是五套系統中最高的引用密度,同時相關性分數與對近期高影響力研究的覆蓋度也最好。作者也坦言 Edison Scientific 的系統在量化細節的呈現上略勝一籌,但 AskChem 勝在主張層級的細粒度、開放資料與互動速度。
意義
AskChem 的價值不只是「又一個化學搜尋引擎」,而是示範了一種讓 LLM 在專業領域裡減少幻覺、提高可信度的基礎設施設計思路:與其讓模型讀完整篇論文後自由生成答案,不如先把知識拆解成「有出處、可逐字核對」的最小單位,再讓模型在這個受控的主張庫裡做檢索與組裝。這種做法把「可驗證性」內建到資料結構層面,而不是事後靠模型自我審查或人工查核來補救,DOI 100% 可解析的結果就是最直接的證明。三層結構(分面分類、證據圖、動態分類法)的組合,也讓系統同時支援「按目錄查找」「沿邏輯關係推理」「探索式瀏覽」三種不同的使用情境,比單純的向量檢索更貼近科學家實際的閱讀與思考方式。對於正在把 LLM agent 導入科研工作流的團隊來說,AskChem 透過 REST、SDK、MCP 多種介面開放存取,等於提供了一個可以直接掛進既有 agent pipeline 的「可信知識層」,也為其他學科(生醫、材料科學等)建立類似的 claim-centered 基礎設施提供了可複製的範本。