← 目錄

K1 論文詳解

2026-08-01


AskChem:把化學文獻檢索單位從「論文」換成「有據可查的主張」

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

New York UniversityBing Yan、Gregory Wolfe、Stefano Martiniani、Kyunghyun Cho285Hugging FacearXiv
化學文獻檢索知識圖譜RAGLLM agent

背景

化學研究常常不是讀一篇論文就能解決問題,而是要把散落在成百上千篇文獻裡的反應條件、產率、機制推論拼湊起來。傳統文獻搜尋系統(不管是關鍵字搜尋還是近年流行的 embedding 式語意搜尋)本質上都是「回傳一串排序過的論文清單」,之後的閱讀、比對、驗證來源全部丟給研究者或是 AI agent 自己手動完成。這在需要跨論文整合資訊的場景裡效率很差,也容易出錯——尤其現在很多人開始用 LLM 讀文獻做摘要或問答,DOI 引用亂編(citation hallucination)是常見痛點。這篇由 Bing Yan、Gregory Wolfe、Stefano Martiniani、Kyunghyun Cho 等人發表的論文,提出了 AskChem,一套把檢索單位從「整篇論文」下沉到「單一主張(claim)」的化學文獻基礎設施,目標是讓機器與人都能快速找到「有出處、可驗證」的化學事實,而不是一堆需要自己再篩選的文件。

方法

AskChem 的核心設計是把每篇論文拆解成「原子化、有型別(typed)」的主張,每條主張都必須綁定來源 DOI,並附上逐字引用或明確的證據定位(evidence locator),確保每個說法都能回溯查證。系統用雙軌抽取管線來產生這些主張:先用 GPT-5-mini 對摘要做高吞吐量的初步抽取,再用 Gemini 3.1 Pro 對全文 PDF 做更深入的抽取,捕捉摘要裡不會出現的細節(如具體反應條件、測量數值)。

在這個共享的主張資料庫之上,AskChem 疊了三層互補結構:一是「穩定化的分面式分類法(faceted taxonomy)」,橫跨反應類型、物質類別、應用、技術、機制、主張類型、測量、時間等八個維度,共有 30.7 萬個已填充節點,支援階層式瀏覽與檢索;二是「證據圖(evidence graph)」,用 17.1342 萬條有型別、有方向的邊(如 supports、contradicts、extends、derives_from)連結主張之間的邏輯關係,經專家驗證邊型別精確度達 97.9%;三是「動態演化的探索式分類法(living taxonomy)」,含 4,931 個節點,把論文安置到科學原理與機制的脈絡下,方便探索性瀏覽。

底層儲存用 SQLite 搭配 FTS5 全文檢索與向量索引,後端是 FastAPI,並用倒數排名融合(reciprocal rank fusion)把 FTS5 文字檢索、論文層級召回、分類節點召回、稠密向量召回四種訊號混合起來做混合式搜尋。對外則同時提供網頁介面、REST API、Python SDK 以及 MCP 伺服器,方便 AI agent 直接呼叫查詢。目前系統已索引 147,000 篇論文、共 240 萬條主張。

實驗結果

論文自建了 AskChem-Bench 評測集,涵蓋 30 道需要跨論文整合的化學問題,包括條件彙總、時間軸追蹤、矛盾發現等任務類型,並用 GPT-5.5 作為讀取生成答案的模型。結果顯示,把 GPT-5.5 接上 AskChem 檢索後,回答中的 DOI 100% 可解析(resolvable),相較於完全不做檢索的基線只有 88.3%,等於幾乎消除了 DOI 捏造的問題。在跟其他四套系統(單獨的 GPT-5.5、Paperclip、Edison Scientific 的 PaperQA 系列 agent、Google NotebookLM Deep Research)比較時,AskChem 拿下每則答案平均 18.1 個「已驗證」DOI 引用,是五套系統中最高的引用密度,同時相關性分數與對近期高影響力研究的覆蓋度也最好。作者也坦言 Edison Scientific 的系統在量化細節的呈現上略勝一籌,但 AskChem 勝在主張層級的細粒度、開放資料與互動速度。

意義

AskChem 的價值不只是「又一個化學搜尋引擎」,而是示範了一種讓 LLM 在專業領域裡減少幻覺、提高可信度的基礎設施設計思路:與其讓模型讀完整篇論文後自由生成答案,不如先把知識拆解成「有出處、可逐字核對」的最小單位,再讓模型在這個受控的主張庫裡做檢索與組裝。這種做法把「可驗證性」內建到資料結構層面,而不是事後靠模型自我審查或人工查核來補救,DOI 100% 可解析的結果就是最直接的證明。三層結構(分面分類、證據圖、動態分類法)的組合,也讓系統同時支援「按目錄查找」「沿邏輯關係推理」「探索式瀏覽」三種不同的使用情境,比單純的向量檢索更貼近科學家實際的閱讀與思考方式。對於正在把 LLM agent 導入科研工作流的團隊來說,AskChem 透過 REST、SDK、MCP 多種介面開放存取,等於提供了一個可以直接掛進既有 agent pipeline 的「可信知識層」,也為其他學科(生醫、材料科學等)建立類似的 claim-centered 基礎設施提供了可複製的範本。

Qwen-UI-Agent:邁向以真實世界為中心的下一代 GUI 代理

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

TongyiLabHanzhang Zhou、Panrong Tong、Xu Zhang、Quyu Kong、Chenglin Cai、Tianyu Xia、Gongjie Zhang、Jianan Zhang267Hugging FacearXiv
GUI Agent強化學習QwenAI Agent移動端自動化

背景

過去兩年,大型語言模型與視覺語言模型(VLM)的進步讓「GUI agent」——也就是能像人類一樣操作手機、電腦與瀏覽器介面的自動化代理——成為業界關注的焦點。理論上,這類代理有潛力成為數位裝置上的「通用執行者」:你只要下達一句指令,它就能自己點開 App、輸入文字、切換頁面,甚至跨平台完成一整套工作流程。

但現實中的 GUI agent 距離「可靠好用」還有很大落差。多數研究仍停留在模擬沙盒(sandbox)環境裡打榜,一旦搬到真實手機、真實 App 上,常常因為介面版本差異、彈窗廣告、網路延遲、驗證碼等因素而失敗。此外,現有代理大多只能執行單一模態的操作(要嘛純 GUI 點擊,要嘛純命令列),難以處理長達數十甚至上百步的複雜任務,也缺乏「主動」發起服務的能力——例如看到一則通知後自己判斷該不該去處理。

阿里巴巴 Qwen 團隊(由 Hanzhang Zhou 領銜,共 16 位研究者參與,含 Steven Hoi 等)在這篇技術報告中提出 Qwen-UI-Agent,試圖從根本上解決這些落地問題。他們的願景很明確:代理要能在真實裝置上穩定運作、跨平台串接工作流程、把 GUI 操作與 CLI(命令列)執行結合起來、完成長時程(long-horizon)任務、主動發起有用的服務,並且能以最少的人力自主提升能力。這篇論文(arXiv:2607.28227,2026 年 7 月 30 日提交,列於 cs.AI / cs.CV)正是圍繞這六個目標展開。

方法

Qwen-UI-Agent 提供三種模型規模:27B(主力模型)、35B-A3B(混合專家 MoE 架構,每個 token 只啟動約 3B 參數)以及更輕量的 4B 版本,涵蓋 mobile、computer-use、web 與 DeepSearch 四大環境。

統一動作空間是這套系統的核心設計。它把 GUI 操作(click、double_click、long_press、type、open、drag、system_button、wait)、CLI 指令(bash 執行)、結構化 API 呼叫,以及控制類動作(ask_user、terminate)全部整合進同一個動作空間,並且支援「單一模型回合內產生一批動作」——實測顯示在電腦操作任務中,CLI 佔比高達 40.7%–55.1%,其中約 39.6%–41.6% 的動作是以批次形式一次送出,大幅減少了逐步推理的延遲。

環境基礎設施上,團隊搭建了多層次沙盒:手機端用 redroid 容器化 Android,支援 20 款 App;電腦端在 OSWorld 的 Ubuntu 虛擬機基礎上擴充 bash 執行能力;瀏覽器端用 FastAPI + Playwright + Chromium 建立獨立 session;DeepSearch 則串接 Serper API 與 Jina Reader 做資訊檢索。更關鍵的是,他們額外建了一套真實裝置手機運行環境——超過 100 台實體手機、支援 150 多款 App,搭配健康感知排程器與黑名單機制,並用「虛擬螢幕」技術把單機吞吐量提升約 20 倍,對於登入、付款、驗證碼等敏感操作則交由專門的 User Agent 處理,同時用 VLM 判斷失敗究竟是模型出錯還是環境問題。

訓練分為三階段。**監督微調(SFT)**採用「分域專家訓練後合併」策略,搭配滑動視窗訓練(視窗長度 5 步、重疊 4 步)來處理長軌跡,並用 step 級別的 VLM 打分過濾低品質軌跡,同時混入通用問答、數學、程式、視覺理解等資料以保留基礎能力,避免「災難性遺忘」。Action RL 階段針對六種常見錯誤(元素混淆定位、排序/排名誤判、數量不完整、過早結束任務、重複迴圈、長尾動作失敗)設計了結構化獎勵函數。Online RL 則是重頭戲:採用 GRPO(Group Relative Policy Optimization)在超過 100 步的長軌跡上訓練,搭配約 1 萬個並發沙盒環境加速 rollout,並用「模型自適應課程」優先訓練成功率處於中段(既非太簡單也非太難)的任務,配合約 1 萬組自動合成的任務-驗證器配對。

驅動整個系統持續進化的是一套 AutoResearch 式資料飛輪:代理自己生成任務與環境、自動合成可重現的初始狀態、自動構建並驗證評分器(verifier)、對失敗案例做結構化歸因分析,再透過多輪拒絕採樣(rejection sampling)把高品質軌跡回收進 SFT 語料庫,形成「生成任務→執行→診斷失敗→改進→再生成」的閉環。此外,論文也提出了 AutoJudge——一套軌跡級自動評測器,在 666 條人工標註軌跡上達到 92.8% 的精確匹配準確率,能可靠地把結果分類為 pass、failed 或 env_error,大幅降低人工評測成本。

最後,一層「輕量化 harness」支援主動服務發起(基於通知觸發、多層次事務狀態追蹤)以及跨裝置的有狀態工作流程,讓代理能在手機與電腦之間做依賴感知的並行多代理規劃。

實驗結果

在**移動端(mobile-use)**基準上,Qwen-UI-Agent 取得了全面領先:MobileWorld(純 GUI)82.1%(50 步預算下,100 步預算則達 85.5%)、MobileWorld-Real 92.2%、AndroidDaily 97.5%。相較於 Opus 4.8,在 MobileWorld 上領先 14.6 個百分點;相較於 GPT-5.6 Sol 領先 12.0 個百分點——這是三個基準線中最直接呈現優勢的領域。

在**電腦操作(computer-use)**上,表現雖非榜首但相當有競爭力:OSWorld-Verified 達 79.5%(排名第二),OSWorld-v2 的部分進度分數為 40.0%、二元完成率 13.9%。值得一提的是效率面——Qwen-UI-Agent 平均只需 135.8 步完成任務,相較於其他模型的 173.5–326.7 步,展現出更精簡的動作規劃能力。相比 MiniMax M3,部分進度分數領先 17.7 個百分點,二元完成率領先 9.3 個百分點。

瀏覽器操作與 DeepSearch方面,WebArena 達 73.6%,較 Opus 4.8 高出 1.7 個百分點;BrowseComp 為 64.1%,中文版 BrowseComp-ZH 更高達 75.0%。

在 **GUI 定位(grounding)**這項基礎能力上,ScreenSpot-Pro(zoom-in 設定)達 81.5%,ScreenSpot-V2 高達 97.5%,MMBench-GUI L2 則為 92.6%——顯示模型在「準確找到螢幕上該點擊的元素」這件事上已相當成熟,這也是所有下游任務表現的地基。

論文也特別強調,在通用能力保留測試(MMLU-Pro、MMMU-Pro、Terminal-Bench 2.0 等)中,經過大量 agent 專項訓練後的模型,相較基礎模型並未出現明顯的能力退化,證明分域訓練加通用資料混合的策略確實有效。

意義

Qwen-UI-Agent 這篇報告最值得關注的地方,不是單一 benchmark 的分數,而是它試圖回答一個更根本的問題:GUI agent 要如何從「實驗室里的沙盒冠軍」變成「口袋裡真正能用的助理」。透過超過百台真實手機組成的運行環境、20 倍吞吐量提升的虛擬螢幕技術,以及能自動診斷模型與環境誰出錯的判別機制,團隊等於是在用工程手段填補「模擬 vs 真實」之間長期存在的落差——這對整個領域的意義,可能比刷新任何一項 benchmark 分數都更大。

其次,統一動作空間把 GUI 點擊與 CLI 指令、批次動作放進同一個決策框架,再加上超過百步的長軌跡線上 RL 訓練與 1 萬個並發環境,說明「長時程任務」的訓練瓶頸正在被系統性克服——過去 agent 訓練往往受限於單步監督或短軌跡強化學習,難以處理需要幾十步規劃的真實任務,而這套方案提供了一條可擴展的路徑。

再者,AutoResearch 式資料飛輪與 AutoJudge 評測器的組合,代表這類代理系統正在往「自我迭代」的方向演進——模型自己出題、自己驗證、自己歸因失敗原因,再把結果回饋進訓練,某種程度上降低了對人工標註的依賴,這也呼應了論文開頭提出「以最少人力自主提升能力」的願景。

當然,電腦操作與瀏覽器任務上「有競爭力但非最強」的結果也說明,跨平台的泛化能力仍是難題——手機端的優勢未必能直接遷移到桌面環境,顯示不同介面範式(觸控 vs 鍵鼠、App 生態 vs 桌面軟體)仍需要各自的資料與獎勵設計。對關注 AI agent 落地的開發者與企業而言,Qwen-UI-Agent 提供的不只是一個高分模型,更是一整套從沙盒到真機、從單步到長軌跡、從人工評測到自動裁判的完整工程範本,值得作為下一代生產級 GUI agent 系統設計的重要參考。

Metis:讓基礎模型「自帶記憶」而非外掛記憶模組

Metis: Memory Foundation Model

MemTensorZeyu Zhang、Ziliang Guo、Yihang Sun、Xichong Zhang、Xixuan Hao、Zehao Lin、Yang Zhang、Xiaoyan Zhao242Hugging FacearXiv
記憶基礎模型AI AgentTransformer架構長期記憶模型效率

背景

現在的 AI agent 越來越強調把各種能力「內化」到基礎模型本身,例如把視覺、語音等模態直接整合進 multimodal foundation model,或是把長鏈推理能力內化成 large reasoning model(如 o1、DeepSeek-R1 這類模型)。但有一項關鍵能力至今仍被排除在這波「內化」浪潮之外——記憶。

目前絕大多數 agent 的記憶系統,做法都是「外掛」:額外接一個向量資料庫做檢索增強生成(RAG)、或用一個獨立摘要模組把歷史對話壓縮存起來,需要時再檢索回填進 context window。這種做法有明顯缺點——檢索和生成是兩套分開優化的系統,存在資訊延遲、檢索誤差、以及難以端到端聯合訓練的問題,模型本身並不「知道」怎麼記憶,只是被動接受外部餵進來的資訊。

上海人工智能實驗室(IAAR-Shanghai)等機構的研究團隊(作者包括 Zeyu Zhang、Zhiyu Li、Tat-Seng Chua 等)在這篇論文中提出了一個新方向:「記憶基礎模型」(memory foundation model)。他們主張,記憶能力應該像推理能力一樣,被原生地內建進模型的骨幹網路(backbone)中,而不是靠外部模組拼接。論文將這種「原生記憶」(native memory)從兩個角度定義:第一,模型內部要有一個持續存在、且會動態演化的記憶狀態(memory state);第二,模型要具備能自主透過前向計算來存取和利用這些記憶的「原生記憶程序」(native memory procedure),包括記住、遺忘、更新等操作都是模型自己算出來的,而非外部規則觸發。

基於這個構想,他們打造出第一個原型系統——Metis。

方法

Metis 的核心是在標準 Transformer 層中,額外插入所謂的「Metis block」,由兩個子模組構成:

  • Local Memory Block(局部記憶區塊):一個稠密記憶網路,負責維護「步驟級」(step-level)的記憶狀態,會隨著對話推進不斷更新。
  • Hyper Memory Block(超記憶區塊):由靜態參數組成,負責控制記憶狀態如何被轉換與讀取。

在記憶的存取機制上,Metis 分成「儲存」與「利用」兩條路徑:儲存時,透過自適應聚合(adaptive aggregation)把當前的隱藏狀態(hidden state)壓縮,再用投影出的 key/value,透過一種類似 gated delta network 的更新規則,寫入一個稠密的記憶矩陣;利用時,則透過「記憶注意力」(memory attention)機制,讓 query 與記憶矩陣做正規化的交互運算,把歷史資訊整合進當前的推理過程。

最關鍵的設計是:整個記憶的線上維護過程是無梯度的(gradient-free)——推理階段模型權重完全凍結,記憶狀態的更新只需要一次前向傳播(forward pass)就能完成,不需要像某些 test-time training 方法那樣反向傳播更新權重。這讓記憶更新的成本大幅降低,同時三個運算分支(原始注意力計算、記憶利用、記憶儲存)可以並行執行,論文將單層延遲表示為 max(T_orig, T_util, T_store) + T_fuse,而不是像外部記憶系統那樣得依序完成檢索、prefill、生成三個階段。

訓練上,團隊構建了大規模的記憶專用訓練資料:主資料集包含來自 27 個公開 benchmark、涵蓋「記住(Remember)、遺忘(Forget)、更新(Update)、反思(Reflect)」四種操作的 357,137 筆樣本(約 4.06 億 tokens),並以顯式、隱式、干擾項三種互動風格呈現;另外還有 609,443 筆輔助資料,專門用來訓練多實體綁定、選擇性遺忘、記憶後對話、與記憶無關對話等魯棒性場景。訓練方式是所謂的「mid-training」——backbone(基於 Qwen3.5)完全凍結,只訓練新增的記憶參數,使用 8 張 H100 GPU、learning rate 2×10⁻⁴、BF16 精度,4B 與 27B 模型訓練 14,000 步,9B 模型因提早收斂只訓練 8,000 步。

實驗結果

團隊在 4B、9B、27B 三種規模上驗證了 Metis,並與 δ-Mem、Temp-LoRA 等基準方法比較。在「無上下文」(No Context)設定下的記憶操作測試 MemOps(Gold)上,Metis-27B 平均得分 24.76%,遠高於 δ-Mem 的 4.38% 與 Temp-LoRA-27B 的 9.70%。

在記憶型問答任務上,LoCoMo(Gold)測試中 Metis-27B 拿下 26.74% 平均分,對比 δ-Mem 僅 10.79%、Temp-LoRA-27B 僅 4.24%;而在偏向「上下文生成」的 NextMem 測試中,Metis-27B 更達到 50.82%,大幅超越 δ-Mem 的 20.42% 與 Temp-LoRA-27B 的 30.97%。這些數字顯示,Metis 的原生記憶機制在同等條件下明顯優於現有的外部記憶或參數化記憶方案。

為了測試泛化能力,團隊也在訓練分布之外的 ATM-Bench 上做評估,Metis-27B 取得 18.56% 平均分,證明其記憶能力具備一定的跨分布遷移性,而非單純過擬合訓練資料形態。

不過論文也坦誠地列出限制:當任務跨度拉長,記憶被壓縮進固定大小參數時會出現資訊遺失,潛在空間(latent space)中不同記憶的語意也可能相互混淆;單步驟的記憶容量在文字超過幾百字後會明顯下降,而隨著更新軌跡(trajectory)累積增多,準確率也會持續衰退。此外,在「主動記憶」階段引入無關上下文時,模型的通用能力(以 IFEval 衡量)出現了 -22.18% 的明顯下滑,顯示記憶機制目前仍會對模型原有能力造成一定干擾。另外,團隊透過低秩分解分析發現,記憶矩陣的資訊高度集中在低維子空間——rank 64 就能還原約 99.9% 的完整效能,暗示未來部署時仍有相當大的壓縮空間。

意義

Metis 的意義不在於「又做出一個記憶系統」,而在於提出並實證了一條與主流「外掛式記憶」完全不同的路線:讓記憶像注意力機制一樣,成為模型計算圖(computation graph)裡的原生組件,可以端到端訓練、可以並行計算、且推理時更新代價極低(僅需一次前向傳播、無需梯度反傳)。這對長期執行任務的 AI agent 特別重要——如果記憶是外掛的,agent 的「人格」與「經驗」就永遠停留在資料庫層面;但如果記憶被內化進模型權重與狀態,理論上可以帶來更緊密的推理-記憶協同、更低的延遲,以及更接近人類「邊做邊記」的認知模式。

當然,目前的 Metis 仍是一個初代原型,長程容量衰減、語意混淆、通用能力受干擾等問題說明這條路線離成熟還有距離,論文中列出的一系列限制其實比得分數字更值得關注——它們指出了下一步研究該優化的具體方向,例如更好的壓縮策略、更穩健的遺忘機制,以及如何在不犧牲通用能力的前提下持續學習。團隊已將程式碼與模型 checkpoint 開源(GitHub: MemTensor/Metis,Hugging Face collection: IAAR-Shanghai/metis,採 CC BY-NC-SA 4.0 授權),為後續研究者提供了一個具體可複現的起點,這或許會催生出「記憶基礎模型」這個新子領域,就像幾年前 reasoning model 從無到有壯大的過程一樣。