← 目錄

K1 論文詳解

2026-07-14


當AI代理人面對數小時的終端機任務:Long-Horizon-Terminal-Bench揭露的長程能力斷層

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

Tencent HunyuanZongxia Li、Zhongzhi Li、Yucheng Shi、Ruhan Wang、Junyao Yang、Zhichao Liu、Xiyang Wu、Anhao Li47Hugging FacearXiv
AI agentbenchmarkterminalLLM評測長程規劃

背景

過去衡量AI代理人(agent)操作終端機(terminal)能力的評測基準,例如Terminal-Bench之類的設計,多半聚焦在「幾分鐘內就能做完」的簡單任務,而且評分方式往往只看「最終有沒有成功」這種二元結果。這種做法有兩個明顯缺陷:一是獎勵訊號太稀疏,模型做到一半、做對七八成,跟完全沒做,在評分上可能沒有差別;二是無法反映真實世界中那些需要長時間、多步驟迭代才能完成的工作,例如重現一篇論文的實驗、除錯一套複雜系統、或分析大量多模態資料。

為了填補這個落差,研究團隊提出了Long-Horizon-Terminal-Bench(LHTB),一套專門測試「長程」終端機任務的評測基準,總共包含46個任務,橫跨九大類別:實驗重現、軟體工程與逆向工程、多模態分析(如醫學影像稽核、文件重建)、互動式遊戲(2048、棋類、貪食蛇變體)、科學計算(N體模擬、流行病學建模)、地球與氣候科學(NetCDF資料處理、洪水偵測)、材料科學相圖、系統效能優化,以及邏輯謎題(數獨、Sokoban、Rush Hour)等。這些任務不是幾分鐘就能解決的小問題,而是動輒需要數百個執行回合(episode)、耗時數十分鐘甚至數小時才能完成的複雜工作流程。

方法

LHTB的核心創新在於評分機制的設計。每個任務都延續Terminal-Bench式的架構——附帶參考解答或模擬引擎——但進一步被拆解成細粒度的可評分子任務(subtask)。這讓系統可以給予「密集的中間獎勵」與「部分分數」,而不是只在任務全部完成時才給分。具體來說,整體任務獎勵R的計算方式,是把各子任務依權重加總後正規化,範圍落在0到1之間。獎勵型態包含三種:二元檢查(例如測試是否通過、服務是否有回應)、連續型指標(例如誤差型懲罰或比例吻合程度),以及跨回合聚合分數(例如多輪任務中的成功率)。

評測設定了兩個門檻:R≥0.95視為「部分獎勵通過」,R≥1.0則是「完美通過」的嚴格標準。研究團隊使用DeepSeek V4-Pro在1.5小時的執行預算下,反覆校準任務難度,從120個候選任務中篩選出46個,並以Harbor容器化格式實作,方便各模型在一致環境下執行。整套基準測試了15個前沿模型,包括GPT-5.5、GPT-5.4、GPT-5.3、DeepSeek V4 Pro、Gemini 3.1 Pro、GLM 5.1/5.2、Kimi K2.6/K2.7、MiniMax M3、Qwen 3.7/3.6、Doubao Seed 2.1 Pro、Hy3與Grok 4.20,全部透過共用的代理人框架(Terminus-2或Codex)執行,確保比較公平。

實驗結果

數字說明了這套基準有多「硬」。平均而言,一個代理人完成一項任務要耗費990萬個token、231個執行回合,以及85.3分鐘的實際執行時間——比過去的終端機基準高出一個數量級。任務成本估算落在每筆2.5美元到28美元之間,平均約10.5美元。

在表現上,即使是最強的模型GPT-5.5,在R≥0.95門檻下也只拿到15.2%的pass@1(46題中約解出7題),在更嚴格的R≥1.0門檻下更只剩10.9%。橫跨全部15個模型,平均通過率在兩個門檻下分別只有4.3%與1.7%。換算成執行次數的分布會更清楚:總共有690次執行中,30次(4.3%)在R≥0.95達標,433次(62.8%)落在0.05到0.95之間、也就是有明顯但不完整的進展,另外227次(32.9%)幾乎沒有進展(R<0.05)。特別值得注意的是,有73次「差一點就成功」的案例落在0.75到0.95之間的高分區。

失敗模式分析也很有意思。79%未解決的執行案例是因為耗盡了90分鐘的時間預算而超時,而這些案例的平均獎勵只有0.10到0.35,顯示它們並非「快完成卻沒完成」,而是實質進度就是有限。另有19%的失敗屬於「提早結束」——代理人自己誤判任務已完成,其中14次是「假完成」(R≥0.75卻自認做完),而且當時還剩20分鐘以上的預算沒用。不同模型的自我驗證能力差異也很大,提早結束時的平均獎勵從Kimi K2.6的0.11到Kimi K2.7的0.51都有,顯示「判斷自己是否做完」這件事,本身就是一項尚待改進的能力。

意義

LHTB最重要的貢獻,或許不是排行榜本身,而是證明了密集獎勵評分能揭露二元評分看不到的真相。如果只用R≥1.0的嚴格二元標準,15個模型中有10個會並列在0分,完全無法分出高下;但透過子任務級的連續獎勵,pass率與平均獎勵之間呈現Spearman ρ=0.56的相關性,讓研究者能區分「同樣只解出一題,但整體進展程度差很多」的模型,也能看出哪些模型常常「差一點」卻功虧一簣。

更深層的意義在於,這篇論文指出當前AI代理人的瓶頸,已經不再是單步推理是否正確,而是長程執行本身——包括時間預算的分配效率、長上下文的記憶管理、迭代式的錯誤修復能力,以及最關鍵卻常被忽視的「校準式停止判斷」(知道自己何時真正做完,而不是自以為做完)。對於想要打造能真正自主完成複雜、長時間工作流程的AI代理人的團隊來說,LHTB提供了一個更貼近真實世界複雜度的試煉場,也讓「代理人能力」的評估,從「會不會做」進化到「能做到多完整、多穩健」的層次。這套基準已對外公開,預期將成為未來長程代理人研究的重要參考點。

別再把圖表轉成純文字了:視覺預訓練讓語言模型更聰明

Scalable Visual Pretraining for Language Intelligence

Yiming Zhang、Zhonghan Zhao、Wenwei Zhang、Haiteng Zhao、Tianyang Lin、Yunhua Zhou、Demin Song、Kuikun Liu41Hugging FacearXiv
視覺預訓練多模態LLM預訓練scaling law

背景

大型基礎模型的能力提升,長期以來幾乎都靠同一條路:把更多文字塞進預訓練語料庫。但這篇由上海人工智慧實驗室、浙江大學、中國科學技術大學、上海交通大學等單位共 16 位作者合作發表的論文《Scalable Visual Pretraining for Language Intelligence》(arXiv:2607.09657)指出,這個做法其實一直在丟資訊。

科學論文、教科書、技術報告等文件裡,大量知識是透過圖表、公式排版、頁面版面配置來傳達的——例如幾何圖形之間的空間關係、公式的符號拓撲結構、圖與文字的對應位置。目前主流的預訓練方式,不管是用 HTML/LaTeX 原始碼解析,還是用 Nougat、Pix2Struct 這類神經網路文件解析模型把 PDF 轉成純文字,本質上都是把一份富含視覺結構的文件「壓扁」成一維的文字序列,一旦轉換完成,原始視覺資訊就被永久丟棄,語言模型從未真正「看過」這些文件。即便近年的多模態基礎模型(如 InternVL)會在訓練中加入圖片輸入,但影像通常只是作為條件式的輸入脈絡,用來輔助預測文字 token,並沒有把視覺內容真正整合進模型的預測目標本身。

研究團隊因此提出一個核心問題:如果讓模型直接在原始視覺文件(把 PDF 頁面當成圖片)上做無監督預訓練,不做任何文字抽取、也不需要圖文配對標註,是否能比純文字預訓練學到更強的語言智能?他們稱這個框架為 Visual Pretraining(VP,視覺預訓練),並與傳統的 Text Pretraining(TP,文字預訓練)在完全相同的底層語料上做對照實驗。

方法

VP 的做法是在既有的文字持續預訓練(continued pretraining, CPT)基礎上,額外加入「下一個視覺潛在特徵預測」(next visual latent prediction)這個訓練目標。具體流程是:先用一個凍結參數的視覺編碼器(vision tower)把渲染出來的文件頁面影像編碼成一串視覺特徵;由於文件頁面存在大量空白邊界與留白區域,系統會依據每個影像區塊(patch)的像素變異數與平均亮度等統計量,過濾掉背景空白區塊,只保留有內容的「前景」區塊,並依照頁面上由左至右、由上至下的閱讀順序(raster-scan)重新排列,藉此把視覺序列大幅壓縮變短。

這些前景視覺特徵接著透過一個可學習的線性投影模組,映射進語言模型的隱藏空間,以因果注意力遮罩(causal mask)的方式餵入與處理文字 token 相同的自回歸(autoregressive)骨幹網路。訓練目標則是用對比學習(InfoNCE,一種帶溫度係數的 softmax 對比損失)讓模型在某個位置預測下一個前景視覺潛在特徵,以批次內其他影像特徵作為負樣本。最終損失函數是文字交叉熵損失與視覺對比損失的加權組合,文字與視覺樣本交錯訓練,同時更新語言模型主幹、視覺投影層與預測頭,但保持視覺編碼器凍結不動。

實驗設計刻意讓 VP 與 TP 只在「文件表徵方式」上不同:同一批科學 PDF 語料,TP 用 MinerU2.5 解析成純文字,VP 則渲染成影像後過濾出稀疏視覺序列,除此之外的起始檢查點、優化流程、監督式微調(SFT)階段全部保持一致,確保任何效能差異都能歸因於是否保留了視覺結構。實驗涵蓋 Qwen3.5、Qwen3、Llama 3.2 Vision、Llama 3.1 四個骨幹模型,兼顧原生多模態模型與純語言模型兩類。

實驗結果

第一個關鍵發現是:同樣的科學文件語料,VP 在科學推理 benchmark 上全面優於 TP。以 Qwen3.5 為例,GPQA Diamond 從 TP 的 76.24 分提升到 VP 的 79.29 分(+3.22 分),MMLU-Pro 從 83.91 提升到 85.09,AIME 2025 從 89.58 提升到 90.21;在 Llama 3.2 Vision 上,AIME 更是從 13.75 大幅提升到 18.54。相對地,難度主要來自多步驟推理而非視覺知識的 HLE(Humanity's Last Exam)基準,VP 的提升就相對有限(最多 +0.97 分),這恰好印證了 VP 的優勢確實來自「補回」了文字抽取過程中流失的圖表、公式等視覺知識,而非泛用推理能力的隨機提升。

第二個發現是效率驚人:VP 只用了 25% 的 token 預算就達到更好效果。同一批 PDF 語料,TP 解析成約 800 億(80B)文字 token,VP 渲染並過濾後只需約 200 億(20B)視覺 token,整體 CPT token 預算 TP 為 1800 億、VP 僅 1200 億。隨著訓練資料量增加,VP 相對 TP 的效能增益還會持續放大:論文用「相對文字基線的正規化增益」衡量,MMLU-Pro 達到 1.27 倍、GPQA 達到 2.02 倍、AIME-25 更達到 2.88 倍,顯示 VP 具有更好的規模化(scaling)效率。此外實驗也發現視覺 token 預算存在甜蜜點——每批次保留 8,192 個前景視覺 token 效果最佳,即便把渲染解析度降低、壓縮視覺輸入,VP 依然能維持對 TP 的優勢。

第三個發現是跨模態能力的「無監督湧現」。VP 完全沒有使用任何圖文配對標註,卻讓模型的視覺與文字表徵在共享空間中對齊得更好:在 100 組科學文件圖文對上,兩模態嵌入的中心點距離(centroid separation)從 1.665 降到 0.661,配對餘弦相似度從 0.631 提升到 0.907,Linear CKA 從 0.657 提升到 0.745,各項 k-近鄰重疊指標也全面改善。反映到實際多模態 benchmark 上,以 Qwen3.5 為例,ChartQAPro 從基準的 57.99 分(TP 甚至退步到 56.42)提升到 VP 的 61.80 分,MathVista 從 84.30 提升到 86.70;在 Llama 3.2 Vision 上 MathVista 更是提升 4.8 分。而且視覺結構密度越高的樣本(圖表、公式、表格越多),VP 對 TP 的優勢越大——高密度樣本增益達 +3.80,中密度 +2.86,低密度幾乎打平(-0.15),進一步證實效果確實來自視覺結構本身。

意義

這篇論文的意義在於挑戰了「語言模型只能靠純文字語料訓練」這個長期未被質疑的預設。它用嚴謹的對照實驗(相同語料、相同模型骨幹、只換表徵方式)證明:把 PDF 直接當圖片訓練,而不是先 OCR/解析成文字再訓練,不但不會讓語言智能打折扣,反而能用更少的 token 換取更強的科學推理與跨模態能力。這對正面臨「高品質文字語料即將枯竭」焦慮的基礎模型訓練產業來說,提供了一條新的規模化路徑——與其拚命尋找更多文字資料,不如更充分地利用既有文件裡本來就存在、卻被文字化過程浪費掉的視覺資訊。

論文作者也坦承限制:VP 目前仍是建立在文字預訓練之上的「加成」,而非完全獨立的訓練範式;實驗也主要聚焦在知識密度高的科學 PDF,尚不清楚是否能推廣到一般自然影像或影片。但作者指出兩個值得期待的方向:其一,對圖表、公式、結構化版面等「高密度視覺原生語料」,視覺潛在預測可以成為有效的輔助預訓練目標;其二,這可能開啟一條更具規模化潛力的路徑——未來基礎模型或許可以主要在大規模壓縮視覺資料流上訓練,再輔以輕量級的文字對齊,就能達到甚至超越現有純文字模型的水準。對於長期關注 LLM scaling 與資料效率的讀者來說,這篇工作提供了一個具體、可驗證的訊號:視覺,不再只是語言模型的輸入配菜,而可能是下一階段規模化智能的主菜之一。

影片生成模型晉升通用視覺學習者:GenCeption 如何用一個 diffusion backbone 打通深度、分割、姿態估計

Video Generation Models are General-Purpose Vision Learners

GoogleDeepMindLetian Wang、Chuhan Zhang、Rishabh Kabra、Jasper Uijlings、Steven Waslander、Andrew Zisserman、Joao Carreira、Kaiming He40Hugging FacearXiv
電腦視覺影片生成擴散模型基礎模型GenCeption

背景

在自然語言處理領域,next-token prediction 這個簡單粗暴的訓練目標,把無數各自為政的任務模型,收斂成了 GPT 系列這種單一的通用基礎模型。電腦視覺至今卻仍停留在「各打各的」階段:深度估計有專門的 DepthAnything3,分割有 SAM3,相機姿態估計有 VGGT-Omega,人體姿態有 Sapiens、David,3D 關鍵點有 Genmo,法向量估計有 Lotus-2——每一項任務都需要一個獨立訓練、獨立標註資料的模型。這篇來自 Google DeepMind(Letian Wang、Chuhan Zhang、Kaiming He、Andrew Zisserman、Cristian Sminchisescu 等 12 位作者)的論文提出一個大膽的類比:如果 next-token prediction 是 NLP 的催化劑,那麼大規模 text-to-video 生成,很可能就是電腦視覺對應的催化劑。原因很直觀——要生成一段連貫、符合物理規律的影片,模型必須內化空間結構、時間動態、以及文字與畫面之間的語意對齊,這些恰好是視覺理解任務所需要的先驗知識。論文作者將這個想法落地為 GenCeption:一個直接沿用預訓練 text-to-video 擴散模型骨幹、僅用文字指令驅動的通用感知模型,號稱能一口氣涵蓋深度、法向量、相機姿態、指代式分割與 3D 關鍵點預測等任務。

方法

GenCeption 的核心骨幹取自 WAN 2.1,一個基於 Transformer 的 latent diffusion 模型(DiT 架構,搭配 VAE 編碼解碼器與文字編碼器),實驗涵蓋 1.3B 與 14B 兩種參數規模。關鍵的架構改造在於:不再讓模型跑完整的多步驟去噪生成流程,而是把時間步(timestep)固定在 t=0、並將速度輸出(velocity output)取負號,直接把一個生成式擴散模型「拗」成一次前向推理(feed-forward)就能輸出感知結果的判別式模型。輸入解析度為 480×832 像素、81 幀、24 FPS,時間下採樣倍率 4、空間下採樣倍率 8。

訓練資料刻意做得非常「輕量」:僅使用 7,500 段人形合成影片,由 800 個 RenderPeople 3D 資產搭配 200 段 CMU 動作捕捉序列渲染而成,再依任務混入少量輔助資料集(深度用 TartanAir、Virtual KITTI、MVS Synth;分割用 MeViS、Ref-COCO、YouTube-VOS)。訓練規模為 256 顆 v6e TPU、batch size 64、共 15,000 步。評測涵蓋 Hi4D、SINTEL(法向量與相機姿態)、KITTI、ETH3D、Goliath(深度)、VideoMatte、PhotoMatte85、PPM-100(前景分割)、EMDB(3D 關鍵點)、以及 RefVOS-DAVIS、MeViS(指代式分割)等多個 benchmark。作為對照組,論文也用同樣設定訓練了 V-JEPA 與 Video MAE 兩種替代預訓練範式,以驗證「影片生成」這個預訓練目標本身是否真的更優。

實驗結果

結果顯示 GenCeption 在多項任務上追平甚至超越專用模型:深度估計上以遠少於對手的資料量,達到與 D4RT、VGGT-Omega 相當的 AbsRel 指標;法向量估計超越 NormalCrafter 與 Lotus-2;指代式分割上超越 SAM3;3D 關鍵點預測則優於 Genmo 與 TRAM。最引人注目的是資料效率——GenCeption 僅用區區 7,500 段合成影片,就達到了 D4RT、VGGT-Omega 等對手 7 倍到 500 倍訓練資料量才能達到的水準。在相同訓練設定下,以影片生成為預訓練目標的骨幹,全面優於 V-JEPA 與 Video MAE,證明「生成」比「遮罩重建」或「表徵預測」更能學到通用視覺先驗。論文也初步觀察到模型與資料的 scaling 趨勢:14B 模型整體優於 1.3B,資料量增加也帶來穩定提升。推理效率上,拿掉 WAN 原本 50 步的擴散取樣後,單顆 TPU 上 1.3B 模型可達 13.6 FPS、14B 模型也有 8.0 FPS,遠快於一般擴散生成模型。

最有意思的發現是「湧現式泛化」:模型全程只用合成的人形影片訓練,卻能直接零樣本遷移到真實世界影像,甚至泛化到訓練資料中完全沒出現過的類別,例如動物與機器人;從單一物體場景訓練,也能泛化到多物體真實場景。

意義

這篇論文的意義不只是「又一個 state-of-the-art 模型」,而是提出了一條電腦視覺走向通用基礎模型的可能路徑:與其為每個視覺任務單獨蒐集標註資料、訓練專用架構,不如借助大規模、易得的 text-to-video 生成預訓練,把空間時間先驗與語言對齊能力一次學好,再用極少量下游資料把它「掰彎」成判別式感知模型。7 到 500 倍的資料效率提升,加上從合成人形資料泛化到真實世界動物與機器人的能力,都指向影片生成模型並非只是「造圖造影片的工具」,而可能是通往能理解真實物理世界的通用視覺智能的基礎路徑。對業界而言,這也意味著未來訓練視覺基礎模型的重心,或許會從堆疊人工標註資料集,轉向投資更大規模、更高品質的影片生成預訓練。