當AI代理人面對數小時的終端機任務:Long-Horizon-Terminal-Bench揭露的長程能力斷層
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
背景
過去衡量AI代理人(agent)操作終端機(terminal)能力的評測基準,例如Terminal-Bench之類的設計,多半聚焦在「幾分鐘內就能做完」的簡單任務,而且評分方式往往只看「最終有沒有成功」這種二元結果。這種做法有兩個明顯缺陷:一是獎勵訊號太稀疏,模型做到一半、做對七八成,跟完全沒做,在評分上可能沒有差別;二是無法反映真實世界中那些需要長時間、多步驟迭代才能完成的工作,例如重現一篇論文的實驗、除錯一套複雜系統、或分析大量多模態資料。
為了填補這個落差,研究團隊提出了Long-Horizon-Terminal-Bench(LHTB),一套專門測試「長程」終端機任務的評測基準,總共包含46個任務,橫跨九大類別:實驗重現、軟體工程與逆向工程、多模態分析(如醫學影像稽核、文件重建)、互動式遊戲(2048、棋類、貪食蛇變體)、科學計算(N體模擬、流行病學建模)、地球與氣候科學(NetCDF資料處理、洪水偵測)、材料科學相圖、系統效能優化,以及邏輯謎題(數獨、Sokoban、Rush Hour)等。這些任務不是幾分鐘就能解決的小問題,而是動輒需要數百個執行回合(episode)、耗時數十分鐘甚至數小時才能完成的複雜工作流程。
方法
LHTB的核心創新在於評分機制的設計。每個任務都延續Terminal-Bench式的架構——附帶參考解答或模擬引擎——但進一步被拆解成細粒度的可評分子任務(subtask)。這讓系統可以給予「密集的中間獎勵」與「部分分數」,而不是只在任務全部完成時才給分。具體來說,整體任務獎勵R的計算方式,是把各子任務依權重加總後正規化,範圍落在0到1之間。獎勵型態包含三種:二元檢查(例如測試是否通過、服務是否有回應)、連續型指標(例如誤差型懲罰或比例吻合程度),以及跨回合聚合分數(例如多輪任務中的成功率)。
評測設定了兩個門檻:R≥0.95視為「部分獎勵通過」,R≥1.0則是「完美通過」的嚴格標準。研究團隊使用DeepSeek V4-Pro在1.5小時的執行預算下,反覆校準任務難度,從120個候選任務中篩選出46個,並以Harbor容器化格式實作,方便各模型在一致環境下執行。整套基準測試了15個前沿模型,包括GPT-5.5、GPT-5.4、GPT-5.3、DeepSeek V4 Pro、Gemini 3.1 Pro、GLM 5.1/5.2、Kimi K2.6/K2.7、MiniMax M3、Qwen 3.7/3.6、Doubao Seed 2.1 Pro、Hy3與Grok 4.20,全部透過共用的代理人框架(Terminus-2或Codex)執行,確保比較公平。
實驗結果
數字說明了這套基準有多「硬」。平均而言,一個代理人完成一項任務要耗費990萬個token、231個執行回合,以及85.3分鐘的實際執行時間——比過去的終端機基準高出一個數量級。任務成本估算落在每筆2.5美元到28美元之間,平均約10.5美元。
在表現上,即使是最強的模型GPT-5.5,在R≥0.95門檻下也只拿到15.2%的pass@1(46題中約解出7題),在更嚴格的R≥1.0門檻下更只剩10.9%。橫跨全部15個模型,平均通過率在兩個門檻下分別只有4.3%與1.7%。換算成執行次數的分布會更清楚:總共有690次執行中,30次(4.3%)在R≥0.95達標,433次(62.8%)落在0.05到0.95之間、也就是有明顯但不完整的進展,另外227次(32.9%)幾乎沒有進展(R<0.05)。特別值得注意的是,有73次「差一點就成功」的案例落在0.75到0.95之間的高分區。
失敗模式分析也很有意思。79%未解決的執行案例是因為耗盡了90分鐘的時間預算而超時,而這些案例的平均獎勵只有0.10到0.35,顯示它們並非「快完成卻沒完成」,而是實質進度就是有限。另有19%的失敗屬於「提早結束」——代理人自己誤判任務已完成,其中14次是「假完成」(R≥0.75卻自認做完),而且當時還剩20分鐘以上的預算沒用。不同模型的自我驗證能力差異也很大,提早結束時的平均獎勵從Kimi K2.6的0.11到Kimi K2.7的0.51都有,顯示「判斷自己是否做完」這件事,本身就是一項尚待改進的能力。
意義
LHTB最重要的貢獻,或許不是排行榜本身,而是證明了密集獎勵評分能揭露二元評分看不到的真相。如果只用R≥1.0的嚴格二元標準,15個模型中有10個會並列在0分,完全無法分出高下;但透過子任務級的連續獎勵,pass率與平均獎勵之間呈現Spearman ρ=0.56的相關性,讓研究者能區分「同樣只解出一題,但整體進展程度差很多」的模型,也能看出哪些模型常常「差一點」卻功虧一簣。
更深層的意義在於,這篇論文指出當前AI代理人的瓶頸,已經不再是單步推理是否正確,而是長程執行本身——包括時間預算的分配效率、長上下文的記憶管理、迭代式的錯誤修復能力,以及最關鍵卻常被忽視的「校準式停止判斷」(知道自己何時真正做完,而不是自以為做完)。對於想要打造能真正自主完成複雜、長時間工作流程的AI代理人的團隊來說,LHTB提供了一個更貼近真實世界複雜度的試煉場,也讓「代理人能力」的評估,從「會不會做」進化到「能做到多完整、多穩健」的層次。這套基準已對外公開,預期將成為未來長程代理人研究的重要參考點。