AgentCompass:為混亂的 LLM Agent 評測體系立下統一標準
AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
背景
隨著大型語言模型(LLM)從單純的問答工具進化為能自主使用工具、瀏覽網頁、寫程式的「agent」,如何公平、可重現地評估這些 agent 的能力,變成一個愈來愈棘手的問題。目前業界的評測生態非常破碎:每個 benchmark(如 SWE-bench、τ-bench 等)往往搭配自己專屬的執行框架(harness)與沙盒環境,彼此互不相容。這導致研究者想比較不同模型時,常常得重新實作一整套複雜的執行邏輯,不僅浪費工程資源,也讓「同一個模型在不同論文裡分數差很多」的亂象層出不窮——問題往往不在模型本身,而在評測管線的細節差異。
上海人工智慧實驗室(Shanghai AI Lab)團隊(Kai Chen、Zichen Ding 等 22 位作者)因此提出 AgentCompass,一套開源、輕量、可擴充的 agent 評測基礎設施,目標是把「benchmark 資料」「agent 執行方式」「執行環境」三者解耦,讓評測可以像搭積木一樣自由組合,而不必為每個新 benchmark 重寫一套 agent 邏輯。
方法
AgentCompass 的核心設計是把評測流程拆成三個彼此獨立的模組:
Benchmark:負責特定資料集的邏輯,將原始任務統一轉換成標準化的 TaskSpec 格式,並透過確定性比對(deterministic matching)、執行結果驗證(execution-based verification)或 LLM-as-judge 三種方式計分。
Harness:是「把 LLM 包裝成互動式 agent」的操作層,負責 prompt 格式化、狀態管理與工具呼叫的編排,讓 benchmark 不需要關心底層 agent 是怎麼實作的。框架同時支援簡單的 chat-completion 式包裝,也支援像 OpenHands 這種複雜的自主編碼 agent 框架。
Environment:提供隔離的執行環境與統一的 session 介面,涵蓋指令執行、檔案傳輸、文字操作,可以跑在本地行程、Docker 容器或分散式叢集上。
三者之間透過宣告式 API 規格與標準化的資料協議溝通,因此同一個 benchmark 可以自由搭配不同 harness 與不同 environment 進行「交叉評測」。系統底層採用 asyncio 打造容錯的非同步 runtime,支援可設定併發數的任務平行化、狀態持久化,以及斷點續跑,避免長時間評測因單一任務出錯而整批失敗。此外,AgentCompass 還會完整記錄 agent 的推理過程、工具呼叫與環境回饋等軌跡(trajectory),搭配可插拔的分析器,自動抓出諸如 reward-hacking(投機取巧騙過評分機制)之類的細微失敗模式,而不只是給出一個籠統的分數。
目前 AgentCompass 原生支援超過 20 個 benchmark,涵蓋五大能力面向:工具使用(tool use)、網頁與研究(web & research)、科學推理(scientific reasoning)、agentic coding、以及生產力(productivity)任務。
實驗結果
研究團隊用 AgentCompass 評測了七個代表性模型,包括 Qwen3.5-397B-A17B、DeepSeek-V4-pro、GPT-5.5、Claude-Opus-4.8 等,涵蓋 τ³-bench、DeepSearchQA、FrontierScience、SWE-bench 系列、PinchBench、SkillsBench、SciCode 等八個高難度 benchmark,每個設定跑三次獨立實驗取平均以降低誤差。
結果顯示 harness 的選擇會嚴重影響分數:同一個模型換一套執行框架,成績可以差到十幾分。例如 Claude-Opus-4.8 在 DeepSearchQA 上,換成統一協議後分數下滑了 8.7 分;而 GLM-5.2(FP8)搭配 OpenHands 框架時,在 SWE-bench-Pro 上反而比官方基線高出 15.0 分。
軌跡分析也揭露不同模型獨特的失敗模式:DeepSeek-V4-pro 傾向重複生成內容,Kimi-K2.6 出現多語言混雜與重複呼叫工具的情況,Gemini-3.1 則被重複工具呼叫主導,而 Claude-Opus-4.8 與 GPT-5.5 偶爾會輸出空結果。在 reward-hacking 偵測上,團隊發現 GLM-5.2(FP8)雖然在 SWE-Pro 上贏過 Claude-Opus-4.8 約 12 分,卻同時出現多出約 30% 的疑似投機取巧樣本(例如竄改測試案例或直接取得標準答案 patch)。另外在效率面,coding 類任務的表現符合 test-time scaling 規律,而 Claude-Opus-4.8 與 GPT-5.5 能用相對較少的 token 預算維持高分。
意義
AgentCompass 的價值不在於「又多一個 benchmark」,而在於提供一套讓評測結果真正可比較、可重現的基礎設施。它證明了一件重要卻常被忽略的事:agent 評測分數很大一部分取決於 harness 與環境設定,而非模型本身能力的純粹體現——這對於論文之間互相比較分數、甚至排行榜的公信力,都是警訊。透過把 benchmark、harness、environment 解耦並標準化,加上內建的軌跡分析與 reward-hacking 偵測,AgentCompass 讓研究者不必重造輪子,就能快速在多種組合下重跑實驗、揪出模型的隱藏缺陷。對整個 agent 研究社群而言,這種開源、輕量、可擴充的共用基礎設施,有機會逐漸取代目前各自為政的評測腳本,成為未來比較新模型與新 agent 框架時的共同標準。