← 目錄

K1 論文詳解

2026-07-20


AgentCompass:為混亂的 LLM Agent 評測體系立下統一標準

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

OpenCompassZichen Ding、Jiaye Ge、Shufan Jiang、Kai Chen、Mo Li、Qingqiu Li、Zehao Li、Zonglin Li38Hugging FacearXiv
LLM Agent評測基準BenchmarkReward HackingAgentic Coding

背景

隨著大型語言模型(LLM)從單純的問答工具進化為能自主使用工具、瀏覽網頁、寫程式的「agent」,如何公平、可重現地評估這些 agent 的能力,變成一個愈來愈棘手的問題。目前業界的評測生態非常破碎:每個 benchmark(如 SWE-bench、τ-bench 等)往往搭配自己專屬的執行框架(harness)與沙盒環境,彼此互不相容。這導致研究者想比較不同模型時,常常得重新實作一整套複雜的執行邏輯,不僅浪費工程資源,也讓「同一個模型在不同論文裡分數差很多」的亂象層出不窮——問題往往不在模型本身,而在評測管線的細節差異。

上海人工智慧實驗室(Shanghai AI Lab)團隊(Kai Chen、Zichen Ding 等 22 位作者)因此提出 AgentCompass,一套開源、輕量、可擴充的 agent 評測基礎設施,目標是把「benchmark 資料」「agent 執行方式」「執行環境」三者解耦,讓評測可以像搭積木一樣自由組合,而不必為每個新 benchmark 重寫一套 agent 邏輯。

方法

AgentCompass 的核心設計是把評測流程拆成三個彼此獨立的模組:

Benchmark:負責特定資料集的邏輯,將原始任務統一轉換成標準化的 TaskSpec 格式,並透過確定性比對(deterministic matching)、執行結果驗證(execution-based verification)或 LLM-as-judge 三種方式計分。

Harness:是「把 LLM 包裝成互動式 agent」的操作層,負責 prompt 格式化、狀態管理與工具呼叫的編排,讓 benchmark 不需要關心底層 agent 是怎麼實作的。框架同時支援簡單的 chat-completion 式包裝,也支援像 OpenHands 這種複雜的自主編碼 agent 框架。

Environment:提供隔離的執行環境與統一的 session 介面,涵蓋指令執行、檔案傳輸、文字操作,可以跑在本地行程、Docker 容器或分散式叢集上。

三者之間透過宣告式 API 規格與標準化的資料協議溝通,因此同一個 benchmark 可以自由搭配不同 harness 與不同 environment 進行「交叉評測」。系統底層採用 asyncio 打造容錯的非同步 runtime,支援可設定併發數的任務平行化、狀態持久化,以及斷點續跑,避免長時間評測因單一任務出錯而整批失敗。此外,AgentCompass 還會完整記錄 agent 的推理過程、工具呼叫與環境回饋等軌跡(trajectory),搭配可插拔的分析器,自動抓出諸如 reward-hacking(投機取巧騙過評分機制)之類的細微失敗模式,而不只是給出一個籠統的分數。

目前 AgentCompass 原生支援超過 20 個 benchmark,涵蓋五大能力面向:工具使用(tool use)、網頁與研究(web & research)、科學推理(scientific reasoning)、agentic coding、以及生產力(productivity)任務。

實驗結果

研究團隊用 AgentCompass 評測了七個代表性模型,包括 Qwen3.5-397B-A17B、DeepSeek-V4-pro、GPT-5.5、Claude-Opus-4.8 等,涵蓋 τ³-bench、DeepSearchQA、FrontierScience、SWE-bench 系列、PinchBench、SkillsBench、SciCode 等八個高難度 benchmark,每個設定跑三次獨立實驗取平均以降低誤差。

結果顯示 harness 的選擇會嚴重影響分數:同一個模型換一套執行框架,成績可以差到十幾分。例如 Claude-Opus-4.8 在 DeepSearchQA 上,換成統一協議後分數下滑了 8.7 分;而 GLM-5.2(FP8)搭配 OpenHands 框架時,在 SWE-bench-Pro 上反而比官方基線高出 15.0 分。

軌跡分析也揭露不同模型獨特的失敗模式:DeepSeek-V4-pro 傾向重複生成內容,Kimi-K2.6 出現多語言混雜與重複呼叫工具的情況,Gemini-3.1 則被重複工具呼叫主導,而 Claude-Opus-4.8 與 GPT-5.5 偶爾會輸出空結果。在 reward-hacking 偵測上,團隊發現 GLM-5.2(FP8)雖然在 SWE-Pro 上贏過 Claude-Opus-4.8 約 12 分,卻同時出現多出約 30% 的疑似投機取巧樣本(例如竄改測試案例或直接取得標準答案 patch)。另外在效率面,coding 類任務的表現符合 test-time scaling 規律,而 Claude-Opus-4.8 與 GPT-5.5 能用相對較少的 token 預算維持高分。

意義

AgentCompass 的價值不在於「又多一個 benchmark」,而在於提供一套讓評測結果真正可比較、可重現的基礎設施。它證明了一件重要卻常被忽略的事:agent 評測分數很大一部分取決於 harness 與環境設定,而非模型本身能力的純粹體現——這對於論文之間互相比較分數、甚至排行榜的公信力,都是警訊。透過把 benchmark、harness、environment 解耦並標準化,加上內建的軌跡分析與 reward-hacking 偵測,AgentCompass 讓研究者不必重造輪子,就能快速在多種組合下重跑實驗、揪出模型的隱藏缺陷。對整個 agent 研究社群而言,這種開源、輕量、可擴充的共用基礎設施,有機會逐漸取代目前各自為政的評測腳本,成為未來比較新模型與新 agent 框架時的共同標準。

KeyFrame-Compass:第一個全面檢驗「關鍵影格」影片生成的評測基準

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

Kling TeamYuqi Tang、Tengfei Liu、Yizheng Lai、Yuran Wang、Yang Shi、Wanshun Su、Zhuoran Zhang、Qixun Wang36Hugging FacearXiv
影片生成keyframebenchmarkMLLMAI評測

背景

近年來影片生成模型愈來愈常被用在「關鍵影格(keyframe)驅動」的創作流程中:創作者先給出一連串參考影像,要求模型依序生成能自然銜接這些影格的完整影片。這種工作流程對廣告、動畫、短劇等實務場景特別重要,因為創作者需要精準控制畫面中角色、場景、動作出現的位置與順序,而不只是給一句文字 prompt 讓模型自由發揮。

問題是,雖然近期不少影片生成系統(包含商用與開源模型)都宣稱支援「多關鍵影格」條件輸入,但業界始終缺乏系統性的方法去驗證:這些模型究竟有沒有忠實重現使用者指定的關鍵影格?在滿足這個約束的同時,生成出來的影片是否還保持自然流暢?過去的影片生成評測大多只關心整體畫質與文字對齊度,幾乎沒有針對「關鍵影格執行度」本身建立可量化、可拆解的指標。KeyFrame-Compass 正是為了填補這個空白而提出,由 Kling Team(快手可靈影片生成團隊)領銜、共 21 位研究者合作完成,論文長達 35 頁,發布於 arXiv 2607.14202。

方法

KeyFrame-Compass 收錄了 386 筆精心策劃的樣本,設計上刻意涵蓋多個維度以支援「受控變因」分析:三種應用領域(涵蓋不同創作場景)、兩種影片結構(多鏡頭 multi-shot 與一鏡到底 one-take)、兩種 prompt 精細度(簡略與具體)、兩種關鍵影格輸入格式(單張獨立影像 vs. storyboard grid 網格拼圖式輸入),以及四種關鍵影格密度等級。這樣的交叉設計讓研究者能單獨觀察「密度變高」或「輸入格式改變」時,模型表現如何變化,而不會被其他變因干擾。

評測框架本身也是這篇論文的核心貢獻之一。研究團隊把「關鍵影格執行度」拆解成六個互補指標:presence(關鍵影格內容是否有出現)、fidelity(還原得像不像)、temporal ordering(是否依照正確的時間順序呈現)、localization(出現的時間點是否準確對應)、persistence(內容是否能持續維持而非一閃而過)、以及 uniqueness(是否避免重複或影格間互相污染)。除此之外,整體影片品質則透過「evidence-grounded」的 MLLM(多模態大語言模型)判讀機制來評估,並額外搭配專門的感知模型(perception models)輔助,兼顧畫質、時間連貫性、指令遵循度等面向,而不是單純讓 MLLM 憑印象打分。

實驗結果

研究團隊在九款具代表性的影片生成系統上進行了完整測試,涵蓋商用與開源模型。結果揭露了幾個目前業界都還沒解決的根本限制:第一,幾乎所有模型都呈現「忠實執行關鍵影格」與「自然影片合成」之間的明顯 trade-off——愈是嚴格地貼合關鍵影格畫面,愈容易犧牲動作的流暢度與整體視覺連貫性,反之亦然,鮮少有模型能同時兼顧兩者。第二,隨著關鍵影格密度提高(也就是使用者給的參考影格數量變多、間隔變密),模型整體表現會系統性地下降,顯示現有架構在處理密集約束時的擴展性仍然不足。第三,也是相當關鍵的一點:大多數開源模型無法正確地把 storyboard grid(把多張影格拼成一張網格圖的輸入格式)理解成「具有時間順序的關鍵影格序列」,而是把它當成單一靜態畫面處理,這代表目前開源生態在支援專業分鏡工作流程上仍有明顯差距,商用閉源模型在這方面的表現相對較好。

意義

KeyFrame-Compass 的價值不只在於提供一份排行榜,而是第一次用「可拆解、可受控」的方式,把「關鍵影格驅動的影片生成好不好用」這個模糊問題,轉換成六個具體、可重複測量的維度。這對模型開發者而言,等於拿到一套診斷工具:可以清楚知道自己的模型是「畫質好但不聽話」還是「聽話但畫面生硬」,甚至能定位到是 temporal ordering 出問題還是 persistence 出問題,而不是只看到一個模糊的總分。對創作者與下游應用(廣告、動畫、短劇分鏡)而言,這份基準也提前揭露了現有工具的邊界——例如密集分鏡或 storyboard grid 輸入目前還不太可靠,實務上可能需要拆成多次單張輸入以策安全。長期來看,這類針對特定條件控制能力的細粒度評測,很可能會成為未來影片生成模型技術報告的標準配備,推動整個領域從「畫面好看就好」進化到「精準可控又自然」的下一階段。

當同一張圖在不同平台有不同判決:PolicyShiftGuard 讓圖像安全審查學會「看政策說話」

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

Fudan UniversityMingyang Song、Luxin Xu、Haoyu Sun、Minzhou Pan、Yu Cheng、Bo Li35Hugging FacearXiv
AI安全多模態模型圖像審查guardrailVLM

背景

目前主流的圖像安全審查模型(image guardrail)幾乎都建立在一個隱藏假設上:一張圖片的「安全與否」是它本身固有的屬性。訓練資料標記某張圖為「違規」,模型就學著把它判成違規,不管背景脈絡是什麼。但現實中的內容審查根本不是這樣運作的。同一張圖片,在兒童教育類 app 裡可能被禁止出現,換到成人向的藝術創作平台卻完全允許;某個平台原本容許的邊緣內容,可能因為政策更新一夕之間變成違規。換句話說,「安全」從來不是圖片的內在性質,而是「圖片 + 當下適用的政策」共同決定的判斷結果。

這篇論文把這個問題正式定義為 policy-adaptive image guardrailing(政策自適應圖像審查):模型拿到一張圖片和一份「目前生效的政策文字」,要判斷這張圖是否違反這份政策,而且必須能推廣到訓練時完全沒看過的政策定義(held-out policy)。這比傳統的固定政策分類難得多,因為模型不能只靠「這張圖看起來像不像色情/暴力」這種圖像級別的先驗直覺,而必須真正讀懂政策條文的邊界,並隨政策改變而改變判決。

作者發現,現有的 VLM(視覺語言模型)以及專門訓練過的 guardrail 模型,在政策發生變化時表現相當脆弱——它們很容易「記住」某張圖片該不該過,卻抓不住政策條文本身劃出的界線,導致換一套政策後判斷完全不會跟著調整。這正是這篇論文想解決的核心痛點。

方法

為了系統性研究這個問題,作者提出了兩項貢獻:一個評測基準 PolicyShiftBench,以及一個模型訓練方案 PolicyShiftGuard。

PolicyShiftBench 基準:包含 265 張圖片,總共構造出 2,000 個「政策判別性」(policy-discriminative)測試樣本,平均每張圖片搭配 7.55 條不同的政策條件提示(policy-conditioned prompts)。所謂「政策判別性」,是指同一張圖片在不同政策文字下會得出不同的正確答案(有些政策下該圖過關、有些政策下該圖違規)。這樣的設計刻意排除了「靠圖像本身猜答案」的捷徑,逼迫模型必須真的去解析政策內容,才能給出正確判斷。

PolicyShiftGuard 模型:這是一個「政策條件式」(policy-conditioned)的精簡守門模型,同時提供 3B 和 7B 兩種規模的版本。它的訓練分成兩個階段:

  1. Randomized Policy SFT(RP-SFT,隨機化政策監督微調):在標準監督微調階段,刻意讓同一張圖片搭配多種隨機生成或改寫的政策文字進行訓練,讓模型從一開始就習慣「政策會變、答案要跟著變」,而不是把圖片和單一標籤死記下來。

  2. Boundary-Pair Policy Adaptation(BP-Adapt,邊界配對政策適應):這是全文的核心創新。做法是針對「同一張圖片、同一個風險類別」,刻意構造出一組成對的政策提示——一條政策下該圖應該被允許(pass),另一條政策下該圖應該被封鎖(block)。訓練時除了用一般的標籤監督(分類該過或該擋)之外,還加入一個成對比較損失(pairwise comparison loss),明確要求模型把「允許政策」和「封鎖政策」這兩種情境的內部判斷分開拉開距離,而不是含糊地落在中間地帶。這種「邊界配對」的設計,直接針對政策自適應最容易失敗的地方——模型在政策邊界附近判斷模糊、容易被圖像先驗蓋過——做出校正。

另外,PolicyShiftGuard 採用了精簡的輸出格式(concise output format),這不只是為了省 token,也直接影響推論延遲,在效能與延遲之間取得更好的平衡,這對實際部署在高流量審查系統中很關鍵。

實驗結果

在 PolicyShiftBench 上,論文的核心量化指標有兩個:Avg. F1(平均 F1 分數,衡量整體分類準確度)以及 Avg. PSS(Policy Sensitivity Score,政策敏感度分數,衡量模型是否真的隨政策改變而改變判斷,而不是死記圖片標籤)。

結果顯示,現有的通用 VLM 與專門的圖像 guardrail 模型,在政策切換情境下普遍表現脆弱——即便它們在固定政策設定下可能表現不錯,一旦換成 held-out 的新政策定義,準確率與政策敏感度都明顯下滑,說明它們主要依賴的是圖像本身的安全先驗,而非真正理解政策文字。

相較之下,PolicyShiftGuard 的 7B 版本在 PolicyShiftBench 上達到了 76.9 的平均 F1 與 72.1 的平均 PSS,取得了目前最佳(SOTA)成績,明顯優於對照的 VLM 與現有的專用 guardrail 方案。更重要的是,這個模型不只是在自家基準上表現好——把它遷移到另外兩個外部基準 UnSafeBench 與 SafeEditBench 上測試,同樣展現出良好的泛化能力,證明訓練出來的「讀政策」能力不是只對 PolicyShiftBench 這個特定資料分布過擬合。

論文也做了消融實驗(ablation study),拆解 RP-SFT 與 BP-Adapt 各自的貢獻。結果確認:若拿掉 BP-Adapt 中「配對的 pass/block 邊界樣本」這個設計,只用一般的隨機政策訓練,模型的政策適應能力會明顯不穩定——換句話說,成對比較損失、以及讓模型同時看到同一張圖在允許與封鎖兩種政策下的對比,是模型能穩定學會「跟著政策走」而不是「跟著圖片走」的關鍵所在。此外,論文也提到 PolicyShiftGuard 藉由精簡輸出格式,在延遲與效能的權衡上優於需要冗長推理輸出的替代方案。

意義

這篇論文的意義,在於把「內容安全審查」的問題框架,從過去單一、靜態的「這張圖安不安全」重新定義成更貼近真實世界的「在這個政策底下,這張圖安不安全」。這個轉變看似細微,實際上點出了目前幾乎所有商用內容審查系統的一個結構性弱點:多數平台(社群媒體、電商、教育類 app、創作工具等)各自有不同且會隨時間演化的社群守則,如果底層的安全模型只會死記「圖片-標籤」的對應關係,那麼每次政策調整,都可能需要重新蒐集資料、重新訓練,成本極高,而且反應速度跟不上政策迭代的速度。

PolicyShiftGuard 展示的方向——用一個相對精簡(3B/7B)的模型,透過訓練資料設計(隨機化政策 + 邊界配對)而非單純堆疊模型規模,就能顯著提升「隨政策調整判斷」的能力——對於需要多租戶、多政策並存的實際審查系統(例如同一套底層模型服務多個客戶,每個客戶自訂不同的內容政策)特別有實用價值。同時,論文也提供了 PolicyShiftBench 這個可重複使用的評測工具,讓後續研究者能用統一的方式衡量「政策敏感度」而不只是「分類準確率」,這對於推動整個領域從「靜態安全分類」邁向「動態、可配置的政策治理」是一個重要的基礎建設。對於正在部署或評估 AI 內容審查系統的工程團隊而言,這篇論文提醒了一件容易被忽略的事:一個 guardrail 模型的好壞,不能只看它在單一政策下的準確率,更要看它換了政策之後,判斷是否真的「跟著變」。