OpenART:用「環境演化式攻擊」揭露 AI Agent 在長流程任務中的安全死角
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
背景
現在的 AI agent 已經不再只是「問一句答一句」的聊天機器人,而是要在一個持續存在、會被反覆讀寫的「共享狀態」中完成長流程任務——像是連續操作資料庫、雲端主控台或企業內部系統。這種模式帶來一個過去安全評測沒有正視的問題:agent 早期做出的一個狀態變更,可能在幾十步之後才引爆風險,而且傳統 benchmark 大多是「一次性、靜態」的短任務,無法捕捉這種跨步驟累積的危險。
為了填補這個落差,研究團隊提出 OpenART,一個開放式、可持續演化的 agent 紅隊測試競技場。它收錄超過 10,000 個經過驗證的「有狀態」場景,橫跨 50 個領域(如銀行、零售、醫療、雲端運算、非營利組織管理等),背後依託一個超過 500,000 個工具與技能的資源池。這些任務的中位數需要 97 次工具呼叫、依賴深度達 32 層、並行寬度 12.5、涉及狀態物件 96.5 個——相較過去 benchmark 通常只有 1 到 15 次工具呼叫、2 到 3 層依賴,複雜度高出一個量級。OpenART 也支援跨 75 種 agent 與模型組合的統一評測,包括 GPT-5.5、Claude Opus-4.8、GLM-5.2、Qwen-3.7-Max、DeepSeek-V4-Pro 五個基礎模型,搭配 OpenCode、Aider、Claude Code、Codex、Copilot CLI、Goose 等 15 種實際部署的 agent 框架。
方法
論文的核心方法是「演化式馬可夫超圖攻擊」(Evolutionary Markov Hypergraph Attack,簡稱 EMHA)。這是一個黑盒策略,重點在於:攻擊者不去修改模型參數,也不改變任務目標本身,而是透過「被授權的狀態轉換」持續演化任務所處的環境,藉此逼出安全漏洞。
EMHA 的運作分成四個階段:第一,「凍結式情境內適應」——模型參數全程不變,學習訊號只透過外部攻擊者的狀態追蹤來累積;第二,「超圖攻擊回合」——從候選圖中選取節點、抽樣依賴路徑,再用凍結的模型把路徑解碼成具體的環境修改動作;第三,「回饋引導的路徑學習」——採用 soft Q-learning 策略平衡探索與利用,把評估回饋透過 return decomposition 重新分配到各步驟;第四,「檔案庫引導的圖演化」——引入 MAP-Elites 品質多樣性搜尋,針對每個行為區間保留適應度最高的攻擊模式,再透過圖編輯運算子產生下一代變異。整個流程中,任務目標保持固定,唯一改變的是環境狀態本身,這也是論文刻意的實驗控制,用來單獨測量「環境演化」對安全性的邊際影響。
研究團隊同時歸納出三種反覆出現的風險模式:「過時假設延續」(agent 沿用已經失效的計畫範本或先前的安全判斷)、「延後的安全推理」(新的情境資訊透過信任管道傳入後,安全判斷被順勢往下游推遲而非重新計算)、以及「組合式風險湧現」(多個各自看似無害的環境變更,在長流程中組合成不安全行為,論文量測到風險傳播的中位距離達 37 個目標動作)。此外,評測器的判準也經過人工審核,99.3% 的自動判斷被人類專家確認為正確,確保 ASR 數字的可信度。
實驗結果
在全部 75 組 agent-模型配置中,EMHA 的整體 pooled 嚴格攻擊成功率(Strict ASR)達到 85.0%。按模型拆分(對應論文 Table 6):DeepSeek-V4-Pro 為 94.7%、Qwen-3.7-Max 為 94.6%、GPT-5.5 為 88.5%、GLM-5.2 為 87.9%,而 Claude Opus-4.8 明顯較低,只有 59.2%,顯示不同模型家族的安全韌性差異相當大。
更關鍵的發現在於「環境演化」本身的效果:相較於只演化攻擊指令、不演化環境的作法,EMHA 帶來的 ASR 提升在簡單環境中僅約 1.8%–2.7%,但在最複雜的環境中暴增到 17.2%–17.6%。這代表任務複雜度越高、狀態越持久,環境層面的攻擊面就被放大得越明顯——也印證了論文一開始的假設:靜態、短任務的 benchmark 系統性低估了長流程 agent 的真實風險。另一個統計結果顯示,「agent 的具體執行環境(runtime)」對安全表現變異的解釋力,在扣除底層模型能力之後,仍額外貢獻約 7.6%,意味著同一個模型換不同的 agent 框架部署,安全表現也可能大幅不同。
意義
OpenART 的意義在於把 agent 安全評測從「單輪、靜態」推進到「多輪、有狀態、可演化」的範式。過去許多紅隊測試把攻擊重心放在提示詞(instruction)層面,但這篇論文證明,當任務足夠複雜、狀態足夠持久時,「環境本身」才是更值得攻擊、也更容易被忽視的破口——攻擊者不需要說服模型做壞事,只要悄悄改變它所處的世界狀態,模型就會在既有的信任假設下,一步步把自己帶往不安全的結果。
這對業界部署 agent 系統有兩個直接啟示:第一,安全防護不能只靠「審查單次輸出」,還需要對長流程中的狀態一致性、假設過期、風險累積做持續監控;第二,agent 的安全表現不只取決於底層 LLM 有多強,execution runtime、工具鏈設計同樣是安全鏈上不可忽視的一環。隨著 agent 被越來越多地部署在銀行、醫療、雲端管理等高風險場域,OpenART 提供的十萬級場景與 50 萬工具池,有望成為業界檢驗「持久環境下 agent 安全性」的標準化基礎設施。