← 目錄

K1 論文詳解

2026-07-31


TurboVLA:繞過大型語言模型,單張RTX 4090上以32Hz即時運行的視覺-語言-動作模型

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

H-EmbodVisHengyi Xie、Chenfei Yao、Xianjin Wu、Xuanyang Xi、Yiping Tang、Di Xu、Yingying Zhu、Dingkang Liang120Hugging FacearXiv
VLA機器人操控模型效率LIBERO邊緣推論

背景

近年來機器人操控領域最熱門的做法,是把「視覺-語言-動作」(Vision-Language-Action, VLA)模型建立在大型語言模型(LLM)之上。這類系統通常遵循一條 V→L→A 的路徑:先用視覺編碼器把攝影機畫面轉成特徵,再把這些特徵「投影」進 LLM 的表示空間,讓 LLM 同時處理視覺 token 與語言指令 token,最後再從 LLM 輸出的隱藏狀態解碼出機器人動作。像 OpenVLA、π0 系列這類模型正是採用這種設計,理論上能借助 LLM 強大的世界知識與推理能力提升泛化性。

但這個設計有一個現實問題:每次策略呼叫(也就是機器人每做一個決策)都必須跑一次完整的 LLM 前向傳播,計算量與記憶體開銷都非常龐大。以 OpenVLA 為例,參數量高達 7.5B,單次推論延遲達 202.9 毫秒、需要 14.9 GB VRAM;即使是相對輕量的 π0.5(3.4B 參數),延遲也要 93.6 毫秒、佔用 12.8 GB VRAM。對於需要高頻率閉環控制的真實機器人任務(例如抓取、疊放、精細操作),這種延遲意味著策略更新頻率被壓低到個位數 Hz,遠不及真實控制迴路所需的反應速度,也讓這些模型難以部署在消費級硬體或邊緣裝置上。

由華中科技大學等團隊組成的研究團隊(Hengyi Xie、Dingkang Liang、Xiang Bai 等人)因此提出一個問題:VLA 模型真的需要一個完整的大型語言模型當作視覺與動作之間的「中介」嗎?他們認為,LLM 在此處理的其實是低層次的執行任務,未必需要語言模型的生成式推理能力,於是提出了 TurboVLA,將傳統的 V→L→A 路徑重新設計為更直接的 V+L→A 映射。

方法

TurboVLA 的核心思路是拿掉 LLM 這個龐大的中介,改用輕量模組直接讓視覺與語言資訊互相融合,再交給一個緊湊的解碼器產生動作。具體架構包含四個部分:

  1. 視覺編碼器:採用 DINOv3,在 LIBERO 基準上使用 ViT-B、在難度更高的 RoboTwin 2.0 雙臂任務上使用 ViT-L,獨立提取畫面特徵。
  2. 文字編碼器:使用 BERT 對語言指令做輕量編碼(消融實驗顯示換成 T5-small 或 SigLIP 也可行,說明架構對文字骨幹並不敏感)。
  3. 雙向視覺-語言互動模組:這是整篇論文的關鍵創新——用 6 層雙向交叉注意力(cross-attention),讓視覺特徵與語言特徵在共享的 256 維隱藏空間中互相「查詢」對方,產生「場景感知的指令特徵」與「指令條件化的視覺特徵」。這一步取代了 LLM 原本用自回歸方式融合多模態資訊的角色。
  4. 動作解碼器:採用類似 ACT(Action Chunking Transformer)的結構,一次性並行輸出一段連續的動作序列(action chunk),而非逐步自回歸生成,LIBERO 上每次輸出 12 步動作、RoboTwin 2.0 上輸出 50 步。

訓練上,TurboVLA 使用 L1 損失做行為克隆(behavior cloning),學習率 5×10⁻⁵,在四張 RTX 4090 上訓練,LIBERO 任務訓練 80,000 步(含 10,000 步暖身)。在真實世界任務的微調中,僅用 260 條teleoperation示範資料、微調 12,500 步,就能讓模型部署到實體的 AgileX Piper 機械臂上。由於整個模型只有約 0.2B 參數(約為 π0.5 的 6%),不需要 LLM 的龐大權重與 KV cache,整體記憶體與運算量因此大幅下降。

實驗結果

在 LIBERO 基準(涵蓋四個任務套件)上,TurboVLA 取得 97.7% 的平均成功率,同時只有 0.2B 參數、31.2 毫秒推論延遲、0.9 GB VRAM,在單張 RTX 4090 上可達到超過 32 Hz 的推論頻率。相較之下:

  • OpenVLA(7.5B 參數):成功率僅 76.5%,延遲 202.9 ms,VRAM 14.9 GB
  • π0.5(3.4B 參數):成功率 96.9%,延遲 93.6 ms,VRAM 12.8 GB
  • VLA-Adapter(1.5B 參數):成功率 97.3%,延遲 87.3 ms,VRAM 4.3 GB
  • Evo-1(0.8B 參數):成功率 94.8%,延遲 137.2 ms,VRAM 1.7 GB

也就是說,TurboVLA 用最小的模型體積和最低的延遲,達到甚至超越了體積大 5 到 37 倍的模型的準確率。

在更具挑戰性的雙臂操作基準 RoboTwin 2.0(涵蓋 50 項任務)上,TurboVLA 達到 60.2% 成功率、延遲 43.4 ms,優於 π0.5 的 57.0%(95.6 ms)以及 StarVLA-α 的 50.3%(74.9 ms)。在真實世界的 AgileX Piper 機械臂測試中,TurboVLA 在「抓取滾筒」任務達 92.5% 成功率、「移動撲克牌」80%、「按壓釘書機」90%、「疊三個碗」87.5%,證明其在物理世界也具備可用的操控精度。

消融實驗進一步驗證了設計選擇的合理性:若拿掉語言條件、只用視覺資訊,成功率會從 97.7% 暴跌至 70.8%;若只用任務 ID 嵌入而非自然語言指令,成功率為 95.4%,仍不及完整的語言指令輸入。在互動模組設計上,完全不做視覺-語言互動(僅做特徵拼接)的成功率為 95.2%,單向注意力變體為 96.1–96.5%,而雙向交叉注意力達到最佳的 97.7%。互動層數方面,N=2 時只有 93.5%,N=6 時達到峰值 97.7%,顯示適度的互動深度是必要的;動作步長方面,H=12 效果最佳,H=8 為 96.4%,H=15 則降至 95.6%。

意義

TurboVLA 的結果對整個 VLA 領域提出一個值得深思的問題:當前主流「LLM 中心」的設計,是否把本應輕量的感知-動作映射任務過度複雜化了?這篇論文用實證證據顯示,一個僅 0.2B 參數、透過輕量雙向交叉注意力直接連接視覺與語言的架構,不僅可以媲美甚至超越搭載數十億參數 LLM 的策略模型,還能把推論延遲壓低到 30 毫秒級、VRAM 需求壓到 1 GB 以下——這意味著它可以直接在消費級顯卡甚至邊緣運算設備上,以 32 Hz 以上的頻率做即時閉環控制,而不需要昂貴的雲端 GPU 或高階工作站。

對機器人產業而言,這種效率提升具有直接的部署意義:更低的延遲代表機器人能更快回應環境變化,對動態、精細的操作任務尤其重要;更低的顯存與算力需求則大幅降低了硬體門檻,讓中小型機器人公司、學術實驗室甚至個人開發者都能在普通遊戲顯卡上跑起完整的 VLA 系統,而不必依賴大型伺服器叢集。

當然,這並不代表 LLM 在機器人領域從此失去用武之地——TurboVLA 的消融實驗也顯示,自然語言指令本身仍然是成功的關鍵(拿掉語言條件成功率暴跌超過 26 個百分點),說明語言理解能力依然重要,只是不一定需要透過完整生成式 LLM 的參數規模與自回歸機制來實現。對於需要開放式常識推理、多步驟規劃或處理極長尾指令的場景,LLM 中心的架構可能仍有優勢;但對於大量偏「執行層」的具體操控任務,TurboVLA 提供了一條更精簡、更適合實際落地的替代路徑,也為未來如何連接視覺、語言與動作三者提供了新的設計思路。

CodeNib:用多視角資料系統餵給 Coding Agent 更聰明的程式庫上下文

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

SysEvol AI ResearchZhongming Yu、Hengjia Yu、Boqin Yuan、Shuting Zhao、Yizhao Chen、Aryan Dokania、Mihir Jagtap、Jiayu Chang77Hugging FacearXiv
CodeNibcoding-agentRAG程式碼檢索arXiv2607.25431

背景

近年 coding agent(像是接手寫程式、修 bug、做 code review 的 AI agent)越來越依賴對整個程式庫(repository)的理解,而不只是單一檔案。但問題是:agent 每次執行任務時,往往得重新「探索」這個程式庫——用 grep 搜尋關鍵字、用語言伺服器(language server)找函式定義、翻歷史紀錄找脈絡。這些工具彼此獨立、互不相通:全文檢索索引(lexical index)、語言伺服器(LSP)、任務暫存的歷史紀錄(task-local history)各自為政,導致同樣的探索工作一次又一次重複進行,而且沒人講得清楚「維護這些索引到底要付出多少成本」。

更麻煩的是,程式庫是會變動的——每次 commit 都可能讓程式碼結構位移、符號被刪除或新增。如果索引沒有隨著程式碼演進而正確更新,agent 拿到的上下文可能是過期、失準的資訊,反而幫倒忙。

由 Zhongming Yu、Jishen Zhao 等多位作者(UC San Diego 等機構)於 2026 年 7 月提交到 arXiv(編號 2607.25431,屬 cs.SE 類別)的論文提出了 CodeNib,試圖用「資料系統」(data system)的思路,而非單一統一抽象層的思路,來解決這個問題:把程式庫的檢索、導覽(navigation)、上下文供應三件事,用一套可重複使用、隨 commit 演進、且成本透明的多視角系統串起來。

方法

CodeNib 的核心想法是:針對每一個 repository commit,建立三種互補的「視角」(view),各自擅長回答不同類型的問題:

  1. Lexical View(詞彙視角,V_lex):針對識別字(identifier)、路徑、註解、原始文字建立 posting list 或 trigram 索引,用 BM25 做全文檢索。
  2. Dense View(稠密視角,V_dense):把檔案(L₀ 粒度)或可呼叫定義(callable definition,L₂ 粒度)轉成向量嵌入(embedding),存進 FAISS 向量索引,支援語意相似度搜尋。
  3. Structural View(結構視角,G_c):建立「類型化的包含與關係邊」(typed containment/relationship edges),把檔案、作用域(scope)、定義之間的結構關係做成圖,並可選擇保留符號出現位置(occurrence)紀錄。

這三層視角都建立在同一套「來源單元」(source unit)階層上:L₀ 是檔案、L₁ 是類似類別的作用域、L₂ 是可呼叫定義,每個單元都用「repository 相對路徑 + 原始碼範圍(source range)」作為跨視角的統一識別碼。系統還維護一份「repository manifest(M_c)」,記錄每個產出物(artifact)的類型、路徑、時間戳、狀態、設定與耗時,讓各視角的建構器(builder)可以獨立失敗而不拖垮其他視角。

在維護機制上,CodeNib 做了細緻設計:符號層級的圖修復(symbol-level graph repair)會把符號分類為刪除、受影響、位移、不變、新增五種狀態,搭配「LSP 輔助的圖修復」與「內容定址(content-addressed)向量重用」機制,避免每次改動都要整個重建。向量索引採用內容定址嵌入,依照設定的差量門檻(delta threshold)對 FAISS 做局部變更;而目前的 BM25 實作則是整個重建。

執行期方面,agent 呼叫的 load_views(M, needed) 只負責解析、驗證、載入已建好的視角產出物,不會在請求處理當下臨時建構索引。檢索計畫則被表示成一組參數 ⟨r, k, ρ, h⟩:r 代表走詞彙、語意、混合(用 RRF 融合排序)或結構化四種路徑之一;k 是候選數量與重排前的截斷點;ρ 是可選的重排模型(reranker);h 是結構化路徑的圖擴展跳數。符號導覽(symbol navigation)同時支援靜態(預先建好、持久化)與即時(JSON-RPC 連到真正的語言伺服器)兩種提供者,並追蹤兩者的相容程度。上下文供應則比較了三種策略:grep/read(純靠模型自己探索)、eager(直接注入排名前 10 的 L₂ 程式碼區塊)、compact(在 eager 基礎上加一次性歷史改寫,去除重複讀取路徑)。

實驗結果

論文用 100 個程式庫快照(來自 SWE-Bench Verified/Multilingual)繪製了整個「repository-context 生命週期」的品質—成本前緣(quality-cost frontier),涵蓋五個研究問題:

  • 檢索品質:用 Jina 嵌入模型搭配 4B 參數的重排模型、候選數 k'=50 時,檔案 Recall@10 達到 0.858,但耗時 4.29 秒;純稠密檢索(不重排)只要 92 毫秒,Recall@10 為 0.812——顯示重排是一個「可控的秒級」品質換取代價。
  • 索引建構成本:在 500 組樣本中,稠密視角建構時間中位數落在 3.8–56.7 秒(L₀ 檔案粒度)與 19.3–285.0 秒(L₂ 函式粒度)之間;採用 HNSW 索引比精確搜尋的 IndexFlatIP 快 33.9 倍(在 0.95 鄰居召回率下),但建構本身要多花 2.0 秒(vs. 6.4 毫秒)。
  • 靜態 vs. 即時導覽:在跨五種語言、共 1,000 次請求的測試中,有 632 次(63.2%)靜態導覽結果與即時語言伺服器完全吻合(定義類請求吻合率 87.4%,參考類請求僅 39.0%)。在吻合的請求中,即時/靜態延遲比的中位數為 4.72 倍——靜態提供者只要 0.62 毫秒,即時伺服器要 2.26 毫秒。
  • 增量維護效率:符號層級圖修復在 33 次程式碼變更中有 15 次(45.5%)與獨立重建結果完全一致,中位數速度提升 8.67 倍(IQR 5.95–10.99 倍);相較之下,檔案層級整批替換只有 14 次吻合,加速僅 1.95 倍。向量更新表現更佳:31 次變更中有 28 次(90.3%)吻合,中位數加速達 25.44 倍。
  • 上下文供應效果:在 Claude Haiku 4.5、Qwen3.5-9B/27B、Gemma 4-12B-IT、Gemini 2.5 Flash 五個模型、共 7,500 條軌跡(trajectory)的測試中,eager 與 compact 策略在維持定位(localization)準確度的前提下,比對照的 grep/read 策略減少 50–87% 的軌跡 token 用量。

嵌入模型方面測試了 SweRank-Small(137M)/Large(7B)、Qwen3-Embed-0.6B/4B、Jina-Code-1.5B;重排模型用 Qwen3-Reranker 系列(0.6B/4B/8B);程式碼解析則靠 Tree-sitter 做分塊,SCIP 處理成熟語言路徑(尤其 Python),clangd 處理 C/C++,並在缺乏出現位置資訊時退化為僅用圖結構、犧牲部分精確度。

意義

CodeNib 的貢獻不在於發明一個更強的檢索演算法或更大的模型,而是提出一套「工程化」的系統設計思路:與其讓 agent 每次都用 ad-hoc 的方式(grep、開新的語言伺服器連線、重新讀檔案)去理解程式庫,不如把詞彙、語意、結構三種證據來源,綁定在同一個「以 commit 為單位」的可重用資料層上,並明確標示每個操作各自的「有效期」與「相容邊界」——例如靜態導覽在多少比例的請求上可信賴地取代即時語言伺服器、增量更新在什麼條件下等同於整個重建。

這對正在快速普及的 agentic coding 工具鏈有實際意義:目前許多 coding agent 系統把檢索、導覽、上下文管理當成黑盒子疊加使用,成本(包含 token 用量、延遲、索引維護開銷)常常不透明。CodeNib 展示的數字——例如向量更新可以比整體重建快 25 倍、精選上下文策略能省下五到九成的軌跡 token——說明只要把「檢索基礎設施」當一回事來設計,agent 的效率與成本可以有數量級的改善,而不需要換更大的模型。對於正在建構自己 coding agent 或內部程式碼助理的團隊來說,這篇論文提供了一個具體、可量化的參考架構,說明如何在正確性、延遲與維護成本之間做出可解釋的取捨。

CoRT:用反事實重播做 token 級別的信用分配,讓 Rubric-RL 訓練更精準

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

ByteDanceBo-Wen Zhang、Junwei He、Wen Wang、Song-Lin Lv、Wentao Ma、Rongyi Lin、Shuhan Zhong、Lan-Zhe Guo74Hugging FacearXiv
LLM強化學習GRPORLHF指令遵循

背景

近年來,語言模型的後訓練(post-training)越來越依賴「rubric-based reinforcement learning」——也就是用一組明確的評分準則(criteria)去評估模型輸出,例如格式是否正確、是否涵蓋特定語義要點、是否遵守長度或風格限制等。這種方式讓獎勵訊號比單純的「好/壞」評分更具可解釋性,也更容易針對特定能力做微調。

然而,在目前主流的 GRPO(Group Relative Policy Optimization)訓練管線中,這些精心設計的、按準則拆解的評分,最終都會被壓縮成一個「回應層級」(response-level)的純量獎勵,再換算成一個單一的 advantage 值,然後均勻廣播到該回應裡的每一個 token 上。換句話說,不管某個 token 是不是真正決定了模型是否符合某條 rubric,它拿到的訓練信號都一樣。這造成一個明顯的落差:rubric 明明是針對不同的文字片段(span)、格式決策或語義選擇分別評分的,但訓練時卻沒有任何機制把信用(credit)分配回這些具體位置。

過去解決類似問題的做法,通常是額外訓練一個「token 評分模型」(token scoring model 或稱 relevance model),用來預測哪些 token 比較重要,再用這個學出來的權重去加權 advantage。但這種做法需要額外的訓練階段、額外的模型與額外的資料標註,增加了整套系統的複雜度與不穩定性風險。CoRT(Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization,arXiv:2607.25659)就是要在不引入這類輔助評分器的前提下,解決 token 級別信用分配的問題。

方法

CoRT 的核心想法非常直接:同一個已經取樣出來的回應,用兩種不同的 prompt 重新算一次每個 token 的 log-likelihood——一次是原本帶有 rubric 條件的 prompt(記作 ℓ⁺),另一次是內容配對但拿掉評分準則的「無準則版本」(criteria-free prompt,記作 ℓ⁻)。兩者的差值 Δ = ℓ⁺ − ℓ⁻,就是這個 token 對 rubric 語境依賴程度的一個代理指標(proxy):如果拿掉 rubric 之後,某個 token 出現的機率明顯下降,代表這個 token 很可能是為了滿足某條準則而生成的,理應獲得更多的信用分配;反之若差值接近零,代表這個 token 跟 rubric 無關(例如連接詞、通用句式)。

技術上,CoRT 分成三個關鍵設計:

  1. Replay-margin 評分:把無界的 Δ 值透過 sigmoid 轉換,映射成有界的分數,避免極端值造成訓練不穩。
  2. 回應層級正規化(response normalization):讓每個回應內所有 token 的權重平均值固定為 1,這樣才能保留原本 GRPO 的 response-level advantage 大小,只改變「怎麼分配」,不改變「總量」。
  3. SmoothStep 排程:訓練一開始不會馬上套用完整的權重,而是從第 0 步逐漸斜坡上升到全強度,避免訓練初期就因為權重劇烈波動而失控。

最後,這些由重播(replay)得到的權重會直接乘上原本 GRPO 算出的帶符號 advantage,重新分配到各個 token,並且權重本身不會傳遞梯度(gradient-stopped)——也就是說,這一整套機制只是在做「信用重分配」,不會反過來干擾策略更新的方向。整個方法只需要對同一個回應多做一次「無準則版本」的前向傳播(forward pass)計算 log-likelihood,不需要額外訓練任何評分模型,也完全不改變原本的 response-level 獎勵計算方式。

實驗結果

研究團隊在多個指令微調(instruction-tuned)模型上做了驗證,包括 Qwen3-4B、Qwen2.5-7B,以及規模更大的 Qwen3-14B。評測的 benchmark 涵蓋 IFBench、IFEval、MultiDimIF、AdvancedIF 等指令遵循類測試集,並在兩種獎勵粒度下測試:**Constraint Satisfaction Rate(CSR,部分滿足即給分)**與 All-or-Nothing(AON,全部準則滿足才給分),同時涵蓋固定 500 步(fixed-step)與最佳窗口(best-within-window)兩種評估協定。

核心結果是:CoRT 在絕大多數比較情境下,都優於同設定的 response-level GRPO baseline,平均提升達 4.4 個百分點。在跟需要額外訓練「relevance 模型」的學習式 token 級信用分配基線(RTT)相比,CoRT 表現持平甚至更好,卻不需要那個額外的訓練階段。此外,CoRT 也能與 DAPO、GSPO 等不同的策略優化目標相容整合;在 Qwen3-14B 上,搭配 CSR 獎勵時同樣觀察到穩定的提升。

消融實驗(ablation)也驗證了兩個設計細節的必要性:如果拿掉「回應層級正規化」,token 權重會逐漸往上漂移,導致梯度不穩定、輸出長度被截斷的比例升高;如果拿掉 SmoothStep 斜坡而直接套用完整權重,訓練後期會出現熵(entropy)暴衝的現象。只有同時保留這兩個機制,才能讓梯度範數(gradient norm)與 token 權重係數維持穩定。另外,按準則逐一移除的實驗顯示,針對局部性準則(例如特定格式要求)的效果會比較集中在對應片段,而針對全域性準則(例如整體語氣要求)的影響則比較分散,這也印證了 Δ 值確實抓到了 rubric 與具體 token 之間的對應關係。

論文也坦承方法的侷限:當某條準則對 token likelihood 幾乎沒有影響、或該準則的內容跟原本 prompt 高度重疊、或獎勵訊號本身很嘈雜時,反事實對比的訊號會變弱,此時 token 級別的信用分配效果也會打折扣。

意義

CoRT 提供了一個相當「輕量」但概念清晰的解法,去補上 GRPO 系列演算法在信用分配上的結構性缺口。它的價值在於:不需要額外收集資料訓練 token 評分模型,也不需要修改獎勵函數本身,只靠「同一個模型對同一段輸出、換一個 prompt 重新算一次機率」這個幾乎零成本的操作,就能把粗粒度的 rubric 判斷還原成 token 級別的訓練信號。這種「policy-internal」的反事實對比訊號,本質上是利用模型自己對語境敏感度的差異,作為一種免費的可解釋性探針(interpretability probe),這對於想在 RLHF/rubric-RL 訓練管線中提升樣本效率與穩定性的團隊來說,是一個成本很低、卻能帶來實質效能提升(4.4 個百分點)的改進方向。

更廣泛地看,這篇論文也呼應了近期 RL 微調研究的一個趨勢:與其疊加更多、更複雜的輔助模型,不如更聰明地利用策略模型本身已有的訊號(例如 log-likelihood、attention pattern 等)去做細粒度的訓練引導。這種思路如果能延伸到其他場景——例如程式碼生成中對特定行的信用分配、或多輪對話中對特定回合的信用分配——可能會成為未來 rubric-guided 或 criteria-based RL 訓練的標準組件之一,同時保留了 GRPO 本身簡單、穩定、不需要額外 critic 模型的優點。