TurboVLA:繞過大型語言模型,單張RTX 4090上以32Hz即時運行的視覺-語言-動作模型
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
背景
近年來機器人操控領域最熱門的做法,是把「視覺-語言-動作」(Vision-Language-Action, VLA)模型建立在大型語言模型(LLM)之上。這類系統通常遵循一條 V→L→A 的路徑:先用視覺編碼器把攝影機畫面轉成特徵,再把這些特徵「投影」進 LLM 的表示空間,讓 LLM 同時處理視覺 token 與語言指令 token,最後再從 LLM 輸出的隱藏狀態解碼出機器人動作。像 OpenVLA、π0 系列這類模型正是採用這種設計,理論上能借助 LLM 強大的世界知識與推理能力提升泛化性。
但這個設計有一個現實問題:每次策略呼叫(也就是機器人每做一個決策)都必須跑一次完整的 LLM 前向傳播,計算量與記憶體開銷都非常龐大。以 OpenVLA 為例,參數量高達 7.5B,單次推論延遲達 202.9 毫秒、需要 14.9 GB VRAM;即使是相對輕量的 π0.5(3.4B 參數),延遲也要 93.6 毫秒、佔用 12.8 GB VRAM。對於需要高頻率閉環控制的真實機器人任務(例如抓取、疊放、精細操作),這種延遲意味著策略更新頻率被壓低到個位數 Hz,遠不及真實控制迴路所需的反應速度,也讓這些模型難以部署在消費級硬體或邊緣裝置上。
由華中科技大學等團隊組成的研究團隊(Hengyi Xie、Dingkang Liang、Xiang Bai 等人)因此提出一個問題:VLA 模型真的需要一個完整的大型語言模型當作視覺與動作之間的「中介」嗎?他們認為,LLM 在此處理的其實是低層次的執行任務,未必需要語言模型的生成式推理能力,於是提出了 TurboVLA,將傳統的 V→L→A 路徑重新設計為更直接的 V+L→A 映射。
方法
TurboVLA 的核心思路是拿掉 LLM 這個龐大的中介,改用輕量模組直接讓視覺與語言資訊互相融合,再交給一個緊湊的解碼器產生動作。具體架構包含四個部分:
- 視覺編碼器:採用 DINOv3,在 LIBERO 基準上使用 ViT-B、在難度更高的 RoboTwin 2.0 雙臂任務上使用 ViT-L,獨立提取畫面特徵。
- 文字編碼器:使用 BERT 對語言指令做輕量編碼(消融實驗顯示換成 T5-small 或 SigLIP 也可行,說明架構對文字骨幹並不敏感)。
- 雙向視覺-語言互動模組:這是整篇論文的關鍵創新——用 6 層雙向交叉注意力(cross-attention),讓視覺特徵與語言特徵在共享的 256 維隱藏空間中互相「查詢」對方,產生「場景感知的指令特徵」與「指令條件化的視覺特徵」。這一步取代了 LLM 原本用自回歸方式融合多模態資訊的角色。
- 動作解碼器:採用類似 ACT(Action Chunking Transformer)的結構,一次性並行輸出一段連續的動作序列(action chunk),而非逐步自回歸生成,LIBERO 上每次輸出 12 步動作、RoboTwin 2.0 上輸出 50 步。
訓練上,TurboVLA 使用 L1 損失做行為克隆(behavior cloning),學習率 5×10⁻⁵,在四張 RTX 4090 上訓練,LIBERO 任務訓練 80,000 步(含 10,000 步暖身)。在真實世界任務的微調中,僅用 260 條teleoperation示範資料、微調 12,500 步,就能讓模型部署到實體的 AgileX Piper 機械臂上。由於整個模型只有約 0.2B 參數(約為 π0.5 的 6%),不需要 LLM 的龐大權重與 KV cache,整體記憶體與運算量因此大幅下降。
實驗結果
在 LIBERO 基準(涵蓋四個任務套件)上,TurboVLA 取得 97.7% 的平均成功率,同時只有 0.2B 參數、31.2 毫秒推論延遲、0.9 GB VRAM,在單張 RTX 4090 上可達到超過 32 Hz 的推論頻率。相較之下:
- OpenVLA(7.5B 參數):成功率僅 76.5%,延遲 202.9 ms,VRAM 14.9 GB
- π0.5(3.4B 參數):成功率 96.9%,延遲 93.6 ms,VRAM 12.8 GB
- VLA-Adapter(1.5B 參數):成功率 97.3%,延遲 87.3 ms,VRAM 4.3 GB
- Evo-1(0.8B 參數):成功率 94.8%,延遲 137.2 ms,VRAM 1.7 GB
也就是說,TurboVLA 用最小的模型體積和最低的延遲,達到甚至超越了體積大 5 到 37 倍的模型的準確率。
在更具挑戰性的雙臂操作基準 RoboTwin 2.0(涵蓋 50 項任務)上,TurboVLA 達到 60.2% 成功率、延遲 43.4 ms,優於 π0.5 的 57.0%(95.6 ms)以及 StarVLA-α 的 50.3%(74.9 ms)。在真實世界的 AgileX Piper 機械臂測試中,TurboVLA 在「抓取滾筒」任務達 92.5% 成功率、「移動撲克牌」80%、「按壓釘書機」90%、「疊三個碗」87.5%,證明其在物理世界也具備可用的操控精度。
消融實驗進一步驗證了設計選擇的合理性:若拿掉語言條件、只用視覺資訊,成功率會從 97.7% 暴跌至 70.8%;若只用任務 ID 嵌入而非自然語言指令,成功率為 95.4%,仍不及完整的語言指令輸入。在互動模組設計上,完全不做視覺-語言互動(僅做特徵拼接)的成功率為 95.2%,單向注意力變體為 96.1–96.5%,而雙向交叉注意力達到最佳的 97.7%。互動層數方面,N=2 時只有 93.5%,N=6 時達到峰值 97.7%,顯示適度的互動深度是必要的;動作步長方面,H=12 效果最佳,H=8 為 96.4%,H=15 則降至 95.6%。
意義
TurboVLA 的結果對整個 VLA 領域提出一個值得深思的問題:當前主流「LLM 中心」的設計,是否把本應輕量的感知-動作映射任務過度複雜化了?這篇論文用實證證據顯示,一個僅 0.2B 參數、透過輕量雙向交叉注意力直接連接視覺與語言的架構,不僅可以媲美甚至超越搭載數十億參數 LLM 的策略模型,還能把推論延遲壓低到 30 毫秒級、VRAM 需求壓到 1 GB 以下——這意味著它可以直接在消費級顯卡甚至邊緣運算設備上,以 32 Hz 以上的頻率做即時閉環控制,而不需要昂貴的雲端 GPU 或高階工作站。
對機器人產業而言,這種效率提升具有直接的部署意義:更低的延遲代表機器人能更快回應環境變化,對動態、精細的操作任務尤其重要;更低的顯存與算力需求則大幅降低了硬體門檻,讓中小型機器人公司、學術實驗室甚至個人開發者都能在普通遊戲顯卡上跑起完整的 VLA 系統,而不必依賴大型伺服器叢集。
當然,這並不代表 LLM 在機器人領域從此失去用武之地——TurboVLA 的消融實驗也顯示,自然語言指令本身仍然是成功的關鍵(拿掉語言條件成功率暴跌超過 26 個百分點),說明語言理解能力依然重要,只是不一定需要透過完整生成式 LLM 的參數規模與自回歸機制來實現。對於需要開放式常識推理、多步驟規劃或處理極長尾指令的場景,LLM 中心的架構可能仍有優勢;但對於大量偏「執行層」的具體操控任務,TurboVLA 提供了一條更精簡、更適合實際落地的替代路徑,也為未來如何連接視覺、語言與動作三者提供了新的設計思路。