HiFi-UMI:靠手持攝影機資料就能練出可部署機器人操作策略
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
背景
訓練能實際部署的機器人操作(manipulation)策略,長期卡在一個資料兩難:透過真實機器人遙操作(teleoperation)蒐集的示範資料精準、貼近部署場景,但成本極高、難以規模化;而「UMI」(Universal Manipulation Interface,免機器人的手持式資料蒐集裝置)蒐集起來快又便宜,卻因為姿態估計誤差、雙手相對位置不準、多感測器不同步、視野狹窄等問題,精細度不足以直接拿來訓練最終部署的策略。業界目前的折衷做法,是把 UMI 資料拿來做預訓練(pre-training),但在後訓練(post-training)階段仍然要摻入一小部分真機遙操作資料當作「錨點(anchor)」,以修正 UMI 資料的失真。
來自 Simple AI 團隊的這篇論文(arXiv:2607.25895,cs.RO/cs.CV/cs.LG,2026年7月28日提交,33頁、15圖、4表)提出一個反向假設:與其想辦法縮小真機資料的占比,不如直接把 UMI 資料本身的「保真度(fidelity)」拉高,是否就能徹底拿掉真機錨點?他們設計了一套名為 HiFi-UMI 的可攜式資料蒐集系統來驗證這個問題,並同步釋出了名為 HiFi-UMI-2K 的大型公開資料集。
方法
HiFi-UMI 的核心思路是「在資料源頭就把保真度做足,而非事後修補」,具體從四個環節同時下手:
- 姿態精度:採用頭戴式的離線雙目慣性 SLAM(stereo-inertial SLAM),搭配手部標記方塊做定位,達成 3 毫米的工作空間局部末端執行器(end-effector)精度,且完全不需要外部動作捕捉基礎設施。
- 雙手相對位姿:直接量測「原生(native)」的雙手相對姿態,而非靠事後重建推算,避免傳統做法中誤差被放大的問題。
- 同步機制:所有感測器共用一個微秒級 GPIO 硬體觸發訊號,跨感測器同步誤差控制在 40 微秒以內,每 27 萬幀才掉一幀。
- 視野覆蓋:每隻手加裝兩顆超廣角魚眼相機,加上頭部立體相機對,總覆蓋角度約 200 度,大幅降低操作過程中的視野遮蔽。
蒐集流程是一套六階段的資料「飛輪」:蒐集與雲端上傳(含即時品質警示,偵測曝光不足、動態模糊、手部離開視野等)→ 離線軌跡重建(局部一致性 SLAM,重建成功率 98%)→ 模擬回放驗證(將軌跡在模擬器中做全身運動驗證,通過率同樣約 98%,兩階段相乘後有效資料良率約 96%)→ AI 輔助標註(多視角語言與時序標註)→ 人工抽樣覆核 → 統計分析與平衡取樣匯出。最終累積語料達到超過 2 萬小時、432 萬段以上的操作片段,橫跨 480 多個場景。
為了驗證「零機器人後訓練(zero-robot post-training)」是否可行,研究團隊挑了三個橫跨 VLA(vision-language-action)與 WAM(world-action-model)兩大家族的骨幹模型:StarVLA-QwenPI(Qwen3-VL-4B 視覺語言編碼器 + flow-matching DiT 動作頭)、OpenPI-π₀.₅(PaliGemma 視覺語言流 + Gemma 連續動作專家)、以及 LingBot-VA(先預測未來影片潛在表示,再透過逆動力學解碼出動作的世界動作模型)。三種模型分別只用 HiFi-UMI 資料做後訓練,再直接部署到真實機器人上,與同樣後訓練但改用真機遙操作資料的基線做對比。
實驗結果
評測涵蓋擦拭汙漬、疊衣服(雙手可變形物體操作)、遠端插入(精密定位任務)、蔬果分類(語意條件操作)四類任務,每個任務—策略組合跑 40 次,並由兩位獨立評審打分。結果顯示,純 UMI 後訓練的策略成功率與真機遙操作基線幾乎打平:StarVLA-QwenPI 為 -2.5 個百分點(51.3% vs. 53.8%)、OpenPI-π₀.₅ 為 +3.1 個百分點(77.5% vs. 74.4%)、LingBot-VA 為 -0.6 個百分點(56.9% vs. 57.5%),差距落在抽樣誤差範圍內,且正負號都有出現,說明沒有系統性劣勢。最強的策略在精密插入任務上達到 85% 成功率——值得注意的是,遙操作基線資料就是在評測場景中蒐集的,而 HiFi-UMI 資料完全沒有來自該場景的軌跡,對照之下更凸顯 UMI 資料的泛化能力。
資料規模的消融實驗也很直觀:針對遠端插入任務,OpenPI-π₀.₅ 的成功率隨示範數增加從 400 筆的 37.5%、800 筆的 65.0%,一路提升到 3,200 筆的 85.0%,並在此附近趨於飽和。此外,用同一語料中的 4,000 小時資料做預訓練,能讓十個未見過任務的動作誤差降低 41%,並讓 StarVLA-QwenPI 的真機成功率再進一步提升 18.1 個百分點。作者也坦言這並非「樣本數對齊」的公平比較(UMI 用了 3,200 條軌跡,遙操作只用 300 條),因此結果更適合理解為「實務流程」層面的比較,而非嚴格的樣本效率結論。
意義
這項工作如果成立,意味著長期困擾機器人學習領域的「真機資料瓶頸」有機會被繞過:只要把免機器人的資料蒐集裝置做到足夠精準(3 毫米級)、同步(微秒級)、視野夠廣(200 度),後訓練階段就不再需要昂貴的真機遙操作錨點,大幅降低取得可部署策略的門檻與成本。這對於想要擴展任務種類、場景數量的團隊尤其有意義——資料蒐集可以交給不需要機器人硬體的操作員,規模化速度遠高於遙操作。同時,研究團隊開源了 HiFi-UMI-2K(2,000 小時、微秒同步、超廣視野,採 CC-BY-4.0 授權並對人臉做遮罩處理),為社群提供了一個大規模且高保真的公開資源,有助於後續研究直接驗證或延伸「資料源頭保真度優先於資料量」的設計哲學,也為 VLA 與世界動作模型兩條技術路線提供了可共用的訓練資料基礎。