返回資訊
AI趨勢入門

小米開源 Xiaomi-Robotics-1:10 萬小時 UMI 預訓練 VLA,RoboDojo 相對第二名高出 58%

2026年8月7日
易賺Ai團隊
7 分鐘閱讀
#機器人#開源#具身智能#VLA#小米#Xiaomi-Robotics-1#XR-1
小米開源 Xiaomi-Robotics-1:10 萬小時 UMI 預訓練 VLA,RoboDojo 相對第二名高出 58%

語言模型靠資料與參數騎上 scaling law;機器人策略模型長期卡在「高品質真實操作資料太貴」。小米技術官方宣布開源自研具身基座模型 Xiaomi-Robotics-1(簡稱 XR-1):不只丟權重,而是把真機後訓練→部署→benchmark 評測整條管線放到 GitHub/Hugging Face/專案頁,授權口徑為 Apache 2.0。TechNode、OSCHINA、News9 與小米機器人站同步披露細節;論文掛 arXiv:2607.15330。

這不是又一篇「我們也做了機器人大腦」的口號稿——公開數字把賭注押在無本體(embodiment-free)大規模預訓練能不能補上機器人資料缺口。

資料與兩階段:先讀世界,再對齊手臂

專案頁把配方寫成跟 LLM 類似的兩段:

預訓練(廣度)

  • 超過 100,000 小時 UMI(Universal Manipulation Interface)真實世界操作軌跡
  • 覆蓋 1,700+ 場景:家庭、商業空間、工業場域、戶外
  • 手動標註不可行,因此用強 VLM 自動標註:長影片切固定長度片段,描述夾爪與物體的場景狀態轉移,當作動作生成的語言條件
  • 公開發現:預訓練呈現乾淨 scaling——資料與模型變大,驗證動作誤差穩定下降

後訓練(對齊)

  • 跨本體資料:自有真機、過濾後開源機器人資料、高品質 UMI
  • 自有真機部分:真實住家收集逾 7,200 小時(沙發整理、鞋櫃分類、廚房收納等)
  • 兩軸對齊:把「依狀態轉移描述生成動作」轉成「聽自然語言指令直接執行」;並把通用動作能力映射到真實機器人本體

開源通稿另常寫「跨本體後訓練逾 10,000 小時」——與專案頁 7,200 小時自有真機並非同一口徑(後者是 in-house 子集),引用時應分開標註。

後訓練完成後,XR-1 宣稱可在未見過環境、未見過物體實例上開箱做移動操作;且預訓練越強,後訓練後真機成功率越高,scaling「尚未看到飽和跡象」。

分數表:模擬器四冠,少樣本適應幾乎翻倍 π0.5

模擬基準(專案頁;成功率越高越好):

BenchmarkXR-1第二名相對增益
RoboCasa74.5%72.6%+2.6%
RoboCasa36557.4%46.6%+23.2%
VLABench59.1%53.2%+11.1%
RoboDojo13.93%8.80%+58.3%

截至 2026-07-15,官網宣稱 RoboCasa365、RoboDojo 榜首。論文摘要另寫 RoboCasa365 57.6%、RoboDojo 均分 20.07 等數字——與表格列法/版本可能不同,部署前應以你複現的 checkpoint 與官方 eval 腳本為準。

更貼近產品的是「幾小時示範學新任務」:

任務XR-1<10hπ0.5<10hXR-1<40hπ0.5<40h
手機裝箱70%30%80%40%
印表機補耗材70%20%60%20%
洗衣投放80%40%100%50%
紙箱打包80%70%100%100%
Overall75%40%85%53%

平均每任務少於 10 小時示範,整體成功率約 75%,對照 π0.5 約 40%;拉到 40 小時量級則約 85% vs 53%。這才是開源對實驗室與新創最硬的賣點:資料效率,不是又一個只在模擬器好看的權重檔。

架構側,中文技術通稿提到約 5B 級 VLA、視覺側整合 SigLIP2-400M 與 Gemma3-12B 相關方案、動作頭為 diffusion-based;完整組件在 Hugging Face collection(含預訓練/後訓練/視覺編碼器等倉庫)。請以倉庫 README 與授權檔為準,不要只抄二手規格。

和同週具身新聞怎麼擺

Google 剛推過 Gemini Robotics ER 2——偏「高層大腦+進度追蹤/多機協作」的雲端智能層。XR-1 押的是另一條路:先用大量無本體真實軌跡打底,再用相對少的真機資料對齊,並把整條後訓練管線開源。一個賣平台與任務編排,一個賣可下載的操作策略基座;採購時不要混成同一張比較表。

對開源生態,Apache 2.0+消費級 GPU 優化敘事(英文媒體口徑)降低「只有大廠機房養得起」的門檻;但真機安全、感測器配置、不同手臂動力學,仍要靠各自場地驗證——開源解的是起跑線,不是責任歸屬。

開發者現在能做什麼、還要驗證什麼

可立刻做的:拉 Hugging Face/GitHub 權重與 eval_* 說明,先在四個模擬基準上對表;再用自家<10 小時示範測「新任務適應」是否接近官網 75% 量級。不要只看 RoboDojo 相對 +58% 的行銷句——絕對成功率仍只有約 14%,任務難度與指標定義要先讀懂。

若你做的是倉儲、零售或居家場景 demo,優先複現「未見環境/未見物體」設定,而不是只在訓練場景錄影。UMI 預訓練的價值主張是泛化;驗證方式也必須是泛化。硬體側要分開記帳:消費級 GPU 能跑推論,不代表夾爪力控、深度相機外參與安全互鎖已經就緒——開源解的是策略層,產線仍要補控制與功能安全。

還要盯三件事:自動標註 VLM 引入的語言雜訊會不會在真機放大;跨本體後訓練對「你家那隻臂」要補多少小時;以及小米是否持續更新榜首 checkpoint,還是開源停在 PR 峰值。機器人缺的從來不是另一個 多模態 口號——缺的是可擴展的真實軌跡。XR-1 把 10 萬小時 UMI 攤到桌上;接下來輪到社群證明,這條 scaling 曲線在別人的倉庫裡也能畫得一樣陡。