語言模型靠資料與參數騎上 scaling law;機器人策略模型長期卡在「高品質真實操作資料太貴」。小米技術官方宣布開源自研具身基座模型 Xiaomi-Robotics-1(簡稱 XR-1):不只丟權重,而是把真機後訓練→部署→benchmark 評測整條管線放到 GitHub/Hugging Face/專案頁,授權口徑為 Apache 2.0。TechNode、OSCHINA、News9 與小米機器人站同步披露細節;論文掛 arXiv:2607.15330。
這不是又一篇「我們也做了機器人大腦」的口號稿——公開數字把賭注押在無本體(embodiment-free)大規模預訓練能不能補上機器人資料缺口。
資料與兩階段:先讀世界,再對齊手臂
專案頁把配方寫成跟 LLM 類似的兩段:
預訓練(廣度)
- 超過 100,000 小時 UMI(Universal Manipulation Interface)真實世界操作軌跡
- 覆蓋 1,700+ 場景:家庭、商業空間、工業場域、戶外
- 手動標註不可行,因此用強 VLM 自動標註:長影片切固定長度片段,描述夾爪與物體的場景狀態轉移,當作動作生成的語言條件
- 公開發現:預訓練呈現乾淨 scaling——資料與模型變大,驗證動作誤差穩定下降
後訓練(對齊)
- 跨本體資料:自有真機、過濾後開源機器人資料、高品質 UMI
- 自有真機部分:真實住家收集逾 7,200 小時(沙發整理、鞋櫃分類、廚房收納等)
- 兩軸對齊:把「依狀態轉移描述生成動作」轉成「聽自然語言指令直接執行」;並把通用動作能力映射到真實機器人本體
開源通稿另常寫「跨本體後訓練逾 10,000 小時」——與專案頁 7,200 小時自有真機並非同一口徑(後者是 in-house 子集),引用時應分開標註。
後訓練完成後,XR-1 宣稱可在未見過環境、未見過物體實例上開箱做移動操作;且預訓練越強,後訓練後真機成功率越高,scaling「尚未看到飽和跡象」。
分數表:模擬器四冠,少樣本適應幾乎翻倍 π0.5
模擬基準(專案頁;成功率越高越好):
| Benchmark | XR-1 | 第二名 | 相對增益 |
|---|---|---|---|
| RoboCasa | 74.5% | 72.6% | +2.6% |
| RoboCasa365 | 57.4% | 46.6% | +23.2% |
| VLABench | 59.1% | 53.2% | +11.1% |
| RoboDojo | 13.93% | 8.80% | +58.3% |
截至 2026-07-15,官網宣稱 RoboCasa365、RoboDojo 榜首。論文摘要另寫 RoboCasa365 57.6%、RoboDojo 均分 20.07 等數字——與表格列法/版本可能不同,部署前應以你複現的 checkpoint 與官方 eval 腳本為準。
更貼近產品的是「幾小時示範學新任務」:
| 任務 | XR-1<10h | π0.5<10h | XR-1<40h | π0.5<40h |
|---|---|---|---|---|
| 手機裝箱 | 70% | 30% | 80% | 40% |
| 印表機補耗材 | 70% | 20% | 60% | 20% |
| 洗衣投放 | 80% | 40% | 100% | 50% |
| 紙箱打包 | 80% | 70% | 100% | 100% |
| Overall | 75% | 40% | 85% | 53% |
平均每任務少於 10 小時示範,整體成功率約 75%,對照 π0.5 約 40%;拉到 40 小時量級則約 85% vs 53%。這才是開源對實驗室與新創最硬的賣點:資料效率,不是又一個只在模擬器好看的權重檔。
架構側,中文技術通稿提到約 5B 級 VLA、視覺側整合 SigLIP2-400M 與 Gemma3-12B 相關方案、動作頭為 diffusion-based;完整組件在 Hugging Face collection(含預訓練/後訓練/視覺編碼器等倉庫)。請以倉庫 README 與授權檔為準,不要只抄二手規格。
和同週具身新聞怎麼擺
Google 剛推過 Gemini Robotics ER 2——偏「高層大腦+進度追蹤/多機協作」的雲端智能層。XR-1 押的是另一條路:先用大量無本體真實軌跡打底,再用相對少的真機資料對齊,並把整條後訓練管線開源。一個賣平台與任務編排,一個賣可下載的操作策略基座;採購時不要混成同一張比較表。
對開源生態,Apache 2.0+消費級 GPU 優化敘事(英文媒體口徑)降低「只有大廠機房養得起」的門檻;但真機安全、感測器配置、不同手臂動力學,仍要靠各自場地驗證——開源解的是起跑線,不是責任歸屬。
開發者現在能做什麼、還要驗證什麼
可立刻做的:拉 Hugging Face/GitHub 權重與 eval_* 說明,先在四個模擬基準上對表;再用自家<10 小時示範測「新任務適應」是否接近官網 75% 量級。不要只看 RoboDojo 相對 +58% 的行銷句——絕對成功率仍只有約 14%,任務難度與指標定義要先讀懂。
若你做的是倉儲、零售或居家場景 demo,優先複現「未見環境/未見物體」設定,而不是只在訓練場景錄影。UMI 預訓練的價值主張是泛化;驗證方式也必須是泛化。硬體側要分開記帳:消費級 GPU 能跑推論,不代表夾爪力控、深度相機外參與安全互鎖已經就緒——開源解的是策略層,產線仍要補控制與功能安全。
還要盯三件事:自動標註 VLM 引入的語言雜訊會不會在真機放大;跨本體後訓練對「你家那隻臂」要補多少小時;以及小米是否持續更新榜首 checkpoint,還是開源停在 PR 峰值。機器人缺的從來不是另一個 多模態 口號——缺的是可擴展的真實軌跡。XR-1 把 10 萬小時 UMI 攤到桌上;接下來輪到社群證明,這條 scaling 曲線在別人的倉庫裡也能畫得一樣陡。
