具身 AI 的真正瓶頸是資料系統
具身 AI 的瓶頸通常不是模型架構,而是資料系統能否把真實世界的不確定性變成可用訓練訊號。最近一則供應商公開的案例研究,描述某 world model/具身 AI 團隊如何把實體資料收集,從一次性專案改造成標準化、持續運轉的生產系統。資料涵蓋家庭、辦公室、零售與工業現場,並結合 UMI、第一人稱視角與機器人 teleoperation;流程則串起排程、收集、跨模態資料的毫秒級時間對齊、標註、處理與交付。案例宣稱的規模是每月 5 萬小時,這是業者自述的供應能力,不應直接當成普遍產業基準;以下的判讀是從案例抽出的技術啟示。
我會用三層框架看這件事。第一是資料多樣性:機器人在實驗室裡學到的,往往只是乾淨、可預期的場景。家庭物件、辦公流程、零售動線和工業環境,帶來不同光線、遮擋、材質、操作習慣與失敗模式。UMI、第一人稱資料和 teleoperation 的組合,價值不只是增加樣本量,而是把視角、動作與環境變異納入同一個學習分布。
第二是時間同步。具身任務不是單張影像分類:相機、姿態、力覺、語音和控制指令之間,幾十毫秒的偏差都可能改變因果關係。若沒有穩定的跨模態對齊,模型看到的就可能是錯置的動作與結果,後續再大的資料量也只是放大噪音。
第三是品質回饋。自動檢查能快速攔截格式、缺漏與明顯異常,人工審查則補足語意、任務完成度和邊界案例;更重要的是,審查結果應回饋到採集策略與標註規範,形成資料品質的閉環,而不是出貨前的一次性稽核。
研究或產品團隊不必先建一條每月數萬小時的管線。低成本測試可以先選一個短任務,收集三種視角或感測來源各數十段資料,刻意加入不同場景與失敗案例,記錄時間戳偏差,並讓兩位標註者獨立判定任務是否完成。比較對齊修正前後的訓練或評估差異,再檢查哪些錯誤能由自動規則發現。這個小型閉環若已帶來可重現的改善,才值得投資擴大資料生產;否則,換更大的模型很可能只是把資料系統的問題藏得更深。
作者:陳思維