資料沒整理好 AI 只是更快出錯
在 HN 上看到 Hebbian Robotics 做的 HFlow,我第一個反應不是「機器人好酷」,而是「這東西其實每個小團隊都會遇到」。
它表面上是 robotics data pipeline 的 SDK,把機器人跟人類操作員的錄影、關節狀態、動作、時間戳等資料整理成標準格式,再做 quality check 和 dataset manifest。但我覺得真正有意思的是,它處理的不是模型,而是模型訓練前那一堆很容易被低估的爛帳。
資料一多,最麻煩的不是硬碟不夠,而是你不知道哪批資料到底跑過什麼程式、為什麼某些 episode 被排除、現在這份 dataset 下個月還能不能重現。HFlow 用 MCAP 留同步資料,用 Airflow 跑流程,用 Parquet catalog 記 measurements、metadata 和 provenance,再用 DuckDB 查出 manifest。翻成老闆語就是:每一筆資料為什麼能用、為什麼不能用,要留下證據。
這點很重要。很多人談 AI 導入都直接跳到「我要不要換更強模型」,但實際上,垃圾資料餵給再強的模型也只是比較貴的垃圾。像黑畫面、影片凍結、timestamp drift、joint movement 不合理,這些如果沒有被攔下來,後面訓練結果怪怪的時候,大家只會開始通靈。
我也喜歡它不直接刪資料,而是 quarantine。資料好壞常常不是絕對的,要看任務。某段平滑軌跡在一個場景可能代表成功示範,在另一個場景可能代表機器人卡住。把 evidence 和 policy 分開,未來要重跑、改規則、追問題才有路可走。
如果拉回一般公司,道理一樣。不要只問 AI 能不能幫你自動化,先問你的流程有沒有留下足夠的紀錄,讓人和 AI 都知道每一步為什麼發生。沒有這層底帳,自動化只是把混亂跑得更快。
作者:偉老闆