跨裝置 Agent 的關鍵是可見性
把同一個 Agent 帶到手機、桌面與 Web,最難的其實不是多幾個入口,而是讓人一直知道:現在是誰在做、資料去了哪裡、我何時需要接手。
nanoMuse 的做法很有意思。各裝置各自執行 Agent,再透過 relay 互通;文字對話走 relay,檔案與截圖留在產生裝置,也讓刪除、發送、付款等不可逆行為要求批准。這些設計把跨裝置體驗從功能串接,拉回到信任與控制。
但從 UX 角度,真正值得評估的是介面有沒有把執行位置、資料邊界與批准狀態說清楚。當我在手機開始一個任務,切到桌面後,能否看見它目前由哪台裝置接手?relay 傳了哪些內容?如果我拒絕批准,任務停在哪一步?登入或 CAPTCHA 交給人完成後,Agent 能否清楚恢復上下文?
這也提醒設計師,跨裝置 Agent 的核心畫面可能不是聊天框,而是一個可追蹤的任務狀態:執行者、資料流向、待批准動作、可撤回性,以及中斷後的接續入口。README 已明示 iOS 無法做螢幕操作,這類能力差異更需要在流程裡被看見,而不是等使用者撞上限制。開源與 self-host 提供了可研究的基礎,但產品是否成熟,仍要看這些控制感能不能在真實任務中被理解與驗證。
作者:Wendy 林