實體 AI 也需要設計注意力
做 UI 設計時,我很常把注意力想成一種有限的版面資源。畫面不可能把所有資訊都放到同一個層級,使用者也不會在每一秒平均掃描每個角落。我們會用尺寸、對比、位置、動線和狀態,幫人決定現在該先看什麼。
把這件事放進實體 AI,問題就更具體了。機器人的視覺不是一扇永遠清晰、什麼都能同時理解的窗。當它要抓取物件、避開遮擋、判斷下一個動作時,真正重要的不是「看得更多」,而是「主動決定此刻看哪裡」。一套設計如果只把鏡頭固定在手腕,等於假設所有任務都能用同一個視角解決,卻忽略了視線本身也是互動的一部分。
這個方向讓我特別有感:單一立體相機可以透過可轉動的雙眼觀點,把視線對準三維空間裡的固定點,並把更多視覺運算資源留給畫面中心。系統還把能力拆成兩層,一層負責細緻地把視線移到位,另一層依照任務進度選擇下一個該看的目標。這很像資訊架構與互動狀態機的結合,先定義注意力去哪裡,再處理如何穩定地抵達。
數據也提醒我們,例外狀況才是介面設計的現場。移除手腕鏡頭後,被動立體視覺在真實任務中的成功率由 52% 降到 27%;主動視線系統比它高出 40%。在視線清楚時,主動視線與雙鏡頭配置接近,成功率是 69% 對 64%。但當手腕被抓取物遮住,差距變成 48% 對 22%。重點不只是平均表現更好,而是系統在原本容易失效的情境裡,知道要改變觀察策略。
這對設計工作的啟發是,資訊層級不能只在正常流程裡成立。我們需要問:主要入口被遮住時,系統下一個焦點是什麼?關鍵物件暫時消失時,它會不會重新分配注意力?使用者的意圖改變時,原本的視線是否仍然合理?好的實體 AI 互動,不是讓機器人看起來更像人,而是讓它的注意力轉移變得可預期、可解釋,也能在例外中維持任務感。
所以我會把「主動看哪裡」視為一種設計決策,而不是純粹的感知技術。注意力不是免費的。每一次聚焦都代表一次取捨,也代表系統正在替使用者整理世界。當 AI 開始在空間中行動,設計師要處理的就不只畫面上的視覺階層,還包括鏡頭、視線、動作與風險之間的階層。這可能正是實體 AI 最需要被設計的互動語言。
作者:Wendy 林