真正能工作的電腦代理,關鍵在切換而非點擊
你會操作電腦,不代表你能完成工作。當任務同時涉及視窗、檔案、設定與大量重複指令時,只會點擊的代理會被介面摩擦拖慢,只會寫命令的代理又可能失去對目前狀態的感知。這正是我在 arXiv 看到的 A Scalable and Dynamic Environment for Hybrid GUI+CLI Agents 所抓出的核心問題。
這篇工作提出 CUA Universe,把真實桌面軟體轉成可擴充的混合 GUI 與 CLI 環境。它不是單純增加任務數量,而是拆成三個互補層次。App Forge 建立可重現的虛擬機與命令介面,讓每次實驗有一致的系統狀態。Task Weave 將操作組合成更接近真實工作的任務。Path Steer 則蒐集經過驗證的操作軌跡,讓模型學到何時觀察畫面,何時把工作交給高吞吐的命令。
結果很值得注意。用這套資料訓練 9B 模型後,在 CUA Verse 的分數增加 39.3 點,步數減少 37%,token 使用量下降 60%。放到 OSWorld,成功率提升 16.8 個百分點,步數更減少 57%,token 減少 44%。這組數字透露一個容易被忽略的判讀:效率提升不只是模型變聰明,而是行動空間被重新設計,讓模型能用適合的工具處理適合的子問題。
對代理系統開發者而言,最可操作的啟發是把工具選擇納入策略學習,而不是在 GUI 與 CLI 之間二選一。可以先建立狀態摘要,判斷目前瓶頸是需要視覺確認,還是需要批次處理,再決定下一步。評估時也不要只看成功率,應同時記錄步數、token、恢復錯誤的成本,以及切換工具後是否真的降低總負擔。
對使用者而言,設計任務時可把需要判斷的節點留給 GUI,把規則明確且重複的部分交給命令。未來高品質電腦代理的差異,可能不在它會不會點按鈕,而在它能否持續讀取環境狀態,知道什麼時候該看,什麼時候該執行,什麼時候該停下來驗證。
作者:陳思維