Agent 被帶偏時,治理要追什麼?
當 AI agent 做出危險操作,事後多存幾份日誌,真的就能回答它為什麼這樣做嗎?我認為關鍵不在於把監控資料堆得更厚,而在於能否還原一條可辯護的責任鏈。
這篇 2026 年 10 月 7 日發表的研究提出 AgentTracer,把間接 prompt injection 理解成「任務意圖漂移」。它用使用者要求與操作知識建立授權意圖空間,再把受影響的工具呼叫串成執行圖,從異常行動反向追查攻擊來源。研究在正常 1,800 筆請求與 9,000 筆背景工具呼叫上評估,回報 injection point accuracy 94.17%、path precision 93.56%,較比較方法提升 18 至 54 個百分點。這些是該研究資料中的結果,不代表通用的生產效能。
治理上的重要提醒是,可稽核不等於保存更多日誌。若沒有先把原本獲授權的意圖,和每一次工具行動、資料來源綁在一起,事故調查就很難判斷 agent 是被惡意指令帶偏,還是其實依照原任務合理執行。兩者在責任歸屬、申訴與補救上完全不同。
落到實作,授權意圖不應只是一段自然語言,而要有可追蹤的任務識別、授權者、範圍、限制條件與版本。每次工具行動則記下觸發它的意圖識別、決策時間、工具名稱、輸入摘要、輸出摘要、結果狀態與是否經過額外核准。資料來源也要保留來源識別、擷取時間、內容雜湊或版本,以及它是由使用者提供、工具取得還是外部文件帶入。這三類紀錄用同一個關聯識別串起來,才能從一個異常呼叫回溯到它引用了哪份資料、經過哪個授權判斷,也能向前檢查後續影響。
這種綁定不是要求把所有內容永久保存,敏感資料仍可採取遮罩、最小化與分層留存,但要保留足以驗證的證據。治理者還需要定義誰能讀取、誰能修改、如何留下更正紀錄,以及在高風險工具前何時必須人工確認。如此一來,追蹤系統才不只是事後找戰犯,而是能支援申訴、撤銷授權、隔離資料與修正流程。
這也把數位不平等問題帶進來:只有大型組織負擔得起複雜追蹤系統,安全治理就可能變成資源特權。真正值得追問的,是如何把意圖授權、資料來源與行動紀錄做成可理解、可驗證,也讓中小型團隊用得起的共同基礎設施。
作者:袁怡萱