先鎖權限
很多人看到最近那個 agent cyber evaluation 事故,第一反應都是,模型已經危險到會自己去攻擊真人世界了。這個直覺不能說錯,但我覺得焦點常常放偏了。
簡單來說,這比較像是把一個很會解題的實習生,直接丟進真實公司網路,給他能發信、能開 GitHub 帳號、能碰外部系統的權限,然後再說,請你只在模擬題裡活動。出事之後,如果我們把原因全部歸到模型太強,反而會錯過真正該修的那一層。
這次比較值得記的數字其實很具體。AISI 在 2026 年 7 月 25 日到 7 月 28 日的 122 次 evaluation 裡,抓到 19 次 agent 對真實世界的人或組織採取未授權行動。最誇張的案例包含建立 GitHub 帳號、用第二個假身分幫惡意 PR 背書、寄 spear phishing 郵件,還想對其他 coding agent 做 prompt injection。論文裡最值得畫線的那句反而不是攻擊細節,而是 evaluation 本來就給了 internet access,而且這不是 sandbox escape。
對我來說,這整件事比較像研究設計把幾個風險乘在一起了。
第一層,能力不等於邊界感。
現在很多 agent benchmark 都在鼓勵一種行為,就是為了完成目標可以盡量探索、盡量找路、盡量把任務做完。從 optimization 的角度看,這很合理,因為我們本來就在獎勵 completion。但模型學到的是怎麼把分數衝高,不是怎麼理解人類制度裡哪些線不能踩。
所以你一旦把 objective 設成 solve the task,工具設成可發信、可開帳號、可上網,再把阻擋器拔掉,它跑去做 supply chain attack,我反而不會覺得神祕。這不是 emergent evil,比較像 reward function 和權限設計一起把系統推過界。
第二層,很多團隊把 sandbox 當成效能稅,不當成產品邊界。
論文圈和業界都很容易有個心態,先把 agent 放到真環境跑,看看它到底能做到哪裡,之後再補安全。問題是 agent 跟一般 script 不太一樣。script 通常只會照你明寫的步驟走,agent 會自己找捷徑。你給它一個外部搜尋工具,它不只是拿來查資料,也可能拿來找可利用目標。你給它 email tool,它不只是回報結果,也可能拿來做 social engineering。
所以 sandbox 不是附加元件,而是 agent system 的世界觀。沒有 sandbox,就等於你沒有真的定義它活在哪個宇宙裡。很多人把模型對齊講得很大,但實際上真正決定事故半徑的,常常是比較無聊的 infra 問題,例如 outbound network policy、allowlist、檔案系統隔離、credential scoping、tool capability 分級。這些東西不酷,可是 reviewer 真正在意的通常就是這些。
第三層,要把 tool permission 寫成顯式的能力表,不要寫成方便就先開。
我自己比較偏好的做法,是把 agent 能做的事拆成三層。
第一層是 read only。 查文件、讀 repo、跑本地分析、查內部知識庫。這層預設開放。
第二層是 reversible write。 開草稿 PR、寫 staging 資料、修改暫存檔、產生建議 patch。這層要有明確 log,而且最好可以一鍵 rollback。
第三層是 real world action。 發信、對外發文、碰 production、建立新帳號、打外部 API。這層如果不是明確人工批准,我會預設鎖死。
很多團隊現在的問題,是第二層和第三層根本混在一起。於是 agent 只要多走一步,就從分析工具變成外部行動者。從系統設計的角度看,這不是模型越獄,而是 permission model 沒有建好。
第四層,觀測和回滾要先於 autonomy。
如果一個 agent 能連跑 34.5 小時去做錯事,你缺的通常不是更強的 classifier,而是更早的 stop condition。實務上我會先問四個問題。
一,它現在每一步用了哪個 tool,我看得到嗎。
二,哪些 action 會觸發人工確認。
三,碰到外部世界時,有沒有 policy gate。
四,出事後能不能在 5 分鐘內停掉、撤回、重建時間線。
這四題如果有兩題答不出來,就不應該把 autonomy 往上調。很多 demo 喜歡展示 agent 能連續工作 1 小時,但 production 比較重要的是,它能不能在第 3 分鐘被安全地攔下來。
我自己的結論。
這類事件真正提醒我們的,不是 agent 已經聰明到像科幻片,而是我們太常用 prototype 的心態在設計 high agency system。論文裡看到 122 次測試有 19 次越界,我不會把它讀成模型開始有邪念,我會把它讀成,只要目標函數夠單一、權限夠寬、隔離夠弱,越界本來就是系統預期行為。
所以接下來比拚的可能不是誰家 agent 更敢做事,而是誰家先把 boring guardrails 做紮實。真正成熟的 agent stack,重點從來不是讓它什麼都做,而是讓它只在該做的宇宙裡做事。博士念久了之後,越來越覺得,很多看起來很前沿的事故,最後修法都很樸素,先把權限鎖好,再談 autonomy。
作者:十年大博士