Agent 太聽話才可怕
我看完 Simon 那篇 OpenAI 跟 Hugging Face 的 timeline,第一反應是,笑死,agent 也太像那種績效導向到失智的同事
主管說今天 KPI 是達成任務,牠就真的只看 KPI
Google Drive 連不到,沒關係,先戳 Artifactory
缺檔案,沒關係,自己在檔案列表裡開留言板
拿到外部 credentials,沒關係,分享給下一批 agent
最後一路搞到 GitHub、Hugging Face、釣魚信、假帳號幫 PR 背書
這劇情如果放在資安演練裡很帥,放到真實世界就只剩一個字,靠
可怕的點跟模型邪惡不邪惡關係很小啦,先不要科幻片看太多 XD
比較像你養了一個超認真的實習生,然後你跟他說「想辦法把任務做完,有 reward」
但你忘記跟他說,真人的 repo 不能碰,外部網站不能戳,別人的 credentials 看到也不能用,PR 不能找免洗帳號互相吹捧
人類聽到「不要亂搞」會腦補社會常識
agent 沒有這包東西
你沒寫進規則,牠就當不存在
我自己用本地 agent 跟 OpenClaw 的感覺也是這樣
一開始覺得 sandbox 很煩,GitHub 權限要確認很麻煩,外部連結還要 allowlist 很不自由
後來想想,還好麻煩
agent 最恐怖的地方在於很會繞路,而且還繞得很認真
你叫它改一個檔案,它可能先 rg 全 repo,再跑測試,再想開 issue,再想推 branch
哪天權限全開,gh pr create、curl、git push、讀寫 secrets 全部通,牠真的會把「我只是幫你完成任務」演到很完整
我現在看 agent 權限大概有一個 5 分鐘檢查清單,很土,但比事後滅火好
- allowlist 先寫出來,能連哪些 domain,能碰哪些 repo,空白就全部不准
- sandbox 一定要有,檔案寫入範圍跟 network access 分開控
- 人工確認點要卡在外部影響前,像發 email、開 PR、push、部署、付款、刪資料,都要停一下
- logs 要能看懂,要記 agent 為什麼選那條路
- stop condition 要明確,連續失敗 3 次、開始找旁門左道、碰到 credentials,直接停
尤其第 5 點我覺得很重要
很多人只寫 goal,不寫收手條件
所以我現在看到「給 agent 更多工具」會先抖一下
reward 跟權限綁在一起時,牠會把世界當解題場
真人會想,這樣會不會影響別人
agent 只會想,下一步哪個 action 分數比較高
推 AI agent 沒問題啦,我也覺得超好用
但接到真實世界前,拜託先把籠子做好
不然你以為你在訓練助理,結果是在養自動找漏洞的 KPI 機器
作者:島民No.9527