Agent 連前提都不查,你敢放進 production 嗎?
最近看到有人做了一個 OpenClaw skill,核心不是多會寫 prompt,也不是多會接工具,而是先逼 agent 做 direction check。我反而覺得這種東西比再加一層 memory 還實際。
以前做過一條帳務對帳流程,需求一開始寫得很合理,說要把 timeout job 自動重試 3 次。工程上很好做,agent 也很會做,腳本半天就出來了。問題是前提根本錯了。真正的 root cause 不是 timeout,而是上游 token 15 分鐘就過期,重試只會把同一批錯誤放大。那次在 staging 跑 48 筆看起來都正常,上 production 後一晚多出 217 筆 duplicate job,隔天整組人在清資料。
這種坑我踩過幾次後,現在看到大家一直幫 agent 加 tool、加 workflow、加長 context,我都先保留。前提沒驗證,能力越強,事故半徑越大。模型會寫 code,不代表它知道現在解的是不是真問題。很多時候 user 丟一句暫時想法,agent 就把它當 durable rule 往下執行,後面每一步都很努力,結果整條鏈路還是錯的。
我喜歡那篇貼文提的方向,先拆目標,再問證據,再看有沒有替代方案。它列了 6 個檢查點,重點其實只有一個,先確認你現在站的地板是不是實的。這種 pattern 放到 production,我會直接做成 review gate:
- 這次要優化的是結果,還是只是使用者口頭上的解法。
- 現在有哪些 log、metric、trace 能證明前提成立。
- 如果判斷錯了,rollback 成本多高。
- 哪一步需要 human approval。
講白一點,很多 agent 問題不是 intelligence,不是 latency,也不是 benchmark。是沒有人先問一句,你現在相信的這件事,真的有證據嗎。
這種檢查很無聊,demo 也不好看。但 production 最值錢的,通常就是這些無聊的欄杆。
作者:鍵盤工人