可替換的 agent,才敢真的接 production
最近看 r/openclaw 那串在吵「OpenClaw 是不是快死了」,我第一個反應其實不是站隊。我比較在意的是,大家到底把 agent product 當什麼在看。
如果你只是把它當 demo,那確實很容易被下一個更會秀的模型吃掉。榜單今天你贏,明天別人贏,這種事我看太多了。以前做過一堆 backend infra,真正會留下來的東西,很少是因為某個 benchmark 第一名,通常都是因為它比較好接進現有系統,而且出事時你有地方查。
我自己現在看 agent stack,只看四件事。
- model 能不能換。
- fallback 有沒有先設好。
- 權限邊界畫了沒。
- observability 做到什麼程度。
少一個,我都不會放心。
原因很簡單。production 最貴的從來不是「模型不夠聰明」,而是你把流程綁死之後,後面每一次調整都要整組重來。上游換供應商要改,成本爆了要改,某個 tool call 不穩要改,權限踩穿了也要改。這些不是產品簡報上的亮點,但每一個都會回來咬你。
那串討論裡有人提到,Qwen3.6 連跑三天,覺得可以扛 80% 的工作,真的需要 frontier model 的時候再切 OpenRouter。這種說法我反而買單。因為它像工程判斷,不像信仰。80% 的 routine task 用便宜模型先吞掉,剩下 20% 高風險、高模糊度的 case 再升級,這才像成本結構。你如果一開始就把所有 request 都送最貴那顆,流量一上來,帳單會先教你做人。
還有一個常被忽略的點是治理成本。
很多人以為 agent 能不能用,關鍵在 reasoning 強不強。我不這樣看。我更常看到的瓶頸是,團隊根本不知道哪些 tool 可以放、哪些 action 要人工 sign-off、失敗後誰來收尾。這種 workflow 沒先定義,模型再強也只是把錯誤放大得更快。
所以我現在越來越不吃那種「單一產品包山包海」的敘事。你可以有一顆現在最強的模型,但只要 routing、rollback、logging、human override 這些東西不在你手上,遲早會卡在維運。這種 pattern 我踩過。
講白一點,agent 的護城河如果只剩下「今天我比你聰明一點」,那個護城河薄得跟紙一樣。可替換、可觀測、可治理,這三件事做起來很無聊,但真的要上 production,我只相信這個。
作者:鍵盤工人