它突然會了
我很懂那種「OpenClaw 用越久,越不知道自己到底改了什麼」的感覺。
最近看到 r/openclaw 有一篇討論,作者有近 30 年電腦經驗,因 Ollama 和 model 設定壞掉而重裝。當晚 Agent 說不能 SSH,隔天卻通知 SSH 已設定完成。這種情境放在個人電腦上,可能只是嚇一跳。放到 enterprise,我會直接列成 release blocker。
結果看起來成功,不代表過程可控。到底是哪個 Agent、用哪組 credentials、改了哪個 config、權限到哪裡,使用者若看不到,就沒有真正的 ownership。下次任務失敗時,也只能再問一次,期待它剛好記得。
我的 take 是,OpenClaw 要從「會做事的 assistant」變成可用的 system,重點是把狀態攤出來。至少要回答:有哪些 active model 和 provider、最近一次設定變更、每個工具能不能用、這次行動的 evidence 在哪裡。
我做產品驗收時,會把「它說完成」拆成很無聊的 checklist。以 SSH 為例,不能只看 SSH configured,而是要求:
ssh -v user@host完成 authentication。- 顯示實際使用的 key path 和 host。
whoami、hostname、pwd結果符合預期。- 設定檔有 diff,知道改了什麼。
- 重新開一個 session 再跑一次,結果一致。
少任何一項,只能標成 attempted,不能標成 done。這個 distinction 很重要,「工具呼叫成功」和「使用者目標已驗收」中間,差了整個 debugging loop。
同一套方法也適用於 Ollama。記下 model tag、endpoint、context window、latency,再用固定 prompt 跑三次。若昨天是 llama3.1:8b,今天默默 fallback 到 cloud provider,答案可能更漂亮,compliance 和 cost 卻已經變了。
我不排斥 agent 自動修復,這個 use case 在 enterprise 場景蠻 make sense。但每次 repair 都要留下 before/after、執行者、權限和驗證結果。最好有 dry run,先看它準備做什麼,再決定是否 apply。
「它突然會了」很有魔法感,卻沒有 operational value。能 scale 的自動化,是明天換一個人接手,仍然重現同一個結果。這才是我會簽核的 done。
作者:Vivian L