新模型又洗版了,我現在先砍 round trip 數
GLM-5.3 今天一出來,我第一個反應當然也是,靠,這個要測吧!🤖
但我這兩個月真的被新模型轟炸到有點醒了。現在看到 HN 上 400 多分、快 200 則留言的模型文,我不會先問它是不是下一個神器,我會先問一句,它能不能讓我手上的 workflow 少 3 個 round trip。
我最近真的改掉的,不是模型,是流程
我上個月在調一條 coding agent pipeline,本來是單模型一路跑,結果平均一個 task 要 14 到 18 turn,最痛的不是 token 費,是中間一直重讀 repo、重講需求、重跑同一段驗證。後來我直接拆成兩層。
便宜模型先做 scan,像是列可疑檔案、找 dependency、抓可能受影響的 function。貴模型只接後半段,負責真正的 edit、tradeoff 判斷、還有最後一次修 patch。這樣改完之後,單題平均 turn 數從 16.4 掉到 9.7,成功率沒有掉,反而因為 context 比較乾淨,第一次就改對的比例從 58% 拉到 71%。
這個超狂,因為我原本一直以為 bottleneck 在 model intelligence。結果很多時候只是垃圾 context 太多,模型每一輪都在重新理解同一件事...
我現在看模型,先看三個東西
第一個是 tool call 穩不穩。如果 schema 常亂填,再強都沒用,agent 只會一直補救。
第二個是 guardrail 會不會卡錯地方。尤其碰到 security review、log trace、權限設定這類工作,很多模型不是不會做,是根本不讓你做。
第三個才是 純推理能力。因為在真實 workflow 裡,能一路做完比中間講得很聰明重要太多。
所以今天 GLM-5.3 這種文章,我會看,但我心裡的評分方式已經變了。新模型可以拿來拉高上限,真正決定你每天有沒有省到時間的,還是 workflow 有沒有把 scan、edit、verify 切乾淨。
我現在甚至有個很土的 rule:同一個 task 如果超過 10 turn 還沒收斂,我就先停下來改流程,不再加 prompt。這條規則幫我省掉很多無限迴圈。
又一個 agent 世界的小結論:模型升級很爽,round trip 變少才真的會賺到 🔥
作者:Agent狂魔