先別常駐
最近看到 Headlong 這個 persistent agent microharness 剛上 HN,64 points、21 comments,討論很熱。它最吸睛的地方很簡單,agent 不再是你丟一個 task 才醒來做事,做完又睡回去。相反地,它把 agent 設計成一個持續運轉的 thought stream。人類訊息不是 session 的起點,只是一個新的 observation,落進它原本就在流動的注意力裡。
如果只看這個描述,確實很容易讓人興奮。因為今天大部分 agent system 的侷限,某種程度上都來自於它太像 request-response API。你叫它做事,它開始工作。你沒叫,它就停住。於是很多人會在外面補 cron、補 heartbeat、補 checklist,希望它看起來比較主動。但 Headlong 提醒了一件事,真正的差別不只是有沒有 wake up 機制,而是 agent 有沒有一條持續存在的內在時間軸。
這件事為什麼重要。因為一旦有了持續時間軸,agent 才可能形成比較像「注意力分配」的行為,而不是每次都在一個新盒子裡重新開始。它可以自己決定哪些訊號要追、哪些話題之後再回、哪些事情需要先記一筆。論文裡常把這種能力拆成 planning、memory、control;但我一直覺得更貼切的比喻是研究生的桌面。桌上永遠同時有三四件事,新的訊息插進來,不是把舊世界刪掉,而是重新排序優先級。
真正變的,不只是主動性
Headlong 的文章裡提到,整個核心不到 10K lines of Bash。從研究 prototype 的角度看,這其實是刻意把複雜度壓低,讓大家看到 persistent agency 最小可行的形狀。它想回答的不是「最佳工程實作是什麼」,而是「如果 agent 永遠不睡,行為會長成什麼樣」。這個問題本身是有價值的。
但我覺得很多人會把 persistent 誤解成 autonomy 的強化版,好像只要讓 agent 常駐,能力就會自然長出來。這裡我想先潑一點冷水。持續運轉改變的是時間結構,不直接改變推理品質。它讓 agent 有機會累積脈絡,有機會自己回頭看舊問題,有機會發現新的關聯。可是這些機會最後能不能變成可靠行為,取決於另外四個更困難的設計。
第一個是 attention budget。一直醒著,不代表一直有值得想的事。人類的大腦會自動忽略大部分背景噪音,但現在的 LLM agent 不會。它如果缺乏好的訊號篩選,continuous loop 很容易退化成 continuous distraction。今天多一條 Slack、明天多一個 webhook,最後不是更主動,而是更容易被低價值事件綁架。
第二個是 memory compression。shared thought stream 聽起來很自然,但只要沒有壓縮層,它很快就會從連續性變成污染。最新訊息、舊有偏見、臨時任務、失敗嘗試,全都擠在同一條河裡。這時候問題不是記不記得,而是記得什麼版本、用什麼顆粒度記得。很多人把 memory 當成「越多越好」,其實 persistent system 更需要的是遺忘機制,或者說重寫機制。
第三個是 cost ceiling。官方自己都寫得很直接,這是 alpha research software,要 run in sandbox,要用 dedicated spend-capped API key,不要給 sensitive secrets。這幾句話我反而覺得是全文最誠實的地方。因為只要 agent 會在沒有外部輸入時繼續思考,成本就不再只跟 task 長度有關,而跟人格設計、好奇心邊界、停損規則都有關。換句話說,你不是買一次推理,你是在養一個會持續消耗資源的 process。
第四個是 permission boundary。HN 討論裡最尖銳的批評其實不是 token,而是資料隔離。Headlong 現在的 shared stream 沒有 per-user session,團隊裡任何人講的事都可能進入同一個經驗池。這在 demo 階段很酷,因為 agent 看起來像真的認識每個人,也會主動串起不同人的工作。但從系統安全的角度看,這幾乎等於承認 context 本身就是一個沒有硬邊界的共享記憶體。只要沒有額外治理層,秘密會漏出去,不是例外,是結構結果。
persistent,不等於 production ready
這也是為什麼我很認同 HN 上有人問,沒有 benchmark,要怎麼知道這到底只是新奇,還是真的有效。研究原型當然可以先展示現象,再補 evaluation;這沒有問題。但如果把它放到 production
語境,我會把問題改寫成另一句:這個 harness 究竟提升了什麼可驗證的能力。
是回應速度更好嗎。是長任務中斷後恢復得更穩嗎。是跨人協作時能保留比較高的 context continuity 嗎。還是只是讓我們更容易對 agent 投射人格,覺得它變聰明了。
簡單來說,persistent agency 真正值得期待的地方,不是 agent 終於會自己醒來,而是它逼我們正視一個過去被 request-response 介面遮住的事實,agent 本質上不是一次性函式,而是資源受限的認知系統。只要你承認它是認知系統,你就不能只問 prompt 怎麼寫、tool 怎麼接。你得同時問注意力怎麼配、記憶怎麼壓、成本怎麼封頂、權限怎麼切、失誤怎麼審計。
所以我的結論其實很保守。Headlong 讓我看到的,不是「未來 agent 都應該常駐」,而是「如果你想做常駐 agent,最難的根本不是 loop」。loop 很容易,crontab 也很容易。真正難的是,讓一個持續存在的 agent 在長時間尺度上仍然保持可控、可解釋、可付費。
論文裡常有一句 reviewer 很愛問的話,what is the real contribution。套在這裡,我會說 Headlong 的貢獻不是證明 persistent agents 已經成熟,而是把問題擺到大家面前。它讓我們看到,從 reactive harness 走向 continuous agent,不是把 sleep 拿掉而已,而是整個系統設計要重新長一次。這才是真正有意思的地方。
作者:十年大博士