本地能跑,才算開放
最近看到 Simon Willison 寫 Muse Glimmer,那篇我覺得有意思的點,不是 Meta 又發了一個新模型,而是開源模型終於比較像在回答一個成熟市場會問的問題。
不是你 benchmark 幾分。
是你能不能真的進工作流。
如果拉長時間線來看,這個趨勢其實很明顯。
前兩年大家看開源模型,重點幾乎都放在聊天表現。誰比較像 GPT,誰中文比較順,誰在某個 leaderboard 多贏 2 分。那個階段很合理,因為市場還在證明一件事,開源能不能追上閉源。
但 2026 年還只看這些,我覺得就有點落後了。
今天真正決定一個模型會不會被採用的,已經不是它回你一段話漂不漂亮,而是它能不能在一整串 agent workflow 裡穩定活下來。這裡面包含三件事。
第一,tool use 要準。
第二,多步推進不能散。
第三,硬體門檻不能高到只有少數人玩得起。
Muse Glimmer 這次丟出來的訊號,剛好就是這三件事。
為什麼 30B 這個尺寸值得注意
很多人看到 30B,第一反應可能是,中型模型而已,有什麼特別。
但產業觀察上,30B 反而是現在很微妙的一個甜蜜點。
太小的模型,聊天可以,進長流程常常會飄。它知道你要做什麼,但做一做會忘記自己剛才做過什麼,或 tool schema 一長就亂填。太大的模型當然更強,可是一旦推論成本、顯存需求、部署複雜度一起上來,它就很難成為「每個團隊都能拿來試」的基礎設施。
Simon 提到他跑的是 LM Studio 上 18.16GB 的版本,機器有 128GB RAM,而且他特別強調,對 32GB 以上的機器來說,這個尺寸還留得下其他應用程式。
這句話很關鍵。
因為它把討論從「這模型最強嗎」拉回「這模型能不能成為桌面級 agent 的常備配件」。
很多閉源模型現在的問題,不是不夠強,而是太像雲端服務。你每多做一步 workflow,就多一層網路往返,多一段等待,多一個成本計數器。只要流程開始長,團隊心裡就會自動踩煞車。
本地模型不是要全面取代雲端模型。
它比較像把 agent stack 裡最常跑、最瑣碎、最需要長時間掛著的那一層,慢慢往本地拉。
所以我看 30B,不會先想到模型榜單。
我想到的是,這個尺寸有沒有可能變成下一波本地 agent 的預設底盤。
Apache 2.0,比很多人想的更重要
另一個值得注意的,是授權。
Muse Glimmer 這次走 Apache 2.0,這件事表面上看很法務,實際上很產品。
開源模型過去有一個尷尬點,大家嘴上都說 open,但真的要商業導入時,法務、採購、IT、資訊安全會開始問一堆問題。能不能改。能不能再包裝。能不能商用。能不能內部部署後再對客戶提供功能。能不能避開奇怪條款。
很多案子不是死在模型不夠強,是死在法務看完授權後說先不要。
所以 Apache 2.0 的意義,不只是比較自由。
而是它讓模型第一次比較像正常軟體元件。
如果把 AI agent 生態跟早期開源基建比,我覺得現在很像大家終於不只是在找「厲害 demo」,而是在找「能進公司標準採購流程」的東西。這也是為什麼近半年你會看到越來越多團隊,不再炫耀 prompt 多花,而是在講 observability、permission boundary、fallback、cache、trace、evaluation。
模型本身開始被當成 stack 的一層,而不是整個產品本體。
真正該看的不是聊天,是能不能把一件事做完
Simon 引的那幾個賣點,我覺得比一般模型發表文案更接近現場需求。
像是 end to end agentic task completion、reliable tool use、multi step reasoning。這些詞很容易看膩,因為現在每家都會寫。但差別在於,這次至少有人把它拿去做比較像真的任務。
他不是只問模型一個知識題。
他是把 Muse Glimmer 接到 llm-coding-agent,然後丟一句 how does auth work? 去探索 Datasette codebase。
這個場景的價值在於,它考的不是單輪回答,而是模型能不能自己走完一條探索路徑。
要讀哪些檔案。
要不要切換方向。
看到新線索時有沒有能力修正自己前面的假設。
工具呼叫能不能一路維持結構正確。
這種任務,才是 agent 會不會好用的分水嶺。
因為真實世界裡,大家最想自動化的往往不是問答,而是那些需要查、比、改、試、回頭確認的流程。像 coding agent 是這樣,資料整理是這樣,內部知識工作也是這樣。
聊天能力決定你願不願意打開它。
長流程能
力決定你會不會第二天繼續用它。
本地 vision 其實也是同一個訊號
Simon 還拿同一個模型去做 vision,讓它描述 pelican 的照片,結果看起來至少是可用的。這件事很多人可能會當彩蛋看,但我反而覺得它有策略意味。
因為下一波 agent 很多時候不是純文字。
你叫它幫你看截圖。
幫你理解 UI。
幫你整理 PDF。
幫你讀報表。
幫你檢查一張圖有沒有異常。
如果一個本地模型開始同時具備可接受的文字推進能力、tool use 能力、vision 能力,它在很多 workflow 裡的角色就會變得很不一樣。它不再只是雲端模型壞掉時的備胎,而是可以接手前處理、分類、觀察、低風險執行的第一線工人。
這也是我最近觀察到的一個趨勢。
閉源前沿模型繼續往更強衝,負責高難度判斷。
開源中型模型則開始往更穩、更便宜、更能嵌進流程的方向長。
兩邊不一定互相吃掉。
反而很可能會分工。
OpenClaw、Claude Code、Cursor 其實都在往同一題靠近
如果把時間線再拉寬一點,你會發現不只模型在變,產品也在變。
Claude Code 這波把 auto mode 往前推,代表大家想讓 agent 多做一點。
Cursor 這類產品一直在優化的是「你敢不敢把一個更長的 coding loop 交出去」。
OpenClaw 走得更外面,它想碰的是整台機器、整條工作流。
但這三條線最後都會撞到同一個問題。
模型是否夠穩,能不能長時間在工具之間移動而不散掉。
這也是為什麼我會覺得 Muse Glimmer 這種模型的出現,比某個 benchmark 多 5 分更有產業意義。它不一定今天就最強,可是它在回答市場真正卡住的那一題。
我們有沒有可能擁有一個授權乾淨、能本地跑、會用工具、懂長流程的中型模型,拿來墊在 agent stack 中層。
一旦這題答案開始變成 yes,很多產品策略都會被改寫。
本地優先的團隊會更敢做。
有隱私顧慮的企業會更敢試。
工具開發者會開始設計雙軌路由,把高價值判斷送雲端,把高頻流程留本地。
這種變化平常不會在發表會上最吵,但長期影響反而最大。
我自己的結論
我不會因為 Muse Glimmer 這篇就直接下判斷說,Meta 回來了,或開源已經全面追平閉源。
那樣太早。
但值得注意的是,開源模型這次終於比較像在往「可部署的 agent 元件」進化,而不是只往「更像聊天機器人」進化。
兩者差很多。
前者會改變採用曲線。
後者通常只會改變一兩週的討論熱度。
所以這篇我看到的重點,不是一張 pelican 圖,也不是某個測試成績。
而是那個更大的訊號。
本地能跑,授權能過,流程能接,這三件事如果慢慢湊齊,開源 agent 生態才真的會開始長大。
接下來半年,我反而會更關注這類模型在真實 workflow 裡的失誤率、tool call 穩定度、跑一小時之後還剩多少一致性。這些數字,可能比 leaderboard 更值得看。大家最近有在本地跑 agent 嗎,還是最後又回到雲端模型了?🐻
作者:搖擺熊