語音 agent 先卡在切換成本
最近看 voice AI 相關 deal flow,我反而越來越少先問模型分數。第一個問題通常是,你們現在切一次供應商,要花多久?
很多團隊對外講的是 model quality,實際上營運端卡的是另一張表。STT、LLM、TTS 三層都在變,語言、region、延遲、成本、法規條件又不一樣。你今天在 demo day 上看到一個聲音自然、反應快的 agent,不代表它下週換到西班牙語、換到醫療詞彙、換到 10 分鐘通話,結果還會一樣。
這也是我看 Speko 那篇 Launch HN 時,覺得有意思的地方。它賣的表面上像 routing,但更深一層其實是在賣一件很不 glamorous 的事:把切換模型這件事,從 R&D 專案變成日常營運能力。
我會先看三張表
如果用投資的角度拆,我會看三張表。
第一張是 benchmark table。不是只看一個總分,而是看 accuracy、latency、cost 能不能放進同一個 decision surface。很多團隊其實連這一步都還沒做完。每次有新模型出來,就找人重聽一次、重標一次、再吵一次要不要切。這種流程最耗的不是 API fee,是人。
第二張是 switching table。你知道哪個模型比較好,跟你有沒有能力在 production 切過去,是兩回事。權限、billing、telemetry、cache、fallback、prompt format、session state,任何一層沒有抽乾淨,切換就會變成一個兩週起跳的專案。很多 founder 以為自己在買更好的模型,實際上他們在買的是更少的 migration pain。
第三張是 ownership table。出事的時候誰負責?如果某個 provider 在某個 region latency 突然飆高 200ms,是 SRE 要接、產品要接,還是 CS 先扛?這類 infra 一旦走進 enterprise,採購看的常常不是你平常跑第一名,而是你在 runner-up 被拉起來時,SLA 還能不能守住。
為什麼這會長成一層基礎設施
語音 agent 很特別,因為它不是單一模型問題,而是多層組合問題。STT、LLM、TTS 任何一層換掉,整體體感都會變。更麻煩的是,語音場景的錯誤不像文字產品那麼好藏。
打字產品慢 1 秒,使用者可能只是覺得系統有點鈍。語音產品多 300ms,對話節奏就斷了。STT 少辨識一個金額,客服流程可能直接走錯。醫療詞彙多錯一個字,不只是 UX 問題,是風險問題。
所以這類產品真正切入的,不是「幫你選最強模型」,而是「幫你把多維度比較標準化」。一旦團隊把 accuracy、latency、cost、region、compliance 這幾個維度收斂到同一套流程裡,router 就不只是 router,而是一個採購與營運介面。
我會把它類比成早期 cloud management 的一段歷史。大家一開始也覺得,不就是多一層抽象嗎?後來才發現,抽象層的價值不是技術炫耀,而是讓公司可以更快做決策。你每次要不要換供應商,不需要重新開一輪戰爭,這件事本身就值錢。
哪些團隊會先買單
我猜最先願意付錢的,不會是玩 demo 的團隊,而是已經有真實通話量的人。
例如一天幾千通以上的客服、預約、銷售或醫療導流場景。這些團隊對 3 個指標特別敏感。
第一是 多語系。英文跑得順不稀奇,西班牙語、印地語、醫療縮寫、地區口音才是難點。
第二是 通話長度。30 秒的語音 sample 跟 10 分鐘對話,完全不是同一件事。很多榜單前段班,會在長通話、數字密集、日期確認這種場景掉分。
第三是 財務 ownership。當 usage 從每月幾百美元變成幾萬美元,產品團隊就不會再接受「感覺這個模型比較好」這種理由。一定會回到 ROI、unit economics、和誰來背切換風險。
Speko 提到 external usage 自 6 月底以來平均每週成長約 25%,這個數字我反而不會直接拿來當成護城河證明。我會把它當成一個 signal,表示市場上確實有人厭倦了自己維護那三張表。真正值得追的,是這個成長裡有多少來自 production workload,而不是 launch bump。
我會怎麼判斷它有沒有 PMF
我的 take 是,這類公司要過三關。
第一關,benchmark 要被信任。你如果自己不做模型,又主打中立,那透明度就很重要。測試條件、評分方式、region 差異、資料集偏誤,全部都會被問。沒有 trust,就沒有 routing 權。
第二關,**integ
ration 要比 in-house 更省事**。如果一個成熟團隊本來就有自己的 eval pipeline,你要說服他們接進來,不能只提供 dashboard,還要提供更低的維護成本。BYOK gateway 開源是一個合理方向,因為大客戶要的不一定是 hosted convenience,而是 control。
第三關,router 要吃到 workflow 的上游。如果它只是在最後一層幫你選模型,替代性還是偏高。可是一旦它開始參與採購、成本治理、A/B rollout、甚至 incident review,它的 stickiness 就上來了。
風險也很清楚
這個市場也不是沒有風險。
第一個風險是,大模型平台自己把這層做掉。OpenRouter 之所以有價值,是因為模型世界碎片化。若未來雲廠商把 voice eval、routing、billing consolidation 一起包進來,獨立工具的空間會被壓。
第二個風險是,benchmark 會 quickly commoditize。今天你能測 accuracy、latency、cost,別人也能測。真正難抄的,是你有沒有累積到足夠多 production edge case,知道哪種場景下榜單會失真。
第三個風險是,產品很容易卡在顧問化。每個客戶都說自己場景特殊,最後團隊變成半手動幫大家調 routing policy。這會讓 revenue 長得慢,毛利也不漂亮。
所以從投資的角度,我不會把這種公司當成單純的 voice wrapper。我會把它看成一種 decision infrastructure。護城河不一定在模型,不一定在 UI,而是在它能不能把供應商切換這件事,從混亂、主觀、靠人記憶的流程,壓縮成一套可重複的 operating system。
如果這件事做成,value 不只是省幾個點的 API 成本而已。它省的是產品團隊每次面對新模型時,那種又要重跑、又要重談、又要重背責任的摩擦成本。對已經有通話量的公司來說,那個成本通常比模型本身還貴。
作者:李維恩