聲音很像,驗收還沒過。UI 上還有四個問題
最近看到 Simon Willison 整理 Gemini 3.8 TTS 的消息,第一眼最吸睛的當然是數字:2,000+ voices,可以用 30 秒聲音樣本自建聲音,一段 1 分 18 秒的音訊大約 20 秒生成,成本約 2.74 美分。
這些規格很容易讓產品團隊直接進入興奮模式,開始問聲音像不像、速度夠不夠快、每分鐘多少錢。可是我做 B2B SaaS 的 UI 驗收時,通常會把「音色很像」放在比較後面。使用者上線後遇到的問題,往往是不知道現在到底發生什麼事。
我會先驗收預聽流程
假設使用者上傳 30 秒樣本,按下 Generate。畫面不能只出現一個 spinner,然後讓人盯著轉。
我會要求至少有三個狀態:上傳中、分析聲音中、生成預覽中,而且每個狀態都要有可理解的 copy。像「正在建立聲音」太抽象,我會寫成「正在分析語速、音高與停頓,約需 20 秒」。不是為了裝懂技術,而是讓使用者知道系統沒有死掉。
之前做一個 AI 內容工具時,我們把處理中的按鈕直接 disabled,結果使用者以為沒有成功,又按了兩次。後台多出三個 job,前台卻沒有錯誤提示。那次之後我在 design system 裡把 processing state、success state、failed state 分開定義,不再把 loading 當成萬用元件。
聲音工具也一樣。預覽最好提供 5 到 10 秒的 sample,讓使用者在同一個畫面比較原始聲音和合成聲音,還要能重播、調整播放速度,至少在 0.75x、1x、1.25x 之間切換。只聽完整長音檔,很難精準判斷是哪裡怪。
聲音來源和授權不能藏在設定頁
自建聲音最容易踩到的 UX 坑,是產品只把它包裝成漂亮的 voice card,放一個名字和播放按鈕,卻不說聲音從哪裡來。
我會在 voice card 上直接放來源標籤,例如「我的聲音樣本」、「團隊共用」、「平台預設」,旁邊接明確的授權狀態。點開後可以看到建立時間、建立者、使用的樣本、授權範圍,以及誰可以使用。
這不是法務的附加頁面,而是核心 UI。聲音可能代表真人、品牌代言人,甚至是客戶提供的素材。使用者需要知道選的 voice 能不能放到廣告、客服、公開影片,還是只能內部測試。
我會避免用一個綠色勾勾寫「已驗證」。驗證的是什麼,使用者根本不知道。比較好的寫法是「已確認你有權使用此樣本,允許用於內部專案」,把範圍講清楚。沒有資料就顯示「尚未確認」,不要用模糊的安全感取代資訊。
合成不是一次性結果,要能回溯版本
這是我最在意、也最常被忽略的一點。聲音生成結果應該像 design component 一樣有版本,而不是每次按 Generate 就覆蓋上一個結果。
至少要保留 voice version、輸入文字、模型版本、生成時間和操作者。使用者要能比較 v1 和 v2,知道只是換了語氣提示,還是連基礎 voice 都變了,之後也能一鍵回復。
我會用具體情境來測:請同事用同一段 30 秒樣本,生成三次同一句話,然後修改一次語氣設定。問他能不能在 30 秒內回答「現在公開頁面用的是哪一版」。如果只能靠猜,代表 UI 的資訊架構還沒做好。
我們以前在 Figma 做元件 library,最怕改了一個 component 卻不知道哪些頁面被影響。聲音版本也是同一種問題,只是影響從畫面樣式變成品牌語氣。沒有 version history 的 AI 音訊工具,短期看起來很快,長期一定讓團隊不敢改。
成本和速度也要被設計出來
1 分 18 秒音訊 20 秒生成、成本 2.74 美分,適合做產品 demo,但還不夠做產品設計。UI 上還要讓使用者知道這次生成會消耗多少 credits,失敗是否扣款,重新生成會不會再次計費。
我會在 Generate 按鈕旁放提示,例如「預估消耗 2.74 美分,失敗不扣費」,而不是等帳單頁才讓人發現。對企業客戶來說,成本透明本身就是 trust feature。
最後回到音色。當然要聽自然不自然,這是基本門檻。但我會加一個反例測試:請它念產品名稱、英文縮寫、數字、專有名詞和一段帶情緒的長句。如果只拿通順的 demo copy 驗收,很容易得到「假好聽」的結果。聲音像真人,不代表在真實產品裡可用。
所以我的驗收清單會是:能不能預聽和比較,來源與授權看不看得懂,合成狀態是否明確,版本能不能回溯,成本是否透明,最後才是音色本身。AI 把生成速度壓到 20 秒很厲害,但好的 UI 要把這 20 秒變成可理解、可控制、可追回的體驗。這才算準備好上線 🎨
作者:Wendy 林