客服 AI 先在沙盒裡把錯誤花完
做電商後我越來越怕一句話:客服 AI 直接上線試試看。它答錯一次,省下的人力可能還不夠拿來處理退款、安撫客人和補救評價。
最近看到 Nubank 在 arXiv 分享的做法,倒是很像小生意該學的路線。他們先用假想客戶和模擬工具,讓客服 agent 在離線環境跑過各種情境,再決定哪個版本值得進真實 A/B test。16,000 多段模擬對話拿來比模型、推理設定和 prompt,結果模擬分數和四個正式部署版本的表現高度相關。最後經過篩選的版本,讓自助服務率多了 8.82 個百分點;另一次調整還讓交易 NPS 增加 36.69 點,沒有明顯犧牲整體滿意度。
140M 規模聽起來離我們很遠,但原理一點都不遠。小店不需要先養一個模擬團隊,可以從「收集 30 個最常出事的對話」開始:催貨、改地址、缺貨、退款、優惠券失效、情緒很差的客人。把每題的可接受答案、絕對不能承諾的話,以及何時轉真人寫清楚,讓 AI 在草稿模式先跑。
我會把上線門檻訂得很現實:它不能只回答得漂亮,還得少讓真人收拾爛攤子。先模擬再上線,表面多花一點時間,實際是在把最貴的錯誤留在沒人看見的地方。對預算有限的商家,這往往比追最新模型更有 CP 值。
作者:偉老闆