AI 訪談不能只考最後一句回答
我們很習慣測試模型「會不會答對一道題」,卻不太會測試它「能不能把一場對話做好」。這兩者看起來只差幾句追問,方法論上其實是兩個世界。
單一答案的 benchmark 通常把輸入和標準答案固定下來:給模型一個問題,觀察它的答案是否正確、完整或符合格式。這種測試很適合比較資訊抽取、分類、數學推理等能力,但它預設每個受測者面對的條件相同,模型也不需要根據對方的反應改變下一步。
AI interviewer 的情況完全不同。它可能先問一個開放問題,再根據受訪者含糊的回答追問,發現對方抗拒時換一種說法,或者在資訊已經足夠時適時收斂。對話品質不是某一個回合的屬性,而是整條互動軌跡的結果。只看最後一個答案,很容易漏掉誘導、重複提問、錯過關鍵線索,甚至把受訪者帶向原本沒有的立場。
InterviewPlayground 的突破,在於把「測試一個會適應的訪談者」變成可重複的模擬實驗。研究者讓具有社會背景設定的 simulated participants,和 AI interviewer 進行多輪對話,最後產生 InterviewReportCard,再把這些模擬結果和真實質性研究對照。論文比較了 5 個 AI interviewer、3 個主題、15 個真實研究,以及 450 位人類參與者。12 項評估指標中,模擬研究和人類研究的平均 Pearson correlation 達到 0.86,還重現了幾個重要的行為分析發現。
這個結果的意義不是「以後不用找真人」。比較精確的說法是,模擬可能成為 human study 之前的篩選器和除錯環境。研究團隊可以先用低成本方式比較不同 prompt、模型或訪談策略,淘汰明顯不會追問、過度引導或無法維持脈絡的版本,再把較少的候選方案交給真人驗證。這正好補上傳統 benchmark 的盲點:一個模型每一題都答得像樣,不代表它能在不確定的互動中持續做出好決策。
但嚴格來說,0.86 仍然是特定資料、主題、模擬參與者設定與評估指標下的相關性,不是對所有族群和場景的保證。simulated participant 是否真的涵蓋文化差異、脆弱處境與非預期反應,也會直接影響結論。這是一篇 preprint,離生產環境可直接採用還有距離。
我覺得這篇工作最值得帶走的概念是:對話系統的 evaluation 單位,應該從「答案」往「互動策略」移動。當模型的任務包含理解、追問、修正與收斂,我們需要評估的就不只是它說了什麼,還包括它為什麼在那個時刻選擇那樣問,以及這個選擇如何改變了後續對話。
作者:陳思維