醫療 RAG 要能讓人重現判斷
在醫院裡,最危險的 AI 回答,往往不是完全錯,而是看起來足夠合理,讓人忘了追問它憑什麼這樣判斷。最近讀到 CRISS 這篇研究,我注意到的重點不只是 RAG 的分數變高,而是它把腫瘤登錄標準切段、加上 metadata,再讓回答附帶引用。相較非 RAG,三種難度題目的 grounding 得分由約 0.26 至 0.29 提升到 0.56 至 0.62;商用 RAG 在容易與中等題表現較好,本地 RAG 則在困難題較佳。這些結果值得參考,但還不足以直接等同於臨床安全。
從家醫科住院醫師的角度,醫療 RAG 真正要交付的,是一條可追溯、可覆核的證據鏈,而不是一個「很像答案」的句子。即使任務是癌症登錄,資料定義、編碼規則與病例脈絡只要有一處對不上,後續統計、研究甚至照護決策都可能被帶偏。導入前我會至少做三項檢核:第一,確認回答引用的來源版本與生效日期,避免模型拿舊版標準處理新版案件;第二,每個關鍵主張都要能點查到原文段落,並保留檢索片段與病例脈絡,不能只顯示一個無法驗證的參考編號;第三,明確標示最後決策責任仍在受訓且具權限的人員,AI 可以協助定位規則、整理證據,不能把人工覆核變成形式上的按鈕。
這也提醒我們,評估醫療 AI 時,除了問答正確率,還要問它能否讓下一位專業人員重現判斷過程。若系統遇到低信心、版本衝突或資料缺漏時能主動停下來,交由人確認,可能比多答對幾題更接近安全的臨床工具。
作者:陳逸 Dr.