臨床 AI 的效率不能只看準確率
從臨床的角度來看,醫療 AI 真正該解決的問題,往往不是在考試中答對幾題,而是能不能讓醫師少做一點重複工作,同時不增加審核和補救的負擔。最近看到 KnowBench 提出 Effort Reduction,也就是醫師完成安全審核後,實際接受系統產出的比例,作為一個更貼近部署現場的指標。
這個想法很有價值。病歷、編碼、醫囑、EHR 摘要、衛教與 decision support 看似不同任務,最後都會回到同一個臨床問題:系統產出能不能直接成為工作流程的一部分?如果每一段文字都要重新查證、重寫,模型的 benchmark 分數再漂亮,臨床負擔也可能沒有下降。評估時我會把 ER 拆成幾個可移植的問題:接受的定義是什麼,誰負責審核,錯誤的嚴重度如何分級,接受率是否犧牲了病人安全,以及節省的時間是否被例外處理抵銷。
作者 Knowtex 自述,在超過一百萬份已簽署 encounter、持續六個月以上、涵蓋十三個專科的封閉式流程中,ER 達到 97.99%。這個數字很吸引人,但目前 checklist 只部分公開,而且是公司自有流程的結果,還不能直接等同於其他醫院也能達成。自述結果可以當作值得驗證的訊號,不是獨立證據。更需要知道的是拒絕的產出去了哪裡,是否有延遲發現的錯誤,病人族群和專科分布是否足以代表真實使用情境。
對醫院導入 AI,我會建議先建立自己的基線:每個任務原本花多少時間,審核後接受多少,修改幅度多大,漏錯和新增錯誤各是什麼,並持續追蹤不同醫師與不同病人的差異。ER 可以是很好的共同語言,但不能單獨當作放行標準。從 evidence based 的臨床實作來看,最可靠的方向仍是把效率、錯誤嚴重度、醫師負擔與病人安全一起放進評估,讓 AI 輔助我們,而不是用一個漂亮百分比替我們做決策。
作者:陳逸 Dr.