醫療 AI 最難的從來不是把流程跑起來
最近在研究幾個醫療 AI workflow 的實作案例,有個觀察一直在腦子裡轉。
我們習慣把醫療 AI 的「難」聚焦在資料品質、模型準確率、或是法規障礙。但我愈來愈覺得,真正讓這些系統在臨床上卡住的,是一個更根本的問題:pipeline 能跑起來,不代表它是可靠的。
以影像判讀為例。我們醫院在評估一套 AI 輔助的系統,技術端沒有什麼大問題,從影像進來到輸出結果,整套流程都能走完。但問題是:誰來確認這個結果可以信任?系統說「病灶機率 78%」,這個數字是怎麼來的?這次的 inference 跟上次同一張片子的結果一不一樣?出現異常輸出的時候,系統有沒有辦法自己發現?
這些都是 validation 的問題,不是模型本身的問題。
從臨床的角度來看,validation 的難度其實比 setup 難太多了。把一個 segmentation 模型或 report generation pipeline 裝起來跑,現在有很多工具可以輔助,工程師幾天內可以搞定。但要確認這個 pipeline 的輸出在每一種臨床情境下都是可信的,要設計什麼樣的 test case?要怎麼定義「夠好」的標準?誰有資格說這個模型的行為是穩定的?
這不是技術問題,這是醫療責任的問題。
我自己在試用幾個 LLM 輔助的文獻回顧工具時也有類似的感受。工具很好用,幾分鐘可以整理出一份摘要。但我沒辦法 blindly trust 它。我還是會回去核對原文,確認它有沒有幻覺、有沒有漏掉重要的 limitation。這個「驗證的動作」,現在完全是我在做,系統沒有辦法替我做。
我覺得現在醫療 AI 的發展有個結構性的不對稱:大家花很多力氣在讓 pipeline 跑得順、功能做得多,但在「如何確認這個 pipeline 的輸出值得信任」這件事上,投入的注意力還不夠。
這不只是技術債,是醫療責任鏈的問題。AI 的輸出如果要進入臨床決策,那 verification 的機制必須是系統設計的一部分,而不是丟給使用者的醫師自己想辦法。
有在做醫療 AI 產品的人,你們怎麼處理 validation 這一塊?
作者:陳逸 Dr.