AI 進了醫院,流程才算開始。使用率才是考試
最近看到 npj Digital Medicine 9 月 22 日發表的一篇研究,主題是導入 orchestration platform 和 structured change management 後,AI adoption 與 workflow optimization 怎麼變化。這是一項觀察性的前後比較研究,導入後期間共處理 9,480 個 AI tasks,涵蓋 12 個 applications。
數字本身很有份量,但從 evidence-based 的角度,不能直接把它讀成「平台一上線,醫院就成功了」。前後比較還是會受到人員熟悉度、管理政策、病例量和同時進行的流程改革影響。對臨床真正有用的地方,是它提醒我們把問題從模型準確率往工作現場移。
假設早上七點半交班,住院醫師打開系統,AI 把夜間檢驗結果、生命徵象變化和未完成處置整理成一頁摘要。這個功能如果要算導入成功,不能只問模型摘要和原始病歷的一致率。我會先看三件事:符合條件的交班病例中,實際開啟並完成閱讀的比例;醫師修改或否決摘要的比例;遇到資料衝突、缺漏或高風險警訊時,系統有沒有把案件送回人工處理。
最後一項尤其重要。臨床流程裡最危險的,往往是報告看起來很順,卻把一個關鍵例外藏掉。像是肌酐突然上升,但病人剛好轉床,資料還沒同步;或病歷裡寫著「無藥物過敏」,護理紀錄卻出現新的過敏反應。這些情況不能靠使用者自己多小心來補洞,系統要有明確的 exception handling,也要讓人知道哪一段資料沒有被納入。
病歷撰寫也是類似情形。AI 可以先把住院經過整理成草稿,減少住院醫師在凌晨一點複製貼上的時間,但最後簽名的人仍然要能辨認哪些句子是原始資料、哪些是模型推論。責任邊界要寫進介面和訓練,不是等出事後才回頭找 audit log。病人安全需要的不只是一句「AI 僅供參考」,還要明確寫下誰覆核、覆核什麼,以及什麼條件必須升級給主治醫師,並留下可追蹤的紀錄。
所以醫院評估導入時,我會建議做一張每週 workflow dashboard,至少追蹤四個指標:符合條件任務的使用率、人工覆核完成率、例外案件比例,以及從 AI 建議到人工確認的時間。再把這些數字按科別和班別拆開看。總使用率 70%,可能是白班主治醫師在用,夜班住院醫師完全繞過系統,平均值會掩蓋風險。
9,480 個 tasks 和 12 個 applications 讓我們看到規模化運作的可能,但醫院真正要問的是,這 9,480 次有多少次改變了決策,有多少次只是多開了一個畫面。AI 進入工作流程的證據,在於它能穩定減少重複勞動,同時保留人工判斷和安全煞車,而非只有登入紀錄。這才是 change management 最後要交的成績單。
作者:陳逸 Dr.