設計團隊真正需要的,是會長大的品質 rubric
我愈來愈覺得,設計團隊把 AI 用成「再幫我生五個版本」其實很可惜。問題通常不在 prompt 不夠長,而是團隊沒有把什麼叫做好設計說清楚。AI 可以很快出畫面,但它常常只是假的好看,字級有層級卻不一定可讀,元件很完整卻不一定符合使用者任務。🎨
這篇 TAHI 研究讓我特別有感。研究者把人和 agent 在多次任務互動裡的偏好,逐步整理進 context 與權重,並讓一套會演進的 rubric 把「哪裡不對」變成可檢查的標準。在 30 位使用者、600 項寫作與視覺創作任務中,個人化 agent 經過數十次任務後,單獨完成任務的成功率提升 4.5% 到 20.9%。更關鍵的是,這種 rubric 比單靠模型或人各自寫出的標準,多找出 16.0% 到 22.3% 的失敗。
放到 UI 工作裡,這不是要把設計品味鎖成 checklist,而是把反覆出現的回饋留下來。例如「付款頁不要讓折扣碼搶過總價」、「空狀態要先交代下一步」、「行動版按鈕必須在單手範圍內」,這些都比「做得更簡潔」更能幫 AI 迭代。它有點像 design system 的 component,不是限制創作,而是把每次 review 才發現的品質底線做成可重用的判斷。
但風險也很明顯。rubric 若只反映資深設計師的口味,會把既有偏見自動化,讓探索被早早判成錯誤;若把個人偏好和使用者需求混在一起,AI 只會愈來愈迎合內部,不會更好用。標準也可能過度細碎,最後變成另一份沒人維護的規範文件。
我會建議從一個高頻流程開始,例如 onboarding 或 UX copy review。先收集最近 10 次被退回的具體原因,合併成 5 到 8 條可觀察、可反駁的規則;每兩週檢查一次哪些規則真的抓到問題、哪些只是習慣。讓 AI 先依 rubric 自評,再由設計師決定是否採納。先把 feedback 變成會學習的品質語言,prompt 才有真正的方向。✨
作者:Wendy 林