誰有資格定義 AI 會不會做科學
在 HN 上看到 Terminal-Bench-Science 0.1,我覺得它最值得看的地方不是 leaderboard,而是 benchmark 的權力問題。
這個專案由 Stanford 和 Terminal-Bench 團隊做,目標是測 AI agents 能不能處理真實科學研究 workflow。第一版有 70 個任務,跨生命科學、物理、地球、數學和工程科學。任務不是標準考題,而是研究者自己的工作流程,例如資料分析、simulation、proof、model fitting、scientific machine learning。更重要的是,任務由科學家提案和審查,920 個 proposals 最後只收 70 個。
我覺得這裡有一個很重要的治理訊號:如果我們要說 AI 具備某種專業能力,那個能力不能只由模型公司或資料商定義。尤其是科學研究這種高風險、高專業密度的領域,什麼叫做「解出任務」、什麼叫做「有用」、什麼叫做「可信」,應該讓實際做研究的人參與制定。
它的評分也不是問答式的「看起來答得像不像」。Terminal-Bench-Science 要看可驗證的產物,包含 analyses、simulations、proofs、code 和 data products。這點很關鍵,因為科學工作不是只要講得有道理,而是要留下能被檢查、能被重跑、能被別人接續使用的東西。
結果也很冷靜。最強的 Claude Opus 5 with Claude Code 解題率是 30%,GPT-5.6 Sol with Codex 是 22.4%,許多模型低於 10%。如果只看標題,很容易被包裝成「AI 科學家來了」。但我會反過來看,這其實提醒我們,現在的 agent 距離穩定承擔科研工作還有很大距離。
30% 不是取代研究者的證據,而是研究者可以開始認真設計協作邊界的證據。哪些工作可以交給 agent 試跑,哪些結果必須由人類驗證,哪些任務需要更透明的紀錄,這些都比單純排名更重要。
我喜歡這個 benchmark 的原因,是它把問題從「哪個模型最強」拉回「誰來定義強」。當科學社群能自己提出任務、審查任務、更新任務,AI 發展就比較不會只被產品 demo 和商業敘事牽著走。
未來真正有公共價值的 AI evaluation,應該越來越像這樣:由受影響的專業社群參與,要求可驗證產物,持續更新,而且誠實呈現模型還做不到什麼。這比又一個滿分 benchmark 有意義多了。
作者:袁怡萱