看到一個超扯 demo 就說這模型強,你的 eval 太便宜了
pelican 騎腳踏車這個梗你一定看過
就是那種 AI 畫圖的示範,pelican 的腳有踩到踏板,腳踏車比例也對,整張圖看起來不違和。在 AI 生成圖片的世界裡這算難題,因為動物姿態加上物件互動,模型很容易出錯。然後這種圖開始在各地流傳,有人說「某某模型這個很強」,有人說「這表示它真的理解空間關係了」。
然後就有人真的去測了
Dylan Castillo 做了一個有系統的測試。8 種動物 x 6 種交通工具,48 個組合,每個 prompt 跑 3 次,一共測了 7 個模型,另外還拉了 GPT-5.6 Luna 和 Gemini 3.1 Flash-Lite 幫忙評估。Simon Willison 把結果整理出來分析。
結論是什麼
pelican 沒有比其他動物畫得好。腳踏車也沒有比其他交通工具畫得好。兩個組合在一起也沒有顯著優勢。GLM-5.2 在那一格表現最接近,但 effect size 小,統計上不顯著。
換句話說那個爆紅的 pelican 騎腳踏車圖,根本就不是因為模型被特別訓練過。可能只是你剛好看到那一次的成功,然後大腦說「啊這個模型真的懂」。
問題是絕大多數人就是這樣在判斷模型能力的
我自己也這樣幹過。某次看到有人貼了一張 AI 生成的建築圖,細節超精緻,窗框比例全對,連陰影都有方向感。我直接跑去試同個 prompt,結果我的版本歪七扭八,窗戶長在牆壁外面,整棟樓像喝醉。
所以那個讓我驚艷的圖,到底是真的能力還是那幾次裡跑出來最好的那一次。根本不知道。
這就是單一 demo 最大的問題。你看到的是「模型最好的時刻」,不是它的平均表現。
demo 選的 prompt 本來就有偏差
pelican 這個梗開始流傳,是因為有人找到「剛好這個組合表現不錯」的例子拿出來秀。不是因為跑了 48 個 prompt 之後算了一個平均分數給你看。是因為人類天生會記住那個最好的結果然後分享出去。
這在 AI 評測裡叫 cherry-picking。不是說那些發圖的人都在騙人,而是人類的注意力本來就是這樣運作的,看到驚豔的截圖,看到普通的划走。
你可以土炮但有效的做法是這樣
想判斷一個模型在某件事上是不是真的穩,跑至少 5 次一樣的 prompt,然後把全部結果都看一遍。不是只看最好的那次。
因為很多時候你會發現,那個「神奇的結果」可能是一個分母很小的事件。5 次裡只出現 1 次,那其實沒什麼用。5 次裡有 4 次都不錯,那才算某種程度的穩定。
48 prompts x 3 次這個設計就是在做這件事。不是看一個最強的 case,而是看 distribution。GLM-5.2 那格最接近,但 n=3 的重複跑下 effect size 站不住腳,這個「差異」其實根本不算差異。
下次再看到「AI 完成了不可能任務」的 demo,可以先問自己幾個問題
這是他們跑了幾次之後截圖貼出來的。這個任務換個 seed 之後還能重現嗎。有沒有對照組,比如其他模型跑同樣 prompt 是什麼結果。
不是要懷疑所有的 demo,而是「一個爆紅的 case」跟「模型在這個能力上穩定」,中間差了好幾個量級。
AI 業者很清楚這件事 www
所以他們才會在發布時選最能說明能力的例子,配上一個精心挑選的 benchmark 數字,看起來像全面評估,但你根本不知道那些數字是怎麼來的。pelican 那個梗現在已經成了這個現象的縮影,是有原因的。
評估一個模型值不值得用,不是看那個最閃的瞬間,是看它在你實際任務上的平均表現。說起來很廢話,但絕大多數人在換工具的時候不是這樣決定的 XD
作者:島民No.9527