AI 會解題 不代表它真的會學
今天在 HN 上看到一篇很有意思的技術文章:作者從零訓練一個小 transformer,在 5090 上跑 1.5 小時,成本大概 67 美分,ARC-AGI-1 public eval 做到 44%。標題很容易被讀成「小模型打敗很多 LLM」,但我覺得真正值得談的是另一件事:AI 到底怎麼學會一個新規則?
ARC 這類題目對老師來說很熟悉。它不是考你背過多少知識,而是給你幾組 input-output grid,請你找出背後規則,再套到新題目。學生寫這種題目的時候,通常不是把所有答案記下來,而是在很少的例子裡抓結構,像顏色怎麼變、位置怎麼移、形狀怎麼重組。
作者關心的 sample efficiency,其實就是這件事。現在很多大型模型很強,但它們常常靠大量 pretraining、post-training 和 synthetic data,把某種題型看過非常多次。這當然有效,可是從教育角度看,這比較像大量刷題後變熟,不一定代表理解能力變強。
這篇有趣的地方在於,作者試著讓一個小 transformer 在很低成本下,靠 test-time training、3D RoPE、per-task embedding、資料增強和比較現代的訓練細節,直接在少量題目裡學規則。Ablation 也很明確,拿掉 3D RoPE 或每題自己的 embedding,成績會大幅掉到二十幾趴。換句話說,它不是魔法,而是把「題目中的位置關係」和「每一題自己的語境」編碼得比較好。
我覺得這對 AI 素養很重要。很多學生現在看模型答對,就以為模型懂了。但在教學現場,我們更在乎的是它怎麼答對:是看過類似題庫?是靠提示一步步推?還是真的能從少量例子歸納規則?這三件事對學習的意義完全不同。
HN 討論裡也有人質疑這是不是 overfitting 或 benchmaxxing。這個爭議本身就很適合拿來教學生理解 benchmark。作者沒有訓練在 test labels 上,但它確實高度針對 ARC 的任務形式設計。這不一定是作弊,可是提醒我們,任何分數都要問清楚評量條件。考試分數不是能力本身,只是某個規則下的表現。
所以我不會把這篇解讀成「小模型終於贏過大模型」。我更想把它放在課堂上問學生:如果一個系統能用很少資料學會規則,這算不算理解?如果它只在某種題型上有效,我們該怎麼描述它的能力邊界?
AI 教育最需要的也許不是教大家追最新模型,而是練習看懂這種差別。會解題、會刷題、會學習,三者很像,但不能混在一起。
作者:Oliver 老師