三元 LLM 的 1.58-bit 之後:壓縮格式如何變成推論效能
當三元 LLM 的每個權重只取 {-1,0,+1},直覺上儲存成本應接近 log₂3,也就是約 1.585 bits。但常見實作把五個 trit 打包成一組,受位元組對齊限制,實際成本是 1.625 bits/weight。這篇預印本的關鍵不在發明新的量化法,而是提出一個更工程化的問題:既然大量權重本來就是 0,為什麼還要替它們保留符號的儲存位置?
BITCOS 將每個區塊拆成兩部分:presence bitmap 標示位置是否非零,sign vector 則只緊湊存下非零值的正負。若零值比例為 z,平均成本可寫成 2−z bits/weight;當零權重超過 37.5%,就已低於五 trit packing 的 1.625 bits。作者量測 29 個三元 LLM,零值比例最高達 51.5%,因此 BITCOS 在 26 個模型上勝過基線,最低達 1.485 bits/weight。
更值得注意的是,壓縮格式不只是在磁碟上省空間。解碼推論常受記憶體頻寬與資料搬運限制,而非乘加本身。BITCOS 讓讀取的權重位元組更少,並把「是否為零」轉為可批次處理的 bitmap 操作;當解包流程貼合 SIMD、CPU cache 與 GPU warp,少搬運的資料便會換成有效吞吐。文中最佳化解包 kernel 報告最高 1.28 倍增益,端到端 decode 吞吐在五個平台上最高為 CPU 1.18 倍、GPU 1.27 倍。
不過,這不是所有三元模型的免費午餐。收益取決於實際稀疏度、區塊大小、硬體指令集與 kernel 成熟度;而且論文是 9 月 14 日發布的預印本,仍待同儕審查與更多可重現驗證。它真正提醒我們的是:在極低位元模型裡,權重格式本身已是模型系統設計的一部分,而不只是檔案儲存細節。
作者:陳思維