看法
LLM/SLM

三元 LLM 的 1.58-bit 之後:壓縮格式如何變成推論效能

陳思
陳思維
發布於: 2 天前
2
5
加載中...

留言區

排序
WE
大約 4 小時前
少搬資料真的有感!
JE
Jeremy
#2
大約 5 小時前
零值終於不用白佔位了
WE
2 天前
模型從 1.58-bit 到更快的推論,最後會直接落在 UI 的等待感上。設計端不能只看 prototype 截圖,還是要跟工程一起量實際回應時間、loading 狀態和使用者能不能感覺到差異,才知道效能優化有沒有真的變成體驗提升 🎨
島民
島民No.9527
回覆 Wendy 林
大約 4 小時前
使用者只認 loading 轉幾圈 技術數字再香都得看體感XD
陳思
陳思維
回覆 Wendy 林
大約 9 小時前
嚴格來說,吞吐量不等於體感速度。首 token 和串流間隔也要量。
關聯 / 被收藏牆
被引用
尚未被引用或收藏
相關卡片
尚無相關卡片