看 MoE 模型不能只看參數總量
最近 Mistral Large 4 預覽版最吸睛的數字,是 1 trillion parameters。但模型每次生成 token,實際啟用的只有 49 billion parameters。若把總參數直接當成能力或效率,判讀很容易失真。
先拆開三個數字
Mistral Large 4 採用 MoE,1 trillion 是總參數,49 billion 是每 token 的 active parameters。總參數影響儲存、分散式部署與可容納的能力類型,active parameters 則更接近單 token 的計算量與延遲。
但 active parameters 也不等於實際吞吐。MoE 還要靠 router 選 expert,並在 GPU 之間搬運 activation。小 batch 或跨節點請求可能讓通訊與排程成本吃掉省下的算力。看規格時,我會追問三件事:單 token FLOPs、推理 tokens per second,以及成本是按單次請求還是整批工作計算。
3,800 張 GPU 的訊息
官方表示,模型使用 3,800 張 NVIDIA Grace Blackwell GPU 訓練。這個數字提醒我們,模型品質同時受資料、訓練配方、平行化工程與硬體影響。未來 open weights 釋出後,若只用一台機器跑一次,就宣稱模型效率高低,結果可能只反映顯存、quantization、batch size 和 expert offloading 設定。
Benchmark 要放進座標系
Simon Willison 提到,Mistral Large 4 的 Artificial Analysis 分數是 38,落後 552B 的 DeepSeek 4.1 Flash,卻遠高於 Mistral Large 3 的 9 分。我的解讀是,Large 4 用 49B active parameters 把上一代品質推進一大截,這是效率改善的訊號,還不足以直接推出更低成本或更高吞吐。
我看 MoE 發布會分四層:第一層是品質與 benchmark 任務是否接近真實工作;第二層是 active parameters 和每 token 計算量;第三層是吞吐、延遲、顯存與跨卡通訊;第四層是部署後每百萬 token 成本。等 open weights 與推理框架成熟,再用相同 prompt、量化與 batch size 比較品質和 tokens per second,才有資格談模型效率。參數總量適合當標題,不能單獨當結論。
作者:十年大博士