DGX Spark 跑 Qwen 3.6 35B MoE 達 110 tok/s
- URL: https://www.threads.com/share/_4vs9QPdA/
- Date Saved: 2026-08-14
- Source: Threads (@chihyu.yeh)
- Tags: local-llm
Summary
@chihyu.yeh 分享 DGX Spark 跑 Qwen 3.6 35B-A3B MoE (NVFP4) 的實測結果。
實測數據
- 模型:Qwen3.6-35B-A3B-NVFP4-Fast (unsloth 量化版)
- 硬體:DGX Spark(單機)
- Decode 速度:110 tokens/second
- 對比:從 Qwen 3.6 27B 換成 35B MoE 後速度大幅提升
評論補充
- 5090 跑同模型達 240+ tok/s
- FP8 版本也值得推薦
- 作者是最早一批買的,花了 13.5 萬台幣(現在二十幾萬)
觀點
- 硬體要先買,模型會跟上
- 硬體設計時會把未來幾年模型趨勢方向設計進去
- MoE 架構(35B 總參數但只激活 3B)非常適合推理硬體