Threads (@chihyu.yeh)
local-llm
Original source

DGX Spark 跑 Qwen 3.6 35B MoE 達 110 tok/s

Summary

@chihyu.yeh 分享 DGX Spark 跑 Qwen 3.6 35B-A3B MoE (NVFP4) 的實測結果。

實測數據

  • 模型:Qwen3.6-35B-A3B-NVFP4-Fast (unsloth 量化版)
  • 硬體:DGX Spark(單機)
  • Decode 速度:110 tokens/second
  • 對比:從 Qwen 3.6 27B 換成 35B MoE 後速度大幅提升

評論補充

  • 5090 跑同模型達 240+ tok/s
  • FP8 版本也值得推薦
  • 作者是最早一批買的,花了 13.5 萬台幣(現在二十幾萬)

觀點

  • 硬體要先買,模型會跟上
  • 硬體設計時會把未來幾年模型趨勢方向設計進去
  • MoE 架構(35B 總參數但只激活 3B)非常適合推理硬體

模型連結