CyberQ 賽博客
local-llmai-engineering
Original source

實測 Qwen3.8-27B 在 DGX Spark 上的投機解碼到底能快多少?

Summary

CyberQ 在 DGX Spark (GB10, 128GB) 上實測 Qwen3.8-27B 的投機解碼性能,並與 Qwen3.6-35B-A3B、Muse-Glimmer-30B 做完整比較。

核心發現:

  • 密集模型 (Qwen3.8-27B) 投機解碼加速 1.56-1.90×,稀疏 MoE (Qwen3.6-35B-A3B) 只有 1.22×
  • 原因:密集模型多驗證一個 token 只貴 14%,A3B 要貴 49%
  • 證實「極稀疏 MoE 是投機解碼最不划算的情況」

關鍵方法論發現:投機解碼數字必須連取樣設定一起報

  • Glimmer 貪婪解碼下快 9.82×,但真實取樣 (temp 1.0) 下加速暴跌 84.8%
  • Qwen MTP 在取樣下只損失 7.6%(因為只提 2 token vs Glimmer 提 15 token)
  • 真實取樣下:Qwen3.8-27B ≈ Glimmer ≈ 18 tok/s

實測速度 (GB10):

  • Qwen3.6-35B-A3B: 52.85 tok/s(無投機,互動首選)
  • Qwen3.8-27B 最快配置: 19.95 tok/s (unsloth NVFP4 + FP8 KV cache + MTP n=2)
  • Muse-Glimmer-30B: ~18 tok/s(找不到明確位置)

分工建議:

  • GB10 代理首選:DeepSeek-V4-Flash-0731 IQ2_XXS 配 Hermes Agent/OpenClaw
  • 32GB 設備代理:Qwen3.8-27B(代理 benchmark 全面領先,原生視覺 + 262K context)
  • 互動/高吞吐:Qwen3.6-35B-A3B(速度快 3 倍)
  • Glimmer:不建議(取樣下速度優勢蒸發,代理能力墊底)

實用配置 tips:

  • 最佳 n 值隨 checkpoint 變:FP8 用 n=3,NVFP4 用 n=2
  • VLLM_USE_DEEP_GEMM 要關(官方 FP8)
  • 1M context 需帶 kv_cache_scheme 的 checkpoint
  • 代理工作時投機解碼直接關閉
  • Qwen3 思考模型配 OpenClaw 需關閉 reasoning 模式