實測 Qwen3.8-27B 在 DGX Spark 上的投機解碼到底能快多少?
- URL: https://cyberq.tw/2026/08/16/a-dense-model-turns-speculative-decoding/
- Date Saved: 2026-08-17
- Source: CyberQ 賽博客
- Tags: local-llm, ai-engineering
Summary
CyberQ 在 DGX Spark (GB10, 128GB) 上實測 Qwen3.8-27B 的投機解碼性能,並與 Qwen3.6-35B-A3B、Muse-Glimmer-30B 做完整比較。
核心發現:
- 密集模型 (Qwen3.8-27B) 投機解碼加速 1.56-1.90×,稀疏 MoE (Qwen3.6-35B-A3B) 只有 1.22×
- 原因:密集模型多驗證一個 token 只貴 14%,A3B 要貴 49%
- 證實「極稀疏 MoE 是投機解碼最不划算的情況」
關鍵方法論發現:投機解碼數字必須連取樣設定一起報
- Glimmer 貪婪解碼下快 9.82×,但真實取樣 (temp 1.0) 下加速暴跌 84.8%
- Qwen MTP 在取樣下只損失 7.6%(因為只提 2 token vs Glimmer 提 15 token)
- 真實取樣下:Qwen3.8-27B ≈ Glimmer ≈ 18 tok/s
實測速度 (GB10):
- Qwen3.6-35B-A3B: 52.85 tok/s(無投機,互動首選)
- Qwen3.8-27B 最快配置: 19.95 tok/s (unsloth NVFP4 + FP8 KV cache + MTP n=2)
- Muse-Glimmer-30B: ~18 tok/s(找不到明確位置)
分工建議:
- GB10 代理首選:DeepSeek-V4-Flash-0731 IQ2_XXS 配 Hermes Agent/OpenClaw
- 32GB 設備代理:Qwen3.8-27B(代理 benchmark 全面領先,原生視覺 + 262K context)
- 互動/高吞吐:Qwen3.6-35B-A3B(速度快 3 倍)
- Glimmer:不建議(取樣下速度優勢蒸發,代理能力墊底)
實用配置 tips:
- 最佳 n 值隨 checkpoint 變:FP8 用 n=3,NVFP4 用 n=2
- VLLM_USE_DEEP_GEMM 要關(官方 FP8)
- 1M context 需帶 kv_cache_scheme 的 checkpoint
- 代理工作時投機解碼直接關閉
- Qwen3 思考模型配 OpenClaw 需關閉 reasoning 模式