Facebook (胡嘉璽)
local-llmai-engineering
Original source

DGX 實測 Qwen 3.8 27B 推理引擎比較(vLLM+MTP vs SGLang)

Summary

在 DGX 上測試 Qwen 3.8 27B 不同推理引擎的速度比較:

問題背景

  • 官方 FP8 模型 8-11 token/s
  • SGLang 官網宣稱 38 t/s,實測只有 13 t/s,且不支援 MTP

vLLM + MTP 實測結果(max_num_seqs=4)

併發數聚合吞吐單流均攤
121~23.5 t/s21~23.5 t/s
231.2 t/s15.6 t/s
454.6 t/s13.7 t/s

對比分析

  • 4 併發:vLLM+MTP 54.6 t/s vs SGLang(無MTP)48.6 t/s → MTP 快約 12%
  • 單流:vLLM+MTP 21+ t/s vs SGLang 13.3 t/s → MTP 優勢明顯
  • 8 併發:SGLang 可達 88.1 t/s,反超 vLLM+MTP

結論

  • 互動場景(1-2人):vLLM+MTP 完勝(單流 21+ vs 13.3 t/s)
  • 高併發批次:SGLang 反而更好(MTP 在大 batch 下優勢趨近於零)
  • 原因:大 batch 已攤分權重掃描成本,speculative decoding 的「填滿頻寬」優勢變小,draft 驗證反而搶佔計算資源