DGX 實測 Qwen 3.8 27B 推理引擎比較(vLLM+MTP vs SGLang)
- URL: https://www.facebook.com/share/p/18z3Tm4FKH/
- Date Saved: 2026-08-15
- Source: Facebook (胡嘉璽)
- Tags: local-llm, ai-engineering
Summary
在 DGX 上測試 Qwen 3.8 27B 不同推理引擎的速度比較:
問題背景
- 官方 FP8 模型 8-11 token/s
- SGLang 官網宣稱 38 t/s,實測只有 13 t/s,且不支援 MTP
vLLM + MTP 實測結果(max_num_seqs=4)
| 併發數 | 聚合吞吐 | 單流均攤 |
|---|---|---|
| 1 | 21~23.5 t/s | 21~23.5 t/s |
| 2 | 31.2 t/s | 15.6 t/s |
| 4 | 54.6 t/s | 13.7 t/s |
對比分析
- 4 併發:vLLM+MTP 54.6 t/s vs SGLang(無MTP)48.6 t/s → MTP 快約 12%
- 單流:vLLM+MTP 21+ t/s vs SGLang 13.3 t/s → MTP 優勢明顯
- 8 併發:SGLang 可達 88.1 t/s,反超 vLLM+MTP
結論
- 互動場景(1-2人):vLLM+MTP 完勝(單流 21+ vs 13.3 t/s)
- 高併發批次:SGLang 反而更好(MTP 在大 batch 下優勢趨近於零)
- 原因:大 batch 已攤分權重掃描成本,speculative decoding 的「填滿頻寬」優勢變小,draft 驗證反而搶佔計算資源