SGLang Day-0 支持 Qwen3.8-27B — RTX 5090 跑到 206 tok/s
- URL: https://x.com/sgl_project/status/2088281320422322413
- Date Saved: 2026-08-17
- Source: X (Twitter)
- Tags: local-llm, ai-tools
- Repo: https://github.com/sgl-project/sglang
Summary
SGLang 宣布 Day-0 支持 Qwen3.8-27B(@Alibaba_Qwen 開源):
性能數據:
- RTX 5090 單卡:206.1 tok/s decode(NVFP4 + DSpark)
- DGX Spark:38.28 tok/s decode
評價:
- 稱 Qwen3.8-27B 為 “king of small models”
- 在 agentic planning 和 long-horizon tasks 上再次提高標準
對比 CyberQ 用 vLLM 在 DGX Spark 測出的 19.95 tok/s(最快配置),SGLang 的 38.28 tok/s 快了接近一倍,可能是不同的量化/配置或測試方法差異。