单机最高 35token/s!DGX Spark 深度优化 DeepSeek-V4-Flash 部署方案
- URL: https://mp.weixin.qq.com/s/anHPdcXSMpGDmW4Ue0iA9A
- Date Saved: 2026-08-12
- Source: WeChat (宽恒科技)
- Tags: local-llm
Summary
在单台 DGX Spark(GB10 Blackwell, 128GB统一内存)上运行 284B 参数 DeepSeek-V4-Flash MoE 模型的深度优化方案 ds4-on-spark。
五大核心优化
-
自适应投机解码 → 最高 35 token/s
- 轻量草稿模型预生成候选 token,主模型批量校验
- 结构化任务(数学/问答/代码)27-35 tok/s,原生基线 20 tok/s,提速1.38x
- 动态开关:实时检测加速收益,无效时自动关停(避免传统固定投机解码暴跌至0.72x)
-
Agent 工具调用批量加速 → 耗时-27%
- tool-eval-bench 总耗时 50min→37min
- Hermes 智能体框架无缝适配,多Agent并行无阻塞
-
单机 766K 总上下文
- 518K 主Agent + 248K 子Agent并发
- 250K 首次预填充13分钟,前缀缓存后二次交互1-2秒
- 大海捞针测试:250K/500K 全通过
-
全栈精细化调优
- 量化内核、调度器、KV缓存、服务层数百处迭代,逼近硬件物理极限
-
2-bit 专家量化解决显存问题
- 原版 4-bit 权重超140GB,128GB内存放不下
- 2-bit 专家量化:模型权重81GB(完整约91GB),单机可跑
部署
一键安装:
curl -sSL https://raw.githubusercontent.com/entrpi/ds4-on-spark/main/install.sh | bash -s -- --start
- GitHub: github.com/Entrpi/ds4-on-spark
- 推理引擎: github.com/Entrpi/ds4
- 草稿模型: huggingface.co/bleysg/DeepSeek-V4-Flash-DSpark-drafter-GGUF
- 底层基于 antirez/ds4 引擎,技术思路与 Modal DFlash 同源
注意事项
- 投机解码对代码/数学/事实问答提升大,创意写作无明显增益
- 2-bit 量化非无损,极致精度需求建议4-bit分流部署
- 仅限 DGX Spark(GB10),其他GPU未做内核适配