WeChat (宽恒科技)
local-llm
Original source

单机最高 35token/s!DGX Spark 深度优化 DeepSeek-V4-Flash 部署方案

Summary

在单台 DGX Spark(GB10 Blackwell, 128GB统一内存)上运行 284B 参数 DeepSeek-V4-Flash MoE 模型的深度优化方案 ds4-on-spark。

五大核心优化

  1. 自适应投机解码 → 最高 35 token/s

    • 轻量草稿模型预生成候选 token,主模型批量校验
    • 结构化任务(数学/问答/代码)27-35 tok/s,原生基线 20 tok/s,提速1.38x
    • 动态开关:实时检测加速收益,无效时自动关停(避免传统固定投机解码暴跌至0.72x)
  2. Agent 工具调用批量加速 → 耗时-27%

    • tool-eval-bench 总耗时 50min→37min
    • Hermes 智能体框架无缝适配,多Agent并行无阻塞
  3. 单机 766K 总上下文

    • 518K 主Agent + 248K 子Agent并发
    • 250K 首次预填充13分钟,前缀缓存后二次交互1-2秒
    • 大海捞针测试:250K/500K 全通过
  4. 全栈精细化调优

    • 量化内核、调度器、KV缓存、服务层数百处迭代,逼近硬件物理极限
  5. 2-bit 专家量化解决显存问题

    • 原版 4-bit 权重超140GB,128GB内存放不下
    • 2-bit 专家量化:模型权重81GB(完整约91GB),单机可跑

部署

一键安装:

curl -sSL https://raw.githubusercontent.com/entrpi/ds4-on-spark/main/install.sh | bash -s -- --start
  • GitHub: github.com/Entrpi/ds4-on-spark
  • 推理引擎: github.com/Entrpi/ds4
  • 草稿模型: huggingface.co/bleysg/DeepSeek-V4-Flash-DSpark-drafter-GGUF
  • 底层基于 antirez/ds4 引擎,技术思路与 Modal DFlash 同源

注意事项

  • 投机解码对代码/数学/事实问答提升大,创意写作无明显增益
  • 2-bit 量化非无损,极致精度需求建议4-bit分流部署
  • 仅限 DGX Spark(GB10),其他GPU未做内核适配