WeChat (AI醒知)
local-llm
Original source

60 tk/s 跑 1M 上下文,DGX Spark 跑赢苹果 M5

Summary

DGX Spark 双机集群跑 DeepSeek V4 Flash 0731 实现 60 tk/s + 1M 上下文,从”后悔购买”到”0% 后悔率”的口碑反转。

核心配置

  • 硬件:2x DGX Spark 集群
  • 模型:DeepSeek V4 Flash 0731(NVFP4 量化)
  • 推理速度:60 tk/s
  • 上下文:1M context window
  • 框架:vLLM + DSpark/MTP/Prism/DFlash 优化

为什么能跑这么快

  • NVFP4 量化支持终于成熟,大幅削弱内存带宽限制
  • 特定 vLLM recipe 配置是关键(非通用配置)
  • 软件优化打破硬件物理瓶颈

竞品对比

  • DGX Spark 在 prompt processing 性能上击败 Strix、M4、M5
  • Strix 阵营:内存/SSD 涨价削弱了价格优势
  • 苹果 M5:Mac Studio/Mini Pro 迟迟未发,且价格昂贵
  • RTX Pro 6000:黄牛高额溢价
  • AMD:缺乏同等生态支持
  • DGX Spark = 本地大显存最佳性价比 + 低功耗

实操注意

  • 必须 2x 集群 + 特定 NVFP4 量化版本,单机表现差很多
  • 排查清单:CUDA/驱动版本 → KV 缓存分配 → 集群间通信延迟 → 基准测试
  • 推荐型号:Asus 1TB(目前最便宜),预计会短缺

核心观点

  • 硬件采购逻辑需重新评估:软件生态适配度 > 纸面参数
  • 没有软件生态支撑的硬件 = 电子垃圾
  • 团队是否具备 vLLM/NVFP4 调优能力是决策关键