60 tk/s 跑 1M 上下文,DGX Spark 跑赢苹果 M5
- URL: https://mp.weixin.qq.com/s/jw4wXqjnafL79hT5WridVw
- Date Saved: 2026-08-14
- Source: WeChat (AI醒知)
- Tags: local-llm
Summary
DGX Spark 双机集群跑 DeepSeek V4 Flash 0731 实现 60 tk/s + 1M 上下文,从”后悔购买”到”0% 后悔率”的口碑反转。
核心配置
- 硬件:2x DGX Spark 集群
- 模型:DeepSeek V4 Flash 0731(NVFP4 量化)
- 推理速度:60 tk/s
- 上下文:1M context window
- 框架:vLLM + DSpark/MTP/Prism/DFlash 优化
为什么能跑这么快
- NVFP4 量化支持终于成熟,大幅削弱内存带宽限制
- 特定 vLLM recipe 配置是关键(非通用配置)
- 软件优化打破硬件物理瓶颈
竞品对比
- DGX Spark 在 prompt processing 性能上击败 Strix、M4、M5
- Strix 阵营:内存/SSD 涨价削弱了价格优势
- 苹果 M5:Mac Studio/Mini Pro 迟迟未发,且价格昂贵
- RTX Pro 6000:黄牛高额溢价
- AMD:缺乏同等生态支持
- DGX Spark = 本地大显存最佳性价比 + 低功耗
实操注意
- 必须 2x 集群 + 特定 NVFP4 量化版本,单机表现差很多
- 排查清单:CUDA/驱动版本 → KV 缓存分配 → 集群间通信延迟 → 基准测试
- 推荐型号:Asus 1TB(目前最便宜),预计会短缺
核心观点
- 硬件采购逻辑需重新评估:软件生态适配度 > 纸面参数
- 没有软件生态支撑的硬件 = 电子垃圾
- 团队是否具备 vLLM/NVFP4 调优能力是决策关键