DGX Spark 完整部署 MiniMax-H3 官方全权重实操教程
- URL: https://mp.weixin.qq.com/s/XwvtM2b4sKS9vbicjDPxXA
- Date Saved: 2026-08-12
- Source: WeChat (GPUS开发者)
- Tags: local-llm, creative-ai
Summary
在单台 NVIDIA DGX Spark(GB10, 128GB统一内存)上完整运行 MiniMax-H3(海螺3.0)全模态影音生成模型的实操指南。
MiniMax-H3 模型概况
- 33.1B 单流全模态 Diffusion Transformer
- 文本/视觉编码器基于 Qwen3-VL-32B
- 输出:最长15秒、24fps、原生32kHz立体声音频MP4
- 两个权重分区:FL2VA(文生视频)、Ref2VA(参考图生视频)
- BF16 全权重约 128.4GB(DiT 66.3GB + Qwen3-VL 51.5GB + VAE 10.6GB)
DGX Spark 踩坑
官方三条路线全部失败:
- SGLang Diffusion — 无 SM121 适配内核
- BF16 + CPU 卸载 — GB10 CPU/GPU 共享统一内存池,卸载无法省内存,直接OOM
- 官方量化 — FP8不支持,INT8在SM121有兼容bug
可行方案:社区 FP8 补丁
GitHub: joeynyc/MiniMax-H3-DGX-Spark
核心修复:
- QKV 分组权重维度标准化适配 SM121
- FP8 激活量化器绑定 SM121 原生 CUDA 算子
- AdaLN 线性层转 FP8,激活值保留 BF16 保画质
- 6个数值敏感投影层强制不量化
实测性能
- 内存占用:加载峰值 89GiB,推理峰值约 93GB
- 生成速度(768×448, 24fps, 15秒):150-160秒
- 冷启动加载:约9分钟
双机并行加速
两台 DGX Spark 通过 RoCEv2 直连 + Ray 分布式:
- 基础并行:65-69秒(提速2.3x)
- cuDNN区域编译:46.6秒
- Cache-DiT缓存优化:30.6秒
注意事项
- MiniMax 社区许可证排除美/欧盟/英/韩
- 运行时占满128GB,不可同时开其他大模型
- ComfyUI 量化版(42.5GB)可共存但不能同时运行,适合日常创作