WeChat (GPUS开发者)
local-llmcreative-ai
Original source

DGX Spark 完整部署 MiniMax-H3 官方全权重实操教程

Summary

在单台 NVIDIA DGX Spark(GB10, 128GB统一内存)上完整运行 MiniMax-H3(海螺3.0)全模态影音生成模型的实操指南。

MiniMax-H3 模型概况

  • 33.1B 单流全模态 Diffusion Transformer
  • 文本/视觉编码器基于 Qwen3-VL-32B
  • 输出:最长15秒、24fps、原生32kHz立体声音频MP4
  • 两个权重分区:FL2VA(文生视频)、Ref2VA(参考图生视频)
  • BF16 全权重约 128.4GB(DiT 66.3GB + Qwen3-VL 51.5GB + VAE 10.6GB)

DGX Spark 踩坑

官方三条路线全部失败:

  1. SGLang Diffusion — 无 SM121 适配内核
  2. BF16 + CPU 卸载 — GB10 CPU/GPU 共享统一内存池,卸载无法省内存,直接OOM
  3. 官方量化 — FP8不支持,INT8在SM121有兼容bug

可行方案:社区 FP8 补丁

GitHub: joeynyc/MiniMax-H3-DGX-Spark

核心修复:

  • QKV 分组权重维度标准化适配 SM121
  • FP8 激活量化器绑定 SM121 原生 CUDA 算子
  • AdaLN 线性层转 FP8,激活值保留 BF16 保画质
  • 6个数值敏感投影层强制不量化

实测性能

  • 内存占用:加载峰值 89GiB,推理峰值约 93GB
  • 生成速度(768×448, 24fps, 15秒):150-160秒
  • 冷启动加载:约9分钟

双机并行加速

两台 DGX Spark 通过 RoCEv2 直连 + Ray 分布式:

  • 基础并行:65-69秒(提速2.3x)
  • cuDNN区域编译:46.6秒
  • Cache-DiT缓存优化:30.6秒

注意事项

  • MiniMax 社区许可证排除美/欧盟/英/韩
  • 运行时占满128GB,不可同时开其他大模型
  • ComfyUI 量化版(42.5GB)可共存但不能同时运行,适合日常创作