Facebook (Tonyaigirls)
creative-ailocal-llm
Original source

用普通顯卡跑 MiniMax-H3:Qwen3-VL-32B Heretic NVFP4 教學

Summary

Tonyaigirls 詳細解說如何用消費級顯卡(16-24GB VRAM)跑 MiniMax-H3 影片生成,推薦模型:Qwen3-VL-32B Heretic (MiniMax-H3 text encoder) NVFP4。

模型名稱拆解

  • Qwen3-VL-32B — 阿里巴巴 Qwen 系列,Vision-Language,320億參數
  • Heretic — 移除安全拒答/alignment 的衍生版(abliteration),讓 text encoder 不會「偷偷不合作」
  • MiniMax-H3 text encoder — 作為 MiniMax-H3 的文字/視覺條件編碼器
  • NVFP4 — NVIDIA 4-bit 浮點量化,大幅降低 VRAM 需求

為什麼選 Heretic?

  • H3 的 DiT(影片生成主體)本身沒有審查機制
  • 但官方搭配的 Qwen3-VL-32B-Instruct 有安全對齊
  • 遇到敏感 prompt 時,hidden state 被「拒絕方向」污染,導致 conditioning 變弱、畫面偏掉
  • Heretic 切除拒絕方向(abliteration),讓編碼器對任何 prompt 都老實編碼

NVFP4 量化

  • 原始 BF16:48-65GB(家用顯卡跑不起來)
  • 量化路線:BF16 → INT8 → NVFP4
  • NVFP4 讓 16-24GB VRAM 可以跑,最低配置 3060 12G

MiniMax-H3 模型種類

  • FL2VA — First/Last Frame → Video + Audio
  • Ref2VA — Reference → Video + Audio(圖/影/音參考)
  • Hybrid/A2A — Anything to Anything

加速 LoRA

  • 官方 8-Step Acc LoRA(PDD 蒸餾),有 FL2VA 和 Ref2VA 兩套
  • 不是傳統 Turbo LoRA,品質相對容易維持

HuggingFace 模型

  • Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4(多個上傳者)
  • Minimax-H3-nvfp4-INT4-INT8-Convrot(791K downloads, 215 likes)