用普通顯卡跑 MiniMax-H3:Qwen3-VL-32B Heretic NVFP4 教學
- URL: https://www.facebook.com/share/p/14kANL9gxUt/
- Date Saved: 2026-08-30
- Source: Facebook (Tonyaigirls)
- Tags: creative-ai, local-llm
- Repo: https://huggingface.co/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
Summary
Tonyaigirls 詳細解說如何用消費級顯卡(16-24GB VRAM)跑 MiniMax-H3 影片生成,推薦模型:Qwen3-VL-32B Heretic (MiniMax-H3 text encoder) NVFP4。
模型名稱拆解
- Qwen3-VL-32B — 阿里巴巴 Qwen 系列,Vision-Language,320億參數
- Heretic — 移除安全拒答/alignment 的衍生版(abliteration),讓 text encoder 不會「偷偷不合作」
- MiniMax-H3 text encoder — 作為 MiniMax-H3 的文字/視覺條件編碼器
- NVFP4 — NVIDIA 4-bit 浮點量化,大幅降低 VRAM 需求
為什麼選 Heretic?
- H3 的 DiT(影片生成主體)本身沒有審查機制
- 但官方搭配的 Qwen3-VL-32B-Instruct 有安全對齊
- 遇到敏感 prompt 時,hidden state 被「拒絕方向」污染,導致 conditioning 變弱、畫面偏掉
- Heretic 切除拒絕方向(abliteration),讓編碼器對任何 prompt 都老實編碼
NVFP4 量化
- 原始 BF16:48-65GB(家用顯卡跑不起來)
- 量化路線:BF16 → INT8 → NVFP4
- NVFP4 讓 16-24GB VRAM 可以跑,最低配置 3060 12G
MiniMax-H3 模型種類
- FL2VA — First/Last Frame → Video + Audio
- Ref2VA — Reference → Video + Audio(圖/影/音參考)
- Hybrid/A2A — Anything to Anything
加速 LoRA
- 官方 8-Step Acc LoRA(PDD 蒸餾),有 FL2VA 和 Ref2VA 兩套
- 不是傳統 Turbo LoRA,品質相對容易維持
HuggingFace 模型
- Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4(多個上傳者)
- Minimax-H3-nvfp4-INT4-INT8-Convrot(791K downloads, 215 likes)