Threads (@0xsojalsec)
local-llm
Original source

Qwen3.8-27B 跑在 8GB RAM:Unsloth Dynamic v3.0 GGUF

Summary

Unsloth 發布 Qwen3.8-27B 的 1-3bit Dynamic v3.0 GGUF 量化版本,可在 8GB VRAM 運行。

宣稱特點

  • 同大小下比其他量化方案高 10% 準確率
  • Real 1-bit 仍保留 77% quality
  • 可塞進 8GB VRAM

回覆中的實測反饋(較負面)

  • Mac Studio 64GB 用戶:跟 Qwen 3.6 35B 比,3.8 版很慢且經常困惑
  • 3070 Ti Mobile 用戶:最小版本 500t/s prefill 但只有 10t/s generation,工具調用都做不好
  • 建議替代方案:
    • Qwen3.6 35B Q6(131K context,26-32t/s)
    • Jackrong Qwopus Q4 + MTP(35-50t/s)
    • Qwen3-Coder-Next 80B UD-IQ3-XS(20t/s gen, 700t/s prefill)
  • 有人指出 8GB 實際要扣 OS 和 KV cache,裝不下
  • 結論:Dense 模型在 8GB VRAM 上幾乎無用(除了 Qwen3.5 9B Q4-Q5)

觀察

標題吸引人但實測評價普遍負面。極低 bit 量化在理論上能裝但實用性成疑。