Escha-W2:2-bit 量化 Qwen3.6-35B,單張 4090 跑 225 tok/s
- URL: https://www.threads.com/share/BBP7mno6Lj/
- Date Saved: 2026-07-31
- Source: Threads (@tsoim722)
- Tags: local-llm
- Repo: https://huggingface.co/EschaLabs/Qwen3.6-35B-A3B-Escha-W2
Summary
Escha Labs 開源 Escha-W2,將 Qwen3.6-35B-A3B(MoE)壓縮到 2-bit,僅 12.3 GB。Apache 2.0 授權。
性能(幾乎無損,平均達 FP8 的 100%):
- MMLU-Pro:80.9
- MATH-500:93.8
- GPQA-Diamond:77.8
- LiveCodeBench:62.6(從 67 掉到 62.6,唯一明顯下降)
速度:
- 單張 RTX 4090 跑 225 tokens/s
- 對比:fp16 的 35B MoE 通常 50-80 tok/s
技術:
- 不是傳統量化,而是「模型感知壓縮」系統
- 結合低-bit 量化 + 微調 + 恢復流程
- 特別保護數學推理和代碼能力
注意事項:
- 不支援 vLLM
- 需要用他們自建的 SGLang/ZRM Runtime:https://huggingface.co/EschaLabs/escha-runtime-qwen3moe