Threads (@tsoim722)
local-llm
Original source

Escha-W2:2-bit 量化 Qwen3.6-35B,單張 4090 跑 225 tok/s

Summary

Escha Labs 開源 Escha-W2,將 Qwen3.6-35B-A3B(MoE)壓縮到 2-bit,僅 12.3 GB。Apache 2.0 授權。

性能(幾乎無損,平均達 FP8 的 100%):

  • MMLU-Pro:80.9
  • MATH-500:93.8
  • GPQA-Diamond:77.8
  • LiveCodeBench:62.6(從 67 掉到 62.6,唯一明顯下降)

速度:

  • 單張 RTX 4090 跑 225 tokens/s
  • 對比:fp16 的 35B MoE 通常 50-80 tok/s

技術:

  • 不是傳統量化,而是「模型感知壓縮」系統
  • 結合低-bit 量化 + 微調 + 恢復流程
  • 特別保護數學推理和代碼能力

注意事項: