Qwopus3.6-27B — 一個人把 Opus「逆向」進了 27B
- URL: https://mp.weixin.qq.com/s/T8kkVTV-svrc1cIzbyAGkg
- Date Saved: 2026-07-02
- Source: WeChat
- Tags: ai-engineering, local-llm
Summary
個人開發者 Jackrong 發布 Qwopus3.6-27B-Coder-Compat:Qwen 底座 + Claude Opus 的推理方式蒸餾,27B 稠密模型,單卡可跑。
核心方法:Trace Inversion(軌跡逆向)
傳統蒸餾只學最終答案,中間推理鏈被壓縮掉。作者稱此為「信息熵陷阱」。
解法:訓練一個 4B 小模型 Trace-Inverter-4B,專門把 Claude 壓縮過的輸出逆向重建為完整推理鏈,再讓 Qwopus 學這份「解題草稿」。
訓練數據
- Claude-opus-4.6-TraceInversion:9,000 條重建推理軌跡
- Claude-opus-4.7-TraceInversion:5,000 條複雜多輪樣本
- lambda/hermes-agent-reasoning-traces:~10,000 條工具調用軌跡
三階段課程
- 格式奠基(≤4K token)— 建立推理模板
- 複雜度擴展(4-8K)— 工具軌跡和調試任務
- 長上下文 SFT(最高 32K)— 長程推理
成績(自報,未經第三方驗證)
- SWE-bench Verified:67.0%(335/500)— no-thinking 模式 + Q5_K_M 量化
- 強項:scikit-learn 84%、xarray 82%、requests 75%、Django 72%
- MTP 版本 ~1.66x 加速,RTX 5090 上約 100 token/s
部署
- GGUF 全量化打包(Q2_K ~ BF16,10.9GB ~ 54.7GB)
- 兼容 llama.cpp、vLLM、SGLang、Unsloth、Docker Model Runner
- Apache 2.0 授權
注意事項
- 所有數字為作者自報,無第三方獨立複現
- 蒸餾閉源模型輸出的合規邊界存在爭議
- 67% 是特定組合(no-thinking + Q5_K_M)下的結果
HuggingFace
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF