WeChat
ai-engineeringlocal-llm
Original source

Qwopus3.6-27B — 一個人把 Opus「逆向」進了 27B

Summary

個人開發者 Jackrong 發布 Qwopus3.6-27B-Coder-Compat:Qwen 底座 + Claude Opus 的推理方式蒸餾,27B 稠密模型,單卡可跑。

核心方法:Trace Inversion(軌跡逆向)

傳統蒸餾只學最終答案,中間推理鏈被壓縮掉。作者稱此為「信息熵陷阱」。

解法:訓練一個 4B 小模型 Trace-Inverter-4B,專門把 Claude 壓縮過的輸出逆向重建為完整推理鏈,再讓 Qwopus 學這份「解題草稿」。

訓練數據

  • Claude-opus-4.6-TraceInversion:9,000 條重建推理軌跡
  • Claude-opus-4.7-TraceInversion:5,000 條複雜多輪樣本
  • lambda/hermes-agent-reasoning-traces:~10,000 條工具調用軌跡

三階段課程

  1. 格式奠基(≤4K token)— 建立推理模板
  2. 複雜度擴展(4-8K)— 工具軌跡和調試任務
  3. 長上下文 SFT(最高 32K)— 長程推理

成績(自報,未經第三方驗證)

  • SWE-bench Verified:67.0%(335/500)— no-thinking 模式 + Q5_K_M 量化
  • 強項:scikit-learn 84%、xarray 82%、requests 75%、Django 72%
  • MTP 版本 ~1.66x 加速,RTX 5090 上約 100 token/s

部署

  • GGUF 全量化打包(Q2_K ~ BF16,10.9GB ~ 54.7GB)
  • 兼容 llama.cpp、vLLM、SGLang、Unsloth、Docker Model Runner
  • Apache 2.0 授權

注意事項

  • 所有數字為作者自報,無第三方獨立複現
  • 蒸餾閉源模型輸出的合規邊界存在爭議
  • 67% 是特定組合(no-thinking + Q5_K_M)下的結果

HuggingFace

https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF