Qwen3.8-27B 開源三天出現五個無護欄版本 — 開源模型的安全悖論
- URL: https://www.facebook.com/share/14kJjQub5y7/?mibextid=wwXIfr
- Date Saved: 2026-08-22
- Source: Facebook (Wisely Chen)
- Tags: ai-engineering, security-privacy
- Blog: https://ai-coding.wiselychen.com/qwen38-27b-abliteration-three-days-safety-paradox/
Summary
Qwen3.8-27B 開源三天,社群已造出五個完全無護欄(abliterated)版本。842 道有害 prompt,0% 拒答,全部可跑在消費級 GPU 筆電上。這是第一次被拆護欄的模型在 agentic 任務上贏過 Opus 4.6。
時間線
- 8/14 Qwen3.8-27B 權重上線 (Apache 2.0)
- 8/15 OrcaRouter 發布 FP8 abliterated build
- 8/16 huihui-ai 發布 abliterated 版本
- 8/17 OrcaRouter MLX 版上線(385萬人看過)
- 8/20 OBLITERATUS 做出 cyber 專用版,0% 拒答
從開源到無護欄:3天。從無護欄到資安攻擊優化:6天。
Abliteration 原理
- 用線性代數把模型的「拒答方向」正交化掉
- 有害/無害 prompt 分別跑過模型,算啟動值平均差異 = 拒答方向
- 從權重矩陣歸零該方向分量
- NousResearch 已打包成開源工具,一張消費級 GPU 幾小時即可完成
攻擊力框架
網路攻擊力 = 能力 × 可及性 × 沒有護欄
Qwen3.8 abliterated vs Grok 4.5:
- 能力:SWE-bench Pro 61.7,贏 Opus 4.6 Max
- 可及性:免費、不需 API key、不需帳號、不需網路
- 護欄:0%(Grok 是弱但可加強,開源是直接歸零)
- 額外維度——離線:不留 log、不經第三方
開源的結構性悖論
- 安全好處和安全風險是同一枚硬幣兩面
- 防禦方同樣需要無護欄模型:紅隊測試、訓練 SOC 辨識 AI 釣魚信
- Hugging Face 事件教訓:閉源模型誤判你在攻擊就停服,防禦工具鏈不能完全依賴閉源
- 比喻:就像槍在美國 — 攻擊者都有了,防禦方也被迫儲備
作者實測
用 5090 + Qwen 3.8 27B,30秒打破自己 vibe coding 出來的 todo app(Opus Level),而 Codex 直接罷工拒絕。