Facebook (Wisely Chen)
ai-engineeringsecurity-privacy
Original source

Qwen3.8-27B 開源三天出現五個無護欄版本 — 開源模型的安全悖論

Summary

Qwen3.8-27B 開源三天,社群已造出五個完全無護欄(abliterated)版本。842 道有害 prompt,0% 拒答,全部可跑在消費級 GPU 筆電上。這是第一次被拆護欄的模型在 agentic 任務上贏過 Opus 4.6。

時間線

  • 8/14 Qwen3.8-27B 權重上線 (Apache 2.0)
  • 8/15 OrcaRouter 發布 FP8 abliterated build
  • 8/16 huihui-ai 發布 abliterated 版本
  • 8/17 OrcaRouter MLX 版上線(385萬人看過)
  • 8/20 OBLITERATUS 做出 cyber 專用版,0% 拒答

從開源到無護欄:3天。從無護欄到資安攻擊優化:6天。

Abliteration 原理

  • 用線性代數把模型的「拒答方向」正交化掉
  • 有害/無害 prompt 分別跑過模型,算啟動值平均差異 = 拒答方向
  • 從權重矩陣歸零該方向分量
  • NousResearch 已打包成開源工具,一張消費級 GPU 幾小時即可完成

攻擊力框架

網路攻擊力 = 能力 × 可及性 × 沒有護欄

Qwen3.8 abliterated vs Grok 4.5:

  • 能力:SWE-bench Pro 61.7,贏 Opus 4.6 Max
  • 可及性:免費、不需 API key、不需帳號、不需網路
  • 護欄:0%(Grok 是弱但可加強,開源是直接歸零)
  • 額外維度——離線:不留 log、不經第三方

開源的結構性悖論

  • 安全好處和安全風險是同一枚硬幣兩面
  • 防禦方同樣需要無護欄模型:紅隊測試、訓練 SOC 辨識 AI 釣魚信
  • Hugging Face 事件教訓:閉源模型誤判你在攻擊就停服,防禦工具鏈不能完全依賴閉源
  • 比喻:就像槍在美國 — 攻擊者都有了,防禦方也被迫儲備

作者實測

用 5090 + Qwen 3.8 27B,30秒打破自己 vibe coding 出來的 todo app(Opus Level),而 Codex 直接罷工拒絕。