Threads (@ray.realms)
security-privacyai-tools
Original source

Heretic — 永久移除 AI 道德安全審查的開源專案

Summary

ray.realms 分享了一個開源專案「Heretic」(github.com/p-e-w/heretic),可以永久移除 LLM 的道德與安全審查機制。

核心原理:

  • 分析 LLM 在處理有害與無害訊息時的內部狀態差異
  • 定位「拒絕」這個概念在模型內部對應的向量
  • 直接從 LLM 的計算中消除該向量

類比: 不是越獄(jailbreak)、不是說服(persuasion),而是直接對 AI 做「前額葉手術」— 精確移除拒絕的概念本身。

注意事項: 僅適用於開源 AI 模型,作者聲明僅用於學術研究(如 AI 可解釋性研究)。

GitHub: https://github.com/p-e-w/heretic