Heretic — 永久移除 AI 道德安全審查的開源專案
- URL: https://www.threads.com/@ray.realms/post/DZkWgzXgQZQ
- Date Saved: 2025-06-15
- Source: Threads (@ray.realms)
- Tags: security-privacy, ai-tools
Summary
ray.realms 分享了一個開源專案「Heretic」(github.com/p-e-w/heretic),可以永久移除 LLM 的道德與安全審查機制。
核心原理:
- 分析 LLM 在處理有害與無害訊息時的內部狀態差異
- 定位「拒絕」這個概念在模型內部對應的向量
- 直接從 LLM 的計算中消除該向量
類比: 不是越獄(jailbreak)、不是說服(persuasion),而是直接對 AI 做「前額葉手術」— 精確移除拒絕的概念本身。
注意事項: 僅適用於開源 AI 模型,作者聲明僅用於學術研究(如 AI 可解釋性研究)。
GitHub: https://github.com/p-e-w/heretic