Threads (@dustin_gmat)
security-privacyai-engineering
Original source

PII Guard — 台灣在地化去識別化工具 + Source Code 脫敏概念

Summary

PII Guard:繁體中文台灣在地化的個人資料去識別化工具(開源 Python)

核心流程

  1. 本地工具遮蔽敏感資訊(身分證/統編 Regex + CKIP 中文 NER)
  2. 產出:脫敏文件 + 代號還原對照表
  3. 脫敏文件送商用 AI 處理
  4. 本地用對照表還原結果
  5. 全程商用 AI 不接觸原始文件和對照表

特點

  • 純 Python 秒級處理(不需 Ollama 也能跑)
  • 台灣特化:抓身分證字號、統一編號等
  • 可搭配本地 LLM 做更智能的 NER

Source Code 脫敏延伸思考

同概念可套用到 source code,讓企業安全送內部代碼給 AI review/refactor:

要遮蔽: 內部域名/IP、API keys、內部服務/微服務命名、DB schema、package 名、註解中人名/ticket

優勢(比 PII 更結構化):

  • Code 有 AST → 精準只改 identifiers/strings/comments
  • Variable/function/class 可 consistent rename 保持邏輯可讀
  • Import paths 可 regex 批量替換

難點:

  • 要保持代碼可編譯/邏輯完整
  • 業務邏輯本身可能是商業秘密
  • 需區分公共 library vs 內部命名

實作思路:

  • Parse AST → 提取 identifiers/strings/comments
  • Mapping table 做 consistent rename(所有引用同步改)
  • 保留語言 keywords 和公共 library 不動
  • 輸出:脫敏 code + 還原 mapping
  • AI 處理完 → mapping 還原

市場機會:企業把內部 codebase 送 AI 做 code review/refactoring 的需求大,但目前沒有好的開源 source code 脫敏方案。