Threads (@daidouofficial)
ai-engineeringsecurity-privacy
Original source

Agent 對話紀錄中加密推理區塊洩漏敏感資訊

Summary

  • arXiv 論文(8月10日)揭露:公開的 agent 對話紀錄中的加密推理區塊(reasoning blocks)可被同廠牌其他模型解密
  • 研究者從 GitHub 和 HuggingFace 收集 6,708 份公開 agent 對話紀錄,其中仍留有加密推理區塊
  • 方法:將一個模型的加密區塊餵給同廠牌防護較鬆的另一個模型,即可解密(同廠牌跨 session / 跨用戶 / 跨模型通用)
  • 論文推論:各家可能共用同一把金鑰
  • 解出 315,320 段推理內容
  • 328/6,708 份紀錄洩漏真實敏感資訊(約每 20 份就有 1 份)
  • 真人 session 中撈到:62 條 API key、33 組密碼、24 個 access token、7 把私鑰
  • 704 項中有 64 項在可見對話文字中完全找不到(只存在於加密推理區塊內)— 即使清理可見部分也無法消除
  • Anthropic、OpenAI、Google 三家都受影響
  • 建議:貼 log 前先把 reasoning 區塊整段刪掉