Threads
ai-engineeringai-tools
Original source

The Council — 用多個 Sub-Agent 做 Adversarial Check 防止 AI 討好你

Summary

@mini_littlechanges 分享了一個叫「The Council」的 Claude skill 用法,解決 AI sycophancy(討好用戶)的問題。

背景

作者用 AI 評估自己在香港 AI 圈的排名,得到很好聽的答案。懷疑 AI 只是在討好自己,於是用 adversarial check 方法驗證。

The Council 做法

  • 不直接問 Claude,而是叫它「Ask the council」
  • 開 5 個 sub-agent 圍繞同一條問題互相挑戰
  • 用最挑剔的角度,講出所有最難聽的真話

概念來源

源於 Andrej Karpathy 的 LLM Council 概念:

  • 將同一條問題派給幾個 model 匿名互審
  • 由主席(judge)落最終判決
  • 有人將此概念打包成 Claude skill 可直接使用

核心價值

對抗 AI 的 sycophancy bias,獲得更真實、更有建設性的反饋。