WeChat 公众号(作者:关山)
ai-engineeringsecurity-privacy
Original source

Anthropic 如何玩转 Data Agent:95%場景95%準確率

Summary

深度解讀 Anthropic 內部如何用 Claude 做 self-service data analytics 的文章。核心觀點:數據分析 Agent 的難點不是生成 SQL,而是把模糊業務問題穩定路由到被治理、可驗證、不過期的正確答案。

關鍵洞察

  1. Data ≠ Software — 不能照搬 Coding Agent 的樂觀。SQL 跑出來不代表答案對,一個保留兩位小數的錯答案比「我不知道」更危險。

  2. 三大錯誤來源:

    • 概念歧義(「活躍用戶」到底是什麼定義?)
    • 數據/口徑過期(表會改、指標定義會改)
    • 正確答案存在但 Agent 找不到(直接給大量歷史 SQL,準確率提升不到1個點)
  3. Agentic Analytics Stack 三層:

    • Data foundations:canonical datasets、CI 校驗、freshness 檢查
    • Sources of truth:semantic layer、lineage、信任層級
    • Skills:資深分析師的工作流程寫成可維護操作規程
  4. Skills 的本質不是 Prompt 模板,而是組織知識的接口:

    • 沒有 Skills:Claude 準確率不超過 21%
    • 加上 Skills:穩定 95%+,部分接近 99%
    • 90% 的數據模型 PR 會同時包含 Skill 變更(工程治理)
  5. 驗證體系:離線 eval 接近 100%、ablation 實驗比拍腦袋有用、線上答案帶 provenance、沉默錯誤最難搞

對企業 AI 的判斷

  • 自然語言問數 ≠ NL2SQL,真正能力在指標治理、上下文路由、驗證審計
  • 數據團隊不會被替代,但從「數據開發」轉向「維護機器查數的可信基礎設施」
  • 企業買單點:少返工、少誤報、少背鍋
  • Data Agent 最終回到組織流程,沒有治理的數據讓模型也很冤

結論:AI 自助分析的正確方式不是把數倉暴露給聰明模型,而是把組織的數據知識、治理流程和驗證機制壓縮成 Agent 可穩定執行的系統。真正值錢的是:讓正確答案變少、變近、變新、變可驗證。