Anthropic 如何玩转 Data Agent:95%場景95%準確率
- URL: https://mp.weixin.qq.com/s/p3kLlWXX5v3Zo-7xsnnGuw
- Date Saved: 2026-06-06
- Source: WeChat 公众号(作者:关山)
- Tags: ai-engineering, security-privacy
Summary
深度解讀 Anthropic 內部如何用 Claude 做 self-service data analytics 的文章。核心觀點:數據分析 Agent 的難點不是生成 SQL,而是把模糊業務問題穩定路由到被治理、可驗證、不過期的正確答案。
關鍵洞察
-
Data ≠ Software — 不能照搬 Coding Agent 的樂觀。SQL 跑出來不代表答案對,一個保留兩位小數的錯答案比「我不知道」更危險。
-
三大錯誤來源:
- 概念歧義(「活躍用戶」到底是什麼定義?)
- 數據/口徑過期(表會改、指標定義會改)
- 正確答案存在但 Agent 找不到(直接給大量歷史 SQL,準確率提升不到1個點)
-
Agentic Analytics Stack 三層:
- Data foundations:canonical datasets、CI 校驗、freshness 檢查
- Sources of truth:semantic layer、lineage、信任層級
- Skills:資深分析師的工作流程寫成可維護操作規程
-
Skills 的本質不是 Prompt 模板,而是組織知識的接口:
- 沒有 Skills:Claude 準確率不超過 21%
- 加上 Skills:穩定 95%+,部分接近 99%
- 90% 的數據模型 PR 會同時包含 Skill 變更(工程治理)
-
驗證體系:離線 eval 接近 100%、ablation 實驗比拍腦袋有用、線上答案帶 provenance、沉默錯誤最難搞
對企業 AI 的判斷
- 自然語言問數 ≠ NL2SQL,真正能力在指標治理、上下文路由、驗證審計
- 數據團隊不會被替代,但從「數據開發」轉向「維護機器查數的可信基礎設施」
- 企業買單點:少返工、少誤報、少背鍋
- Data Agent 最終回到組織流程,沒有治理的數據讓模型也很冤
結論:AI 自助分析的正確方式不是把數倉暴露給聰明模型,而是把組織的數據知識、治理流程和驗證機制壓縮成 Agent 可穩定執行的系統。真正值錢的是:讓正確答案變少、變近、變新、變可驗證。