GitHub Copilot 大規模使用 Claude 的工程心法: 快取、多模型調度與評測
- URL: https://blog.aihao.tw/2026/06/01/github-claude-caching-harnesses-advisors/
- Date Saved: 2025-05-31 5|- Source: 愛好 AI 工程 Blog (blog.aihao.tw), author: ihower
- Tags: ai-engineering, dev-tools
Summary
GitHub 產品長 Mario Rodriguez 與 Anthropic 的 Brad Adams 在「Code with Claude」演講,分享 Copilot 在每天數十億次推論規模下的工程實踐。
Key Takeaways
Prompt 快取
- 1% 效率提升 = 好幾百萬美金差別(高頻交易思維)
- 健康命中率:94-96%+,掉到 70% 代表有 bug
- 命中 vs 未命中是 10 倍成本差距(命中只算 10% 費用)
- 前綴要靜如止水:system prompt 別塞動態值(UUID 崩盤教訓)
- 工具只在必要時才動,要有回歸測試護體
- 多模型 harness 下的 cache affinity 是真正工程難題
- 長上下文不等於更貴:壓縮才是成本殺手(每次壓縮吐 ~4000 輸出 token)
Advisor 策略
- Haiku 當執行者 + 工具呼叫 Opus:大部分 Haiku 自己處理,卡關才問 Opus
- 接近 Opus 智慧但成本低很多
- 作者持保留態度:本質是跨模型 multi-agent,代價易被低估
Rubber Duck (Critic 模式)
- 在「會複利的時間點」插入批評者
- 三個核心插入位置:計畫擬好後、複雜實作後、寫完測試但還沒跑之前
- 計畫階段槓桿最高
- 已是 Copilot CLI 實驗功能
新模型上線方法論
- 接進 Cappy API → 調 harness/prompt/工具 → 微調 agent 迴圈
- 雙軌:離線基準測試 + 內部 dogfooding
- 離線只是基準線,真功夫在線上 A/B 測試(常要幾天到幾週)
鐵律
- 量「結果」不量「活動」
- 程式碼「存活率」> 「採用率」(接受後又刪掉 = 沒達成目的)
- 訊號要三角驗證:公開基準 + 內部基準 + 試用 + A/B + 線上遙測