ai-engineeringdev-tools
Original source

GitHub Copilot 大規模使用 Claude 的工程心法: 快取、多模型調度與評測

Summary

GitHub 產品長 Mario Rodriguez 與 Anthropic 的 Brad Adams 在「Code with Claude」演講,分享 Copilot 在每天數十億次推論規模下的工程實踐。

Key Takeaways

Prompt 快取

  • 1% 效率提升 = 好幾百萬美金差別(高頻交易思維)
  • 健康命中率:94-96%+,掉到 70% 代表有 bug
  • 命中 vs 未命中是 10 倍成本差距(命中只算 10% 費用)
  • 前綴要靜如止水:system prompt 別塞動態值(UUID 崩盤教訓)
  • 工具只在必要時才動,要有回歸測試護體
  • 多模型 harness 下的 cache affinity 是真正工程難題
  • 長上下文不等於更貴:壓縮才是成本殺手(每次壓縮吐 ~4000 輸出 token)

Advisor 策略

  • Haiku 當執行者 + 工具呼叫 Opus:大部分 Haiku 自己處理,卡關才問 Opus
  • 接近 Opus 智慧但成本低很多
  • 作者持保留態度:本質是跨模型 multi-agent,代價易被低估

Rubber Duck (Critic 模式)

  • 在「會複利的時間點」插入批評者
  • 三個核心插入位置:計畫擬好後、複雜實作後、寫完測試但還沒跑之前
  • 計畫階段槓桿最高
  • 已是 Copilot CLI 實驗功能

新模型上線方法論

  • 接進 Cappy API → 調 harness/prompt/工具 → 微調 agent 迴圈
  • 雙軌:離線基準測試 + 內部 dogfooding
  • 離線只是基準線,真功夫在線上 A/B 測試(常要幾天到幾週)

鐵律

  • 量「結果」不量「活動」
  • 程式碼「存活率」> 「採用率」(接受後又刪掉 = 沒達成目的)
  • 訊號要三角驗證:公開基準 + 內部基準 + 試用 + A/B + 線上遙測