ai-engineering
Original source

為下一個模型而寫,別為上一個:Anthropic 三場演講的開發心法

Summary

整合 Anthropic「Code with Claude」大會三場演講的核心心法。主講者分別是 Alex Albert (The Capability Curve)、Matt (The Thinking Lever)、Lucas (The Expanding Toolkit)。統一主題:Build for the next model, not the last one.

Key Takeaways

1. 模型一年內進步多少

  • SWE-bench: Sonnet 3.7 得 62 分,Opus 4.7 得 87 分(25 分跳升)
  • 進步三方面:規劃能力、錯誤復原(不再 doom loop)、長距離注意力

2. 從 Evals 開始

  • 能被量化的才能被改善
  • Evals 要對齊真實產品任務分佈
  • 不要飽和——有時最好的優化就是換最新模型

3. 做減法

  • 新模型可能不需要舊的 scaffolding
  • 「往往是移除東西而非新增東西來提升表現」

4. 給模型空間發揮

  • 讓 Claude 自己決定何時思考(adaptive thinking + effort parameter)
  • 給 agent 更多工具權限
  • 讓 Claude 自行驗證輸出

5. 推理時算力 (Test-time Compute)

  • 同模型花更多時間 = 更好結果
  • effort 等級選擇:max(最難任務)→ extra high(Opus 4.7 預設)→ high → medium → low
  • 大模型+低 effort:「需要智慧但要快」;小模型:「不需太多智慧,要便宜」
  • 「要快的第一個 token?用小模型。要快的最後一個 token?用大模型開低 effort。」

6. 別把 thinking 開關當 effort 用

  • 開關 thinking 是切換核心能力,不是調整努力程度
  • 用 effort parameter 才能同時調整 thinking + tools + output

7. 去年的 scaffolding 今年內建了

  • 以前手寫:router、retry、output validator、loop
  • 現在:一個 client.messages.create() + tools=ALL_TOOLS

8. 四個被模型吸收的能力

  • Tool use(不需手動 router)
  • Context management(1M token + compaction)
  • Code execution(內建 sandbox)
  • Computer use(原生解析度截圖+像素座標)

9. 判斷程式碼價值的鐵則

  • 補償模型不可靠性的程式碼 → 半衰期幾個月(交給 Anthropic)
  • 連接你世界的程式碼(tools, context, auth, data)→ 價值複利累積

10. 三場整合

  • Capability Curve:進步會複利,所以用 evals 重測、做減法
  • Thinking Lever:用 effort/budgets 不是 toggles
  • Expanding Toolkit:別自己讓模型可靠,投資連接你的獨特世界
  • 貫穿三場的常數:evals