為下一個模型而寫,別為上一個:Anthropic 三場演講的開發心法
- URL: https://blog.aihao.tw/2026/06/01/build-for-the-next-model/
- Date Saved: 2025-05-31 5|- Source: 愛好 AI 工程 Blog (blog.aihao.tw), author: ihower
- Tags: ai-engineering
Summary
整合 Anthropic「Code with Claude」大會三場演講的核心心法。主講者分別是 Alex Albert (The Capability Curve)、Matt (The Thinking Lever)、Lucas (The Expanding Toolkit)。統一主題:Build for the next model, not the last one.
Key Takeaways
1. 模型一年內進步多少
- SWE-bench: Sonnet 3.7 得 62 分,Opus 4.7 得 87 分(25 分跳升)
- 進步三方面:規劃能力、錯誤復原(不再 doom loop)、長距離注意力
2. 從 Evals 開始
- 能被量化的才能被改善
- Evals 要對齊真實產品任務分佈
- 不要飽和——有時最好的優化就是換最新模型
3. 做減法
- 新模型可能不需要舊的 scaffolding
- 「往往是移除東西而非新增東西來提升表現」
4. 給模型空間發揮
- 讓 Claude 自己決定何時思考(adaptive thinking + effort parameter)
- 給 agent 更多工具權限
- 讓 Claude 自行驗證輸出
5. 推理時算力 (Test-time Compute)
- 同模型花更多時間 = 更好結果
- effort 等級選擇:max(最難任務)→ extra high(Opus 4.7 預設)→ high → medium → low
- 大模型+低 effort:「需要智慧但要快」;小模型:「不需太多智慧,要便宜」
- 「要快的第一個 token?用小模型。要快的最後一個 token?用大模型開低 effort。」
6. 別把 thinking 開關當 effort 用
- 開關 thinking 是切換核心能力,不是調整努力程度
- 用 effort parameter 才能同時調整 thinking + tools + output
7. 去年的 scaffolding 今年內建了
- 以前手寫:router、retry、output validator、loop
- 現在:一個 client.messages.create() + tools=ALL_TOOLS
8. 四個被模型吸收的能力
- Tool use(不需手動 router)
- Context management(1M token + compaction)
- Code execution(內建 sandbox)
- Computer use(原生解析度截圖+像素座標)
9. 判斷程式碼價值的鐵則
- 補償模型不可靠性的程式碼 → 半衰期幾個月(交給 Anthropic)
- 連接你世界的程式碼(tools, context, auth, data)→ 價值複利累積
10. 三場整合
- Capability Curve:進步會複利,所以用 evals 重測、做減法
- Thinking Lever:用 effort/budgets 不是 toggles
- Expanding Toolkit:別自己讓模型可靠,投資連接你的獨特世界
- 貫穿三場的常數:evals