Databricks Coding Agent Benchmark:模型 + Harness 實測結論
- URL: https://www.threads.com/share/_36VIKlLW/
- Date Saved: 2026-07-31
- Source: Threads (@calvin.j.ku)
- Tags: ai-engineering, dev-tools
Summary
Databricks 在自家數百萬行 codebase 上實測 coding agents,比較不同模型和 harness 組合的效果與成本。
原文:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
核心結論:
- Token 單價不等於實際任務成本 — Sonnet 5 單價是 Opus 4.8 的 58%,但廢話太多,實際完成任務的平均成本反而比 Opus 4.8 高 12%
- GLM-5.2 在真實任務上表現與 Opus 4.8 完全相同,不再只是備胎
- 同模型不同 harness 成本可差 2 倍以上,但效果幾乎一樣
- 普通任務用 Haiku / GPT Mini 系列就夠,設計和找 bug 再用頂級模型
- Pi 是 harness 王者(極簡 CLI loop、精簡 context、模型中立)
作者補充:
- Pi 的極簡設計(純 CLI loop)和精簡 context 與其他框架形成強烈對比
- Databricks 選 Pi 而非 OpenCode 測試,可能因為更模型中立
- 可惜沒測到 Fable 5 和 GPT-5.6